Skip to content
🔗 分享本题
查看我的学习进度 →

RAG 检索指标、生成指标与端到端业务指标分层评估图

🧠 记忆锚点:先拆开评检索与生成,再看端到端任务成功;低分必须回到失败切片定位根因,不能只盯总分。

💡 答案要点

RAGAS 四个核心指标:

指标说明计算方式合格线
Faithfulness(忠实度)答案是否基于检索内容答案中的陈述能否在上下文中找到依据> 0.7
Answer Relevance(答案相关性)答案是否回答问题答案与问题的语义相似度> 0.8
Context Relevance(上下文相关性)检索内容是否有用检索内容中与问题相关的比例> 0.8
Context Recall(上下文召回率)是否检索到了正确答案标准答案中的信息是否在检索内容中> 0.8

评估流程:

1. 准备测试集(100-500 个问题 + 标准答案)
2. 运行 RAG 系统,生成答案
3. 用 RAGAS 计算四个指标
4. 分析低分案例,优化检索策略
5. 定期回归测试(每周/每月)

面试话术:

"我建立了自动化评估 Pipeline,每次上线前跑一遍测试集。Faithfulness 低于 0.7 会触发告警,说明模型可能在瞎编。同时我加入了人工抽检,随机抽样 5% 的答案人工审核,确保评估指标和真实体验一致。"