
🧠 记忆锚点:先拆开评检索与生成,再看端到端任务成功;低分必须回到失败切片定位根因,不能只盯总分。
💡 答案要点
RAGAS 四个核心指标:
| 指标 | 说明 | 计算方式 | 合格线 |
|---|---|---|---|
| Faithfulness(忠实度) | 答案是否基于检索内容 | 答案中的陈述能否在上下文中找到依据 | > 0.7 |
| Answer Relevance(答案相关性) | 答案是否回答问题 | 答案与问题的语义相似度 | > 0.8 |
| Context Relevance(上下文相关性) | 检索内容是否有用 | 检索内容中与问题相关的比例 | > 0.8 |
| Context Recall(上下文召回率) | 是否检索到了正确答案 | 标准答案中的信息是否在检索内容中 | > 0.8 |
评估流程:
1. 准备测试集(100-500 个问题 + 标准答案)
2. 运行 RAG 系统,生成答案
3. 用 RAGAS 计算四个指标
4. 分析低分案例,优化检索策略
5. 定期回归测试(每周/每月)面试话术:
"我建立了自动化评估 Pipeline,每次上线前跑一遍测试集。Faithfulness 低于 0.7 会触发告警,说明模型可能在瞎编。同时我加入了人工抽检,随机抽样 5% 的答案人工审核,确保评估指标和真实体验一致。"