
🧠 记忆锚点:Precision 看召回结果准不准,Recall 看证据全不全,Faithfulness 看回答是否有据,Relevancy 看是否答题。
💡 答案要点
RAGAS 四个核心指标:
| 指标 | 说明 | 计算方式 | 合格线 |
|---|---|---|---|
| Faithfulness(忠实度) | 答案是否基于检索内容 | 答案中的陈述能否在上下文中找到依据 | > 0.7 |
| Answer Relevance(答案相关性) | 答案是否回答问题 | 答案与问题的语义相似度 | > 0.8 |
| Context Relevance(上下文相关性) | 检索内容是否有用 | 检索内容中与问题相关的比例 | > 0.8 |
| Context Recall(上下文召回率) | 是否检索到了正确答案 | 标准答案中的信息是否在检索内容中 | > 0.8 |
优化策略:
| 指标低 | 可能原因 | 优化方案 |
|---|---|---|
| Faithfulness 低 | 模型瞎编 | 增加检索结果数量、优化 Prompt |
| Answer Relevance 低 | 答非所问 | 优化检索查询、改进 Prompt |
| Context Relevance 低 | 检索内容不相关 | 改进 Embedding、加 Rerank |
| Context Recall 低 | 没检索到正确答案 | 混合检索、扩大检索范围 |
面试话术:
"Faithfulness 低于 0.7 会触发告警,说明模型可能在瞎编。我通过增加检索结果数量和在 Prompt 中强调'只基于检索内容回答',把 Faithfulness 从 0.65 提升到了 0.82。"