🧠 图解记忆: 离线指标守底线,人工评审找原因,线上反馈验证真实价值。
💡 答案要点
评估指标体系:
| 类别 | 指标 | 说明 | 合格线 |
|---|---|---|---|
| 准确性 | Faithfulness | 答案是否基于检索内容 | > 0.7 |
| 准确性 | Answer Relevance | 答案是否回答问题 | > 0.8 |
| 检索质量 | Context Relevance | 检索内容是否有用 | > 0.8 |
| 检索质量 | Context Recall | 是否检索到正确答案 | > 0.8 |
| 用户体验 | 点赞率 | 用户满意的比例 | > 80% |
| 用户体验 | 重新生成率 | 用户重新生成的比例 | < 15% |
测试方法:
| 方法 | 说明 | 优缺点 |
|---|---|---|
| 人工评估 | 人工给答案打分 | 准确,但成本高 |
| 自动评估 | RAGAS、TruLens | 快速,但不够准确 |
| A/B 测试 | 对比不同策略 | 真实,但需要流量 |
| 回归测试 | 固定测试集定期跑 | 防止退化 |
面试话术:
"我建立了三层评估体系:1)自动评估(RAGAS)每次上线前跑;2)人工抽检(每周 5%);3)A/B 测试(新策略灰度发布)。有一次 RAGAS 指标正常,但人工评估发现答案质量下降,原来是检索策略改变了,及时调整了回来。"
