Skip to content
🔗 分享本题
查看我的学习进度 →

AI 应用通过离线指标、人工抽检和线上反馈三层评估并设置回归发布门

🧠 图解记忆: 离线指标守底线,人工评审找原因,线上反馈验证真实价值。

💡 答案要点

评估指标体系:

类别指标说明合格线
准确性Faithfulness答案是否基于检索内容> 0.7
准确性Answer Relevance答案是否回答问题> 0.8
检索质量Context Relevance检索内容是否有用> 0.8
检索质量Context Recall是否检索到正确答案> 0.8
用户体验点赞率用户满意的比例> 80%
用户体验重新生成率用户重新生成的比例< 15%

测试方法:

方法说明优缺点
人工评估人工给答案打分准确,但成本高
自动评估RAGAS、TruLens快速,但不够准确
A/B 测试对比不同策略真实,但需要流量
回归测试固定测试集定期跑防止退化

面试话术:

"我建立了三层评估体系:1)自动评估(RAGAS)每次上线前跑;2)人工抽检(每周 5%);3)A/B 测试(新策略灰度发布)。有一次 RAGAS 指标正常,但人工评估发现答案质量下降,原来是检索策略改变了,及时调整了回来。"

📚 参考:promptfoo(LLM 应用测试与评估)