Skip to content
🔗 分享本题
查看我的学习进度 →
RAG 多目标评测跷跷板图解

🧠 图解记忆: 先看哪些场景切片变好或变坏,再谈总分;关键场景的硬门槛高于平均提升。

跷跷板效应: 换更强的 embedding 模型后,A 类问题变好了,B 类问题反而变差。怎么发现、怎么权衡,是评估题的核心深挖点。

第一步:建评测体系(没有评测就没有发言权)

  • 检索指标:Recall@K(相关文档有没有进前 K)、MRR(第一个相关文档排第几)、NDCG(整体排序质量)——覆盖"有没有 / 排多前 / 整体排序好不好"
  • 生成指标:人工标注「完全正确 / 部分正确 / 错误 / 幻觉」统计准确率;或用 LLM-as-Judge 自动评分(省人力但有偏差风险)
  • 标注集:从真实用户反馈攒 50–100 条代表性问答,标好标准答案和相关文档,作为回归测试集,任何策略变更都要跑一遍

第二步:跷跷板效应的发现与诊断

  • 按问题类型拆分指标:事实型 / 步骤型 / 代码类 / 专有名词类分别算准确率。换 embedding 后「事实型」0.85→0.92 但「专有名词类」0.78→0.65,就是典型跷跷板
  • 按文档来源拆分:不同知识库、不同领域表现可能天差地别
  • 用混淆矩阵看变化:改策略前后哪些 case 变好、哪些变坏、哪些没变,重点分析「变坏 case」的共性

第三步:处理策略

  • 加权取舍:按业务重要性给不同类型问题赋权,核心业务场景指标优先保住
  • 混合方案:A 类问题用 embedding A、B 类问题用 embedding B,路由层按 query 类型分发——比"全局换一个模型"聪明得多
  • 渐进式验证:小流量灰度跑 3–7 天,数据稳定后再决定是否全量切换,别凭单次测试集拍板

表达模板:

示例表达(仅在能用本人经历或可复现实验佐证时使用): “在我们的评测集中,变更后 [问题类型 A] 改善,但 [问题类型 B] 回退。我们检查 bad case 后确认原因是 [原因],通过 [混合检索/路由/数据修复] 处理,并用相同切片重新评估。”请只填入自己的真实结果。

面试话术:

"评估的根基是标注集 + 分层指标,检索看 Recall@K/MRR/NDCG,生成看人工标注或 LLM-as-Judge。跷跷板效应靠'按问题类型拆分指标'暴露——换 embedding 后我会先看各类问题的准确率变化矩阵,找出变坏的 case 共性;处理上优先保核心业务指标,必要时走多 embedding 路由 + BM25 融合,最后用小流量灰度验证再全量。"

📚 参考:RAGAS:评估指标体系(跷跷板效应的定位)