Skip to content
🔗 分享本题
查看我的学习进度 →

"Prompt 改了一版,怎么证明效果没有退化?"——2026 年必考题。答案核心就两个词:基线和回归。没有评测集,所有 Prompt 改动都是玄学。

💡 答案要点

核心方法:基线(Baseline)+ 回归测试集(Regression Set)

改动前:全量跑一遍评测集 → 记录每个用例得分(基线)
改动后:全量重跑 → 逐用例对比
判定:总分不降 + 关键场景不降 + 目标问题确实修复 → 才允许上线

评测集怎么建(防"背题"):

  1. 覆盖典型场景 + 边界场景 + 历史线上问题(踩过的坑必须进集);
  2. 分场景打标签(意图识别、合同提取、风险判断…),按场景分别看得分;
  3. 防数据泄漏:线上新问题不能偷偷塞进评测集"刷分",评测集要冻结版本;
  4. 定期补充,但补充要记录,基线版本和评测集版本一一对应。

评测维度(按应用类型分):

应用类型评测维度常用指标
RAG检索相关性 + 回答事实一致性Recall@k、MRR、Faithfulness、正确率
Skill结构化输出校验通过率 + 工具调用准确率Schema 通过率、工具选对率、参数正确率
Agent轨迹级评测(工具序列 + 最终结果)任务完成率、轨迹匹配率、兜底成功率

工具: DeepEval、Ragas、lm-evaluation-harness(离线批量跑,进 CI)。

灰度兜底(离线评测过了不代表线上稳):

  • 新版本小流量(如 10%)对比线上版本,看真实用户反馈指标;
  • 关键业务加人工抽检(如法务、客服场景的转人工率)。

面试话术:

"Prompt 改动我走基线+回归流程:评测集覆盖典型、边界和历史问题场景并冻结版本,改动前全量跑一遍记基线,改完重跑逐用例对比,总分和关键场景不降、目标问题修复才放行。RAG 场景分两维——检索相关性用 Recall@k/MRR,回答事实一致性用 Faithfulness;Skill 场景看输出 Schema 通过率和工具调用准确率。离线评测过了再小流量灰度,双保险。这套流程跑下来,Prompt 优化就从玄学变成了可验证的工程。"