"Prompt 改了一版,怎么证明效果没有退化?"——2026 年必考题。答案核心就两个词:基线和回归。没有评测集,所有 Prompt 改动都是玄学。
💡 答案要点
核心方法:基线(Baseline)+ 回归测试集(Regression Set)
改动前:全量跑一遍评测集 → 记录每个用例得分(基线)
改动后:全量重跑 → 逐用例对比
判定:总分不降 + 关键场景不降 + 目标问题确实修复 → 才允许上线评测集怎么建(防"背题"):
- 覆盖典型场景 + 边界场景 + 历史线上问题(踩过的坑必须进集);
- 分场景打标签(意图识别、合同提取、风险判断…),按场景分别看得分;
- 防数据泄漏:线上新问题不能偷偷塞进评测集"刷分",评测集要冻结版本;
- 定期补充,但补充要记录,基线版本和评测集版本一一对应。
评测维度(按应用类型分):
| 应用类型 | 评测维度 | 常用指标 |
|---|---|---|
| RAG | 检索相关性 + 回答事实一致性 | Recall@k、MRR、Faithfulness、正确率 |
| Skill | 结构化输出校验通过率 + 工具调用准确率 | Schema 通过率、工具选对率、参数正确率 |
| Agent | 轨迹级评测(工具序列 + 最终结果) | 任务完成率、轨迹匹配率、兜底成功率 |
工具: DeepEval、Ragas、lm-evaluation-harness(离线批量跑,进 CI)。
灰度兜底(离线评测过了不代表线上稳):
- 新版本小流量(如 10%)对比线上版本,看真实用户反馈指标;
- 关键业务加人工抽检(如法务、客服场景的转人工率)。
面试话术:
"Prompt 改动我走基线+回归流程:评测集覆盖典型、边界和历史问题场景并冻结版本,改动前全量跑一遍记基线,改完重跑逐用例对比,总分和关键场景不降、目标问题修复才放行。RAG 场景分两维——检索相关性用 Recall@k/MRR,回答事实一致性用 Faithfulness;Skill 场景看输出 Schema 通过率和工具调用准确率。离线评测过了再小流量灰度,双保险。这套流程跑下来,Prompt 优化就从玄学变成了可验证的工程。"