🧠 图解记忆: 测试集来自真实场景,覆盖正常与边界,并随线上失败持续生长。
💡 答案要点
测试集构建流程:
1. 收集问题 → 2. 标注标准答案 → 3. 分类整理 → 4. 定期更新问题分类:
| 类别 | 说明 | 占比 |
|---|---|---|
| 简单问题 | FAQ、事实查询 | 40% |
| 中等问题 | 需要推理 | 40% |
| 复杂问题 | 多步推理、计算 | 15% |
| 边界问题 | 模糊、无答案 | 5% |
测试集规模:
- 最小可用:50-100 题
- 推荐:200-500 题
- 生产级:1000+ 题
维护策略:
- 每周新增:从用户反馈中收集新问题
- 每月审核:删除过时问题,更新答案
- 每季度回归:跑一遍测试集,确保质量不下降
面试话术:
"我维护了一个 300 题的测试集,覆盖简单/中等/复杂三种难度。每次上线前跑一遍,Faithfulness 低于 0.7 就阻断发布。同时每周从用户反馈中收集 10-20 个新问题,持续扩充测试集。"
📚 参考:OpenAI Evals(评估集构建)
