Skip to content
🔗 分享本题
查看我的学习进度 →

AI 测试集从真实场景采样、分层标注、去重质检、版本回归到线上失败回流的闭环

🧠 图解记忆: 测试集来自真实场景,覆盖正常与边界,并随线上失败持续生长。

💡 答案要点

测试集构建流程:

1. 收集问题 → 2. 标注标准答案 → 3. 分类整理 → 4. 定期更新

问题分类:

类别说明占比
简单问题FAQ、事实查询40%
中等问题需要推理40%
复杂问题多步推理、计算15%
边界问题模糊、无答案5%

测试集规模:

  • 最小可用:50-100 题
  • 推荐:200-500 题
  • 生产级:1000+ 题

维护策略:

  1. 每周新增:从用户反馈中收集新问题
  2. 每月审核:删除过时问题,更新答案
  3. 每季度回归:跑一遍测试集,确保质量不下降

面试话术:

"我维护了一个 300 题的测试集,覆盖简单/中等/复杂三种难度。每次上线前跑一遍,Faithfulness 低于 0.7 就阻断发布。同时每周从用户反馈中收集 10-20 个新问题,持续扩充测试集。"

📚 参考:OpenAI Evals(评估集构建)