🧠 图解记忆:核心对象包括 Dataset、Example、Experiment、Run、Trace、Evaluator 和 Annotation;点击图片可查看原图。
💡 答案要点
核心对象包括 Dataset、Example、Experiment、Run、Trace、Evaluator 和 Annotation。平台需要保存模型/Prompt/检索配置版本,支持离线批量运行、在线采样评估、人工标注和实验对比。
关键设计点:
- 数据集按权限和用途隔离,保留盲测集并记录 lineage;
- 任务执行使用队列、幂等键、限额和断点续跑;
- 评估器支持代码规则、人工和校准后的 LLM Judge;
- 结果按切片比较,展示置信区间,而不是只给平均分;
- Trace 中的敏感输入需要脱敏、加密和保留期限;
- 发布门禁引用固定实验和阈值,所有变更可审计。
📚 参考:promptfoo(评测平台的开源参考) · OpenAI Evals
