Skip to content
🔗 分享本题
查看我的学习进度 →

25 模块 Q6 教学图:设计一个 LLM/RAG 评测平台

🧠 图解记忆:核心对象包括 Dataset、Example、Experiment、Run、Trace、Evaluator 和 Annotation;点击图片可查看原图。

💡 答案要点

核心对象包括 Dataset、Example、Experiment、Run、Trace、Evaluator 和 Annotation。平台需要保存模型/Prompt/检索配置版本,支持离线批量运行、在线采样评估、人工标注和实验对比。

关键设计点:

  • 数据集按权限和用途隔离,保留盲测集并记录 lineage;
  • 任务执行使用队列、幂等键、限额和断点续跑;
  • 评估器支持代码规则、人工和校准后的 LLM Judge;
  • 结果按切片比较,展示置信区间,而不是只给平均分;
  • Trace 中的敏感输入需要脱敏、加密和保留期限;
  • 发布门禁引用固定实验和阈值,所有变更可审计。

📚 参考:promptfoo(评测平台的开源参考) · OpenAI Evals