
🧠 记忆锚点:先定义任务成功,再分质量、安全、鲁棒、延迟、成本评;离线门禁与线上反馈形成闭环。
💡 答案要点
评估维度:
┌─────────────────────────────────────────────────────────┐
│ AI 应用评估体系 │
└─────────────────────────────────────────────────────────┘
准确性 ←→ 相关性 ←→ 安全性 ←→ 体验 ←→ 成本
↓ ↓ ↓ ↓ ↓
答案对 答得准 无有害 响应快 花钱少核心指标:
| 维度 | 指标 | 计算方法 | 合格线 |
|---|---|---|---|
| 准确性 | 答案正确率 | 人工标注/标准答案对比 | > 85% |
| 相关性 | RAGAS Relevance | 答案与问题的语义相似度 | > 0.8 |
| 安全性 | 有害内容比例 | 审核 API 检测 | < 1% |
| 体验 | 首字延迟 | 从请求到第一个 token | < 1s |
| 体验 | 完整响应时间 | 从请求到完整答案 | < 5s |
| 成本 | 单次对话成本 | Token 消耗 × 单价 | < ¥0.01 |
评估方法:
| 方法 | 说明 | 优缺点 |
|---|---|---|
| 人工评估 | 专业人员打分 | 准确但成本高 |
| 自动评估 | RAGAS/TruLens | 快速但不够精确 |
| A/B 测试 | 对比不同版本 | 真实但周期长 |
| 用户反馈 | 点赞/点踩 | 直接但有偏差 |
面试话术:
"自动评估 Pipeline 应覆盖离线回归、对抗集和人工校准。题量与抽检比例由风险、错误基线和希望检测的最小变化决定;RAGAS 等代理指标不能替代任务成功、证据正确性和人工判定。每次变更还要保留失败切片和可回滚版本。"