Skip to content
🔗 分享本题
查看我的学习进度 →

AI 应用任务成功、依据扎根、安全、鲁棒、体验、成本质量评估体系图

🧠 记忆锚点:先定义任务成功,再分质量、安全、鲁棒、延迟、成本评;离线门禁与线上反馈形成闭环。

💡 答案要点

评估维度:

┌─────────────────────────────────────────────────────────┐
│                    AI 应用评估体系                        │
└─────────────────────────────────────────────────────────┘

准确性 ←→ 相关性 ←→ 安全性 ←→ 体验 ←→ 成本
   ↓         ↓         ↓         ↓       ↓
答案对   答得准   无有害   响应快   花钱少

核心指标:

维度指标计算方法合格线
准确性答案正确率人工标注/标准答案对比> 85%
相关性RAGAS Relevance答案与问题的语义相似度> 0.8
安全性有害内容比例审核 API 检测< 1%
体验首字延迟从请求到第一个 token< 1s
体验完整响应时间从请求到完整答案< 5s
成本单次对话成本Token 消耗 × 单价< ¥0.01

评估方法:

方法说明优缺点
人工评估专业人员打分准确但成本高
自动评估RAGAS/TruLens快速但不够精确
A/B 测试对比不同版本真实但周期长
用户反馈点赞/点踩直接但有偏差

面试话术:

"自动评估 Pipeline 应覆盖离线回归、对抗集和人工校准。题量与抽检比例由风险、错误基线和希望检测的最小变化决定;RAGAS 等代理指标不能替代任务成功、证据正确性和人工判定。每次变更还要保留失败切片和可回滚版本。"

📚 参考:OpenAI Evals(评估框架官方仓库)