🧠 图解记忆:先定义好答案,再选指标;自动全量加人工抽样;点击图片可查看原图。
核心指标
💡 答案要点
自动评估指标
| 指标 | 适用场景 | 优缺点 |
|---|---|---|
| BLEU | 机器翻译 | 快速,但对创意文本不准 |
| ROUGE | 摘要生成 | 关注召回率 |
| BERTScore | 语义相似度 | 考虑语义,更智能 ⭐ |
| Perplexity | 语言模型质量 | 低困惑度=高质量 |
人工评估维度
| 维度 | 说明 | 示例问题 |
|---|---|---|
| 相关性 | 是否回答了问题 | 5分制评分 |
| 准确性 | 事实是否正确 | 有无幻觉 |
| 流畅性 | 语言是否通顺 | 是否自然 |
| 完整性 | 信息是否充分 | 有无遗漏 |
RAG系统专用指标
python
# 使用 RAGAS 框架
from ragas import evaluate
from ragas.metrics import (
faithfulness, # 忠实度: 回答是否基于检索内容
answer_relevancy, # 相关性: 是否回答了问题
context_recall, # 召回率: 检索到了关键信息吗
context_precision # 精确率: 检索内容是否都有用
)
results = evaluate(
dataset=test_data,
metrics=[faithfulness, answer_relevancy, context_recall, context_precision]
)面试话术:
"我们项目用双层评估:自动指标RAGAS跑全量数据,人工抽样200条核心case。关键维度是忠实度(不能幻觉)和相关性(要答对问题)。每次模型迭代都要对比这些指标,确保没有退化。"
📚 参考:OpenAI Evals(开源评估框架)
