Skip to content
🔗 分享本题
查看我的学习进度 →

LLM 输出质量评估动漫知识图:从真实测试集出发,组合任务匹配的自动指标、人工维度和 RAG 指标,对比基线与新版本并检查回归

🧠 图解记忆:先定义好答案,再选指标;自动全量加人工抽样;点击图片可查看原图。

核心指标

💡 答案要点

自动评估指标

指标适用场景优缺点
BLEU机器翻译快速,但对创意文本不准
ROUGE摘要生成关注召回率
BERTScore语义相似度考虑语义,更智能 ⭐
Perplexity语言模型质量低困惑度=高质量

人工评估维度

维度说明示例问题
相关性是否回答了问题5分制评分
准确性事实是否正确有无幻觉
流畅性语言是否通顺是否自然
完整性信息是否充分有无遗漏

RAG系统专用指标

python
# 使用 RAGAS 框架
from ragas import evaluate
from ragas.metrics import (
    faithfulness,        # 忠实度: 回答是否基于检索内容
    answer_relevancy,    # 相关性: 是否回答了问题
    context_recall,      # 召回率: 检索到了关键信息吗
    context_precision    # 精确率: 检索内容是否都有用
)

results = evaluate(
    dataset=test_data,
    metrics=[faithfulness, answer_relevancy, context_recall, context_precision]
)

面试话术:

"我们项目用双层评估:自动指标RAGAS跑全量数据,人工抽样200条核心case。关键维度是忠实度(不能幻觉)和相关性(要答对问题)。每次模型迭代都要对比这些指标,确保没有退化。"

📚 参考:OpenAI Evals(开源评估框架)