Skip to content
🔗 分享本题
查看我的学习进度 →

幻觉与偏见对比动漫知识图:幻觉关注回答是否有事实依据,偏见关注不同群体是否受到系统性不公平影响,两者需要不同检测方法和持续评测闭环

🧠 图解记忆:幻觉查证据,偏见查群体差异,两者都要持续评测;点击图片可查看原图。

幻觉问题(补充:如何检测与量化幻觉?)

💡 答案要点

(什么是幻觉、幻觉类型、基本缓解方法 → 见第 5 节)

如何检测幻觉(面试高频追问):

方法原理场景
引用溯源要求模型回答时给出引用/来源生产系统标配
忠实度评估(Faithfulness)RAGAS 等框架检测"回答是否忠于检索内容"RAG 系统
交叉验证同一问题问多次/问不同模型,对比一致性高价值场景
事实核对关键实体(人名/日期/数字)用外部工具验证知识密集型
不确定性探测问模型"你有多确定",或检查 logprobs 置信度低成本粗筛

量化指标(RAGAS 忠实度):

python
from ragas import evaluate
from ragas.metrics import faithfulness

result = evaluate(dataset, metrics=[faithfulness])
# faithfulness: 回答中有多少陈述能从检索内容中找到依据(0-1)

工程最佳实践:

  1. 生产环境必须带引用/溯源,这是幻觉的第一道防线
  2. 定期抽样评估 faithfulness 指标,监控幻觉率变化
  3. 高价值场景(金融/医疗)加交叉验证或人工复核

偏见问题

💡 答案要点

什么是偏见? 模型在性别、种族、地域等方面的不公平输出

典型例子:

输入: "The nurse said ... he/she"
偏见模型: 倾向用 "she" (性别刻板印象)

输入: "程序员通常是..."
偏见模型: "男性" (职业性别偏见)

偏见来源:

  • 训练数据中的社会偏见
  • 标注人员的主观偏好
  • 采样策略导致的分布偏移

缓解方法:

方法效果成本
数据平衡增加少数群体样本
RLHF对齐人类反馈强化学习
提示词工程明确要求公平性低⭐
后处理过滤检测并修正偏见输出

面试话术:

示例表达(仅在能用本人经历或可复现实验佐证时使用): "幻觉和偏见是LLM两大核心问题。我们项目用RAG解决幻觉——所有回答必须基于知识库,未找到时明确告知。偏见方面,我们在Prompt中明确要求'请公平对待所有性别/种族',并在RLHF阶段强化这一点。"