🧠 图解记忆:幻觉查证据,偏见查群体差异,两者都要持续评测;点击图片可查看原图。
幻觉问题(补充:如何检测与量化幻觉?)
💡 答案要点
(什么是幻觉、幻觉类型、基本缓解方法 → 见第 5 节)
如何检测幻觉(面试高频追问):
| 方法 | 原理 | 场景 |
|---|---|---|
| 引用溯源 | 要求模型回答时给出引用/来源 | 生产系统标配 |
| 忠实度评估(Faithfulness) | RAGAS 等框架检测"回答是否忠于检索内容" | RAG 系统 |
| 交叉验证 | 同一问题问多次/问不同模型,对比一致性 | 高价值场景 |
| 事实核对 | 关键实体(人名/日期/数字)用外部工具验证 | 知识密集型 |
| 不确定性探测 | 问模型"你有多确定",或检查 logprobs 置信度 | 低成本粗筛 |
量化指标(RAGAS 忠实度):
python
from ragas import evaluate
from ragas.metrics import faithfulness
result = evaluate(dataset, metrics=[faithfulness])
# faithfulness: 回答中有多少陈述能从检索内容中找到依据(0-1)工程最佳实践:
- 生产环境必须带引用/溯源,这是幻觉的第一道防线
- 定期抽样评估 faithfulness 指标,监控幻觉率变化
- 高价值场景(金融/医疗)加交叉验证或人工复核
偏见问题
💡 答案要点
什么是偏见? 模型在性别、种族、地域等方面的不公平输出
典型例子:
输入: "The nurse said ... he/she"
偏见模型: 倾向用 "she" (性别刻板印象)
输入: "程序员通常是..."
偏见模型: "男性" (职业性别偏见)偏见来源:
- 训练数据中的社会偏见
- 标注人员的主观偏好
- 采样策略导致的分布偏移
缓解方法:
| 方法 | 效果 | 成本 |
|---|---|---|
| 数据平衡 | 增加少数群体样本 | 高 |
| RLHF对齐 | 人类反馈强化学习 | 高 |
| 提示词工程 | 明确要求公平性 | 低⭐ |
| 后处理过滤 | 检测并修正偏见输出 | 中 |
面试话术:
示例表达(仅在能用本人经历或可复现实验佐证时使用): "幻觉和偏见是LLM两大核心问题。我们项目用RAG解决幻觉——所有回答必须基于知识库,未找到时明确告知。偏见方面,我们在Prompt中明确要求'请公平对待所有性别/种族',并在RLHF阶段强化这一点。"
