
🧠 记忆锚点:模型说自己会怎么做只是文本;行为倾向要在多场景、多次试验和真实约束下由行动统计。
💡 答案要点
核心问题:LLM 说的和做的一样吗?
当前对齐评估主要靠"自我报告"——问模型"你会怎么处理这个情况",模型回答了就认为它具备某种性格特质。但这种评估有个根本缺陷:模型输出的敏感性取决于 prompt 措辞,而且"声称的倾向"不等于"在真实场景中的行为"。
Google Research 2026年4月研究:
提出了一个评估框架,把心理学问卷(IRI同理心、ERQ情绪调节等标准化量表)转化成"情境判断测试(SJT)",在真实用户-助手场景中评估模型行为。
方法论:
传统方式(自我报告):
"我快速表达意见" → 模型回答"是" → 认定模型有主张性
新框架(情境判断测试):
情境:商务会议中同事提出明显错误的方案,你会?
A. 直接反对 B. 私下沟通 C. 沉默 D. 转移话题
→ 评估模型选择的策略是否体现主张性与同理心的平衡25个LLM的大规模分析揭示两种gap:
| Gap 类型 | 描述 | 含义 |
|---|---|---|
| Deviation Gap | 模型倾向与人类标注者共识偏离 | 模型"自以为是",不符合人类直觉 |
| Range Gap | 人类有共识时,模型倾向过于集中 | 模型缺乏对人类意见多样性的捕捉 |
测试场景覆盖:
- 职业沉着(专业场景的压力应对)
- 冲突解决(人际矛盾的处理策略)
- 实际任务(订票、日程等日常决策)
- 生活方式(日常决策场景)
核心结论:
"即使是对齐良好的模型,它们的'性格'也可能与人类不一致。这不是能力问题,而是'价值观对齐'的盲区——模型学的是'如何回答正确',而不是'如何像人类一样自然反应'。"
面试话术:
"2026年的AI安全评估有个新方向——不只是测试'模型说什么',而是测试'模型做什么'。Behavioral Dispositions Framework 通过把心理学量表变成情境判断测试,发现了很多对齐盲区。比如模型在'自我报告'里表现出同理心,但在真实冲突场景中的应对策略却显得过于生硬。这种评估方法对产品设计很重要——如果你的客服 Agent 总是'正确但冷漠',用户会流失。我的判断是:2026年的对齐评估会从'能力测试'升级到'行为测试'。"