Skip to content
🔗 分享本题
查看我的学习进度 →

模型自我报告与多场景重复行为试验形成概率分布的对比图

🧠 记忆锚点:模型说自己会怎么做只是文本;行为倾向要在多场景、多次试验和真实约束下由行动统计。

💡 答案要点

核心问题:LLM 说的和做的一样吗?

当前对齐评估主要靠"自我报告"——问模型"你会怎么处理这个情况",模型回答了就认为它具备某种性格特质。但这种评估有个根本缺陷:模型输出的敏感性取决于 prompt 措辞,而且"声称的倾向"不等于"在真实场景中的行为"。

Google Research 2026年4月研究:

提出了一个评估框架,把心理学问卷(IRI同理心、ERQ情绪调节等标准化量表)转化成"情境判断测试(SJT)",在真实用户-助手场景中评估模型行为。

方法论:

传统方式(自我报告):
  "我快速表达意见" → 模型回答"是" → 认定模型有主张性

新框架(情境判断测试):
  情境:商务会议中同事提出明显错误的方案,你会?
  A. 直接反对   B. 私下沟通   C. 沉默   D. 转移话题
  → 评估模型选择的策略是否体现主张性与同理心的平衡

25个LLM的大规模分析揭示两种gap:

Gap 类型描述含义
Deviation Gap模型倾向与人类标注者共识偏离模型"自以为是",不符合人类直觉
Range Gap人类有共识时,模型倾向过于集中模型缺乏对人类意见多样性的捕捉

测试场景覆盖:

  • 职业沉着(专业场景的压力应对)
  • 冲突解决(人际矛盾的处理策略)
  • 实际任务(订票、日程等日常决策)
  • 生活方式(日常决策场景)

核心结论:

"即使是对齐良好的模型,它们的'性格'也可能与人类不一致。这不是能力问题,而是'价值观对齐'的盲区——模型学的是'如何回答正确',而不是'如何像人类一样自然反应'。"

面试话术:

"2026年的AI安全评估有个新方向——不只是测试'模型说什么',而是测试'模型做什么'。Behavioral Dispositions Framework 通过把心理学量表变成情境判断测试,发现了很多对齐盲区。比如模型在'自我报告'里表现出同理心,但在真实冲突场景中的应对策略却显得过于生硬。这种评估方法对产品设计很重要——如果你的客服 Agent 总是'正确但冷漠',用户会流失。我的判断是:2026年的对齐评估会从'能力测试'升级到'行为测试'。"