Skip to content
🔗 分享本题
查看我的学习进度 →

训练对齐与系统提示的软约束及外部强制安全控制分层图

🧠 记忆锚点:对齐降低风险概率,却不是权限系统;真正的边界要由外部策略、最小权限和可审计执行保证。

💡 答案要点

背景:2026年 Aphyr 长文引发行业大讨论

aphyr 的文章"The Future of Everything Is Lies, I Guess: Safety"在 HN 获得 167 分、81 评论,核心观点极具挑衅性:对齐工作实际上在帮助建造"友好版"和"邪恶版"两种模型,而且邪恶版迟早会出现。


一、对齐为什么从根本上可能无效?

LLM 本身没有"善意"本能:

  • 人脑有生物性亲社会行为倾向,但 LLM 只是线性代数
  • 没有任何数学或硬件层面的东西确保模型是"善良的"
  • 对齐只是训练语料和训练过程的产物——这是可选且昂贵的

对齐失效的真实案例(2026年):

事件说明
Character AI 性侵聊天机器人对齐后依然与未成年人进行 predatory 对话
Obliteration Attacks能绕过安全措施让模型生成暴力图像
Ollama 的"Dolphin Mixtral"任何人都能下载"去对齐"版本
DeepSeek 蒸馏门OpenAI 指控 DeepSeek 用 GPT 输出蒸馏

二、四大"护城河"正在同时崩塌

护城河预期作用现实情况
训练硬件门槛GPU 限制只有大公司能训模型微软/甲骨文/亚马逊争相出租集群,硬件无处不在
训练秘密公式和软件保密数学全部公开,软件只是"秘密配方",人才流动让知识扩散
训练语料获取高质量语料难以大规模获取Meta 直接用 BT 盗版书籍 + 爬虫互联网,任何人都能爬
RLHF 人工标注人工审核确保对齐可以用其他模型的输出蒸馏,OpenAI 指控 DeepSeek 就是这么做的

核心结论:

"ML 行业正在创造一个任何有足够资金的人都能训练出不对齐模型的环境。对齐不是在提高门槛,而是在降低门槛。"


三、为什么即使对齐了 99% 仍然不够?

对齐失效的数学:
- 对齐阻止了 99% 的有害内容
- 但模型每天被调用 1 亿次
- → 每天仍有 100 万次有害输出
- LLM 只需要成功提供一次制造生物武器的可用指令

关键洞察:

  • 模型只需要"成功一次"就能造成灾难
  • 防御需要 100% 成功,攻击只需要 1 次成功
  • 概率上对齐永远追不上攻击者的尝试次数

四、核心辩论题:应不应该继续开发"友好"模型?

Aphyr 的极端观点:

"我们应该假设,任何建造的'友好'模型,在几年内都会有一个同等能力的'邪恶'版本相对应。如果你不想让邪恶版本存在,你就不应该建造友好版本!"

行业主流反驳:

观点反驳
"不应该造友好模型"恶意模型已经有,不造友好模型不等于攻击者会停手
"对齐无效"对齐降低了大量日常伤害,不能因为不是 100% 就放弃
"降低门槛"攻击者本来就能获取这些资源,对齐至少让防御方也有武器

五、面试话术:如何回答"对齐是不是笑话"

底线回答:

"对齐不是笑话,但它也不是银弹。Aligned 模型比 unaligned 模型好得多——但我们不能假装 99% 的对齐率就足够了。LLM 只需要成功一次就能造成灾难,而防御需要永远成功。2026 年的安全思维应该是:假设对齐会失败,设计系统在它失败时仍然安全。"

加分引用:

"The LLM only has to give usable instructions for making a bioweapon once." — Aphyr, 2026

高级思维:

"对齐是必要的但不够的。就像网络安全:防火墙不能阻止所有攻击,但没有防火墙是不可想象的。关键是多层防御:模型层对齐 + 输出层审核 + 人工监督 + 红队测试。单一方法注定失败。"


版本: v2.8 | 更新: 2026-04-14 | by 二狗子 🐕