
🧠 记忆锚点:SFT 教会回答,奖励模型学会比较,PPO 在奖励与不偏离参考模型之间优化。
💡 答案要点
RLHF = Reinforcement Learning from Human Feedback(基于人类反馈的强化学习)
为什么需要对齐?
| 问题 | 示例 | 影响 |
|---|---|---|
| 价值观偏差 | 生成有害内容 | 安全风险 |
| 事实错误 | 编造不存在的信息 | 信任危机 |
| 格式混乱 | 答非所问、重复 | 用户体验差 |
| 不够有用 | 过于简短或啰嗦 | 实用性低 |
RLHF 三阶段:
┌─────────────────────────────────────────────────────────┐
│ RLHF 完整流程 │
└─────────────────────────────────────────────────────────┘
阶段1:监督微调(SFT)
高质量对话数据 → 微调 → 基础对齐模型
阶段2:训练奖励模型(RM)
人类标注偏好对比数据 → 训练 → 奖励模型
(输入:问题+答案,输出:分数)
阶段3:强化学习优化(PPO)
用奖励模型指导 → PPO 算法 → 最终模型详细流程:
阶段1 - SFT(Supervised Fine-Tuning):
数据:{问题, 高质量答案}
目标:让模型学会基本对话能力
数据量:1万-10万条阶段2 - RM(Reward Model):
数据:{问题, 答案A(好), 答案B(差)}
目标:训练评分模型,评估答案质量
模型:通常用 SFT 模型改造
损失函数:
L = -log(σ(r_好 - r_差))
让"好答案"分数高于"差答案"阶段3 - PPO(Proximal Policy Optimization):
流程:
1. 模型生成答案
2. 奖励模型打分
3. PPO 更新策略
4. 添加 KL 散度惩罚(防止偏离太远)
目标函数:
maximize E[r(x,y)] - β·KL(π_θ || π_ref)
其中:
- r(x,y):奖励模型分数
- KL:与参考模型的散度
- β:惩罚系数面试话术:
"RLHF 是让 AI 学会'什么是好答案'。SFT 是打基础,RM 是建立评价标准,PPO 是不断优化。DeepSeek V4-Flash/4、Claude 都用了 RLHF。"
📚 参考:InstructGPT:Training language models to follow instructions(RLHF 原论文)