Skip to content
🔗 分享本题
查看我的学习进度 →

RLHF 监督微调、奖励模型和 PPO 对齐三阶段流程图

🧠 记忆锚点:SFT 教会回答,奖励模型学会比较,PPO 在奖励与不偏离参考模型之间优化。

💡 答案要点

RLHF = Reinforcement Learning from Human Feedback(基于人类反馈的强化学习)

为什么需要对齐?

问题示例影响
价值观偏差生成有害内容安全风险
事实错误编造不存在的信息信任危机
格式混乱答非所问、重复用户体验差
不够有用过于简短或啰嗦实用性低

RLHF 三阶段:

┌─────────────────────────────────────────────────────────┐
│                    RLHF 完整流程                         │
└─────────────────────────────────────────────────────────┘

阶段1:监督微调(SFT)
  高质量对话数据 → 微调 → 基础对齐模型

阶段2:训练奖励模型(RM)
  人类标注偏好对比数据 → 训练 → 奖励模型
  (输入:问题+答案,输出:分数)

阶段3:强化学习优化(PPO)
  用奖励模型指导 → PPO 算法 → 最终模型

详细流程:

阶段1 - SFT(Supervised Fine-Tuning):

数据:{问题, 高质量答案}
目标:让模型学会基本对话能力
数据量:1万-10万条

阶段2 - RM(Reward Model):

数据:{问题, 答案A(好), 答案B(差)}
目标:训练评分模型,评估答案质量
模型:通常用 SFT 模型改造
损失函数:
  L = -log(σ(r_好 - r_差))
  让"好答案"分数高于"差答案"

阶段3 - PPO(Proximal Policy Optimization):

流程:
1. 模型生成答案
2. 奖励模型打分
3. PPO 更新策略
4. 添加 KL 散度惩罚(防止偏离太远)

目标函数:
  maximize E[r(x,y)] - β·KL(π_θ || π_ref)
  其中:
  - r(x,y):奖励模型分数
  - KL:与参考模型的散度
  - β:惩罚系数

面试话术:

"RLHF 是让 AI 学会'什么是好答案'。SFT 是打基础,RM 是建立评价标准,PPO 是不断优化。DeepSeek V4-Flash/4、Claude 都用了 RLHF。"

📚 参考:InstructGPT:Training language models to follow instructions(RLHF 原论文)