
🧠 记忆锚点:不要只背缩写;看采样、优势估计、重要性比率和裁剪到底按 token 还是序列计算。
💡 答案要点
DAPO = Decoupled Clip → GRPO的进一步解耦
DAPO(来自 ByteDance)核心改进是"解耦":
GRPO 问题:policy KL penalty 和 sample 是在同一个分布上计算的
DAPO 改进:
1. Decoupled Sampling - 生成和评估使用不同的分布
2. Dynamic KL Penalty - KL 惩罚系数动态调整
3. Token-level Loss - 损失从 sequence 级别细化到 token 级别| 维度 | GRPO | DAPO |
|---|---|---|
| 采样 | 同一分布 | 解耦采样 |
| KL惩罚 | 固定系数 | 动态调整 |
| 损失粒度 | sequence级别 | token级别 |
| 效果 | 稳定但保守 | 更激进、性能更好 |
GSPO = Gradient-guided Self-Play Optimization
GSPO(来自 DeepSeek)核心思想是"梯度引导的自博弈":
python
# GSPO vs GRPO 核心差异
GRPO: 基于验证器的奖励信号直接更新
GSPO:
1. 构建两个 Agent:Generator 和 Critic
2. Generator 生成样本
3. Critic 用梯度指导 Generator 的方向
4. 类似 GAN 的思想,但用 RL 框架面试话术:
"DAPO 和 GSPO 是 2025-2026 年 GRPO 的两个主要进化方向。DAPO 解决的是 GRPO 的'保守性'问题——通过解耦采样和动态 KL 惩罚,让策略更新更激进。GSPO 则引入了类似 GAN 的自博弈思想,用梯度引导代替纯验证信号。实际项目里,如果追求稳定可用 GRPO,如果追求极限性能可以尝试 DAPO。"