Skip to content
🔗 分享本题
查看我的学习进度 →

GRPO、DAPO、GSPO 在采样、优势估计、重要性比率和裁剪粒度上的对比图

🧠 记忆锚点:不要只背缩写;看采样、优势估计、重要性比率和裁剪到底按 token 还是序列计算。

💡 答案要点

DAPO = Decoupled Clip → GRPO的进一步解耦

DAPO(来自 ByteDance)核心改进是"解耦":

GRPO 问题:policy KL penalty 和 sample 是在同一个分布上计算的
DAPO 改进:
  1. Decoupled Sampling - 生成和评估使用不同的分布
  2. Dynamic KL Penalty - KL 惩罚系数动态调整
  3. Token-level Loss - 损失从 sequence 级别细化到 token 级别
维度GRPODAPO
采样同一分布解耦采样
KL惩罚固定系数动态调整
损失粒度sequence级别token级别
效果稳定但保守更激进、性能更好

GSPO = Gradient-guided Self-Play Optimization

GSPO(来自 DeepSeek)核心思想是"梯度引导的自博弈":

python
# GSPO vs GRPO 核心差异
GRPO: 基于验证器的奖励信号直接更新
GSPO: 
  1. 构建两个 Agent:Generator 和 Critic
  2. Generator 生成样本
  3. Critic 用梯度指导 Generator 的方向
  4. 类似 GAN 的思想,但用 RL 框架

面试话术:

"DAPO 和 GSPO 是 2025-2026 年 GRPO 的两个主要进化方向。DAPO 解决的是 GRPO 的'保守性'问题——通过解耦采样和动态 KL 惩罚,让策略更新更激进。GSPO 则引入了类似 GAN 的自博弈思想,用梯度引导代替纯验证信号。实际项目里,如果追求稳定可用 GRPO,如果追求极限性能可以尝试 DAPO。"