文献阅读:RL算法GPG
GPG:A SIMPLE AND STRONG REINFORCEMENT LEARNING BASELINE FOR MODEL REASONING
arXiv:2504.02546v4 | ICLR 2026
一、背景
大型语言模型(LLMs)已取得长足发展,正逐步缩小与通用人工智能(AGI)之间的差距。近期,如 OpenAI o1 和 DeepSeek-R1 等通过生成中间推理步骤(CoT)来提升在数学等复杂任务上的表现。这种成功主要归功于强化微调(RFT)方法,如 PPO 和 GRPO。
但这两种方法存在一些问题:
- PPO 训练极其消耗资源,需要训练 Critic 模型和 Reference 模型,过程复杂且计算需求大。
- GRPO 虽然去除了 Critic 模型,但仍然保留了 Reference 模型、KL 散度约束以及代理损失(Off-policy)。此外,GRPO 中的奖励标准化(A^i,t=ri−mean(Rii=1G)std(R)\hat{A}_{i,t}=\frac{r_i-mean({R_i}^G_{i=1})}{std({R})}A^i,t=std(R)ri−mean(Rii=1G))会引入“奖励偏差”。
PPO是作为通用RL算法被提出,以Atari游戏作为主要评估基准,在该基准场景下策略网络通常会同时学习视觉表征与控制策略。LLM通过预训练和SFT已经具备强大表达能力,因此移除冗余组件对可扩展性至关重要,也推动对简化RL算法的重新思考。
因此,此文提取出了GPG方法:
- 直接优化目标函数,而非依赖代理损失(on-policy).
- 无需价值判别网络(Critic)与参考模型(Reference Model);此外,该算法不施加任何分布层面约束(KL散度约束、新旧策略概率裁剪约束),使其具备极佳的大规模扩展潜力。
- 对梯度估计偏差现象展开研究后,提出了一种自适应梯度估计(AGE)方法。当有效样本占比过低时,梯度估计会出现方差过大的潜在问题,为缓解该问题,本文引入简易阈值机制以保证留存最低限度的有效样本分组,并在此基础上执行重采样操作。
- 通过大量实验表明,GPG在各类单模态与多模态视觉任务上均取得当前最优(SOTA)效果。
二、方法
2.1 预备知识与任务定义
- 策略梯度基础:RL 的目标是最大化期望回报 J(θ)=maxθEπθ[∑t=0Trt]J(\theta) = \max_{\theta} \mathbb{E}_{\pi_\theta} \left[ \sum_{t=0}^{T} r_t \right]J(θ)=maxθEπθ[∑t=0Trt]。根据策略梯度定理,这可以通过估计梯度 ∇θJ(θ)=Eπθ[∇θlogπθ(at∣st)Aπθ(st,at)]\nabla_\theta J(\theta) = \mathbb{E}_{\pi_\theta}[\nabla_\theta \log \pi_\theta(a_t|s_t) A^{\pi_\theta}(s_t, a_t)]∇θJ(θ)=Eπθ[∇θlogπθ(at∣st)Aπθ(st,at)] 来实现。
- 优势函数:为了降低梯度估计的方差,通常使用优势函数 A(st,at)=Q(st,at)−V(st)A(s_t, a_t) = Q(s_t, a_t) - V(s_t)A(st,at)=Q(st,at)−V(st), 其中 Q(st,at)Q(s_t, a_t)Q(st,at) 是在状态 sts_tst 下采取动作 ata_tat 的价值函数,V(st)V(s_t)V(st) 是状态 sts_tst 的价值函数。在现代大模型推理场景中,不需要复杂的 GAE 估计,单步奖励估计已经足够有效。
- 任务简化:由于设计中间步骤的准确奖励非常困难,作者将问题简化为:给定问题 qqq 和提示 sss,模型生成动作 aaa(即完整回答),并在最后获得一个最终的整体奖励 rrr。
GAE: Generalized Advantage Estimation(广义优势估计)
在策略梯度算法中,我们需要计算“优势函数” A(st,at)A(s_t, a_t)A(st,at),它表示在状态 sts_tst 下采取动作 ata_tat,比平均水平好多少。计算优势函数通常需要依赖一个“价值网络”来估计状态的价值 V(s)V(s)V(s)。
计算优势函数有两种极端的方法,各有利弊:
- 方法 A:蒙特卡洛估计
* 做法:让模型一直玩到游戏结束(或生成完整个回答),把实际得到的总奖励拿来用。
* 优点:无偏估计,也就是期望值是完全准确的。
* 缺点:方差极大。因为一次具体的轨迹包含很多随机性,导致梯度更新剧烈震荡。- 方法 B:时序差分(TD,1步估计)
* 做法:只看眼前的1步奖励,加上 Critic 模型预测的下一状态的价值:At=rt+γV(st+1)−V(st)A_t = r_t + \gamma V(s_{t+1}) - V(s_t)At=rt+γV(st+1)−V(st)。
* 优点:方差很小,训练稳定。
* 缺点:严重依赖 Critic 模型预测的准确性。如果 Critic 预测得不准,偏差就会一层层传递下去(高偏差)。GAE 的核心思想是:两者间做一个平滑的插值过渡。
它引入了一个超参数 λ\lambdaλ(取值在 0 到 1 之间),把未来的多步 TD 误差通过指数衰减的方式加权求和。数学上长这样:
AtGAE=∑l=0∞(γλ)lδt+l A^{GAE}_t = \sum_{l=0}^{\infty} (\gamma \lambda)^l \delta_{t+l} AtGAE=l=0∑∞(γλ)lδt+l
(其中 δt=rt+γV(st+1)−V(st)\delta_t = r_t + \gamma V(s_{t+1}) - V(s_t)δt=rt+γV(st+1)−V(st) 是单步的 TD 误差)
- 当 λ=0\lambda = 0λ=0 时:GAE 就退化成了 1步 TD 估计。
- 当 λ=1\lambda = 1λ=1 时:GAE 等价完整蒙特卡洛
- 当 0<λ<10 < \lambda < 10<λ<1 时(通常取 0.95):它在考虑未来多步实际奖励的同时,逐渐衰减对 Critic 模型的依赖,从而在偏差和方差之间取得了平衡。
2.2 Group Policy Gradient (GPG) 的核心设计
GPG 的核心目标是:在没有价值模型 的情况下,解决策略梯度估计方差过高的问题,并消除现有方法中的各种偏差。
Our proposed method, Group Policy Gradient (GPG), is designed to address the issue of high variance in policy gradient estimation in the absence of a value model.
1. GPG 的核心目标函数
GPG 利用每组奖励均值来归一化奖励,从而有效降低方差。该方法无需传统价值模型,从而简化了训练过程并增强了计算效率。目标函数定义为:
JGPG(θ)=E[1G∑i=1G1∣oi∣∑t=1∣oi∣(−logπθ(oi,t∣q,oi,<t)A^i,t)]J_{GPG}(\theta) = \mathbb{E} \left[ \frac{1}{G} \sum_{i=1}^{G} \frac{1}{|o_i|} \sum_{t=1}^{|o_i|} \left( -\log \pi_\theta(o_{i,t}|q, o_{i,<t}) \hat{A}_{i,t} \right) \right]JGPG(θ)=E
G1i=1∑G∣oi∣1t=1∑∣oi∣(−logπθ(oi,t∣q,oi,<t)A^i,t)
oio_ioi代表组G的其中一次响应,第i次响应的优势A通过对组级奖励{Ri}i=1G\{R_i\}^G_{i=1}{Ri}i=1G进行归一化计算得出:A^i,t=ri−mean(Rii=1G)Fnorm\hat{A}_{i,t}=\frac{r_i-mean({R_i}^G_{i=1})}{F_{norm}}A^i,t=Fnormri−mean(Rii=1G)
FnormF_{norm}Fnorm是可选的归一化技术,常采用的方法是在一个训练批次内采用标准方差正则化。此方法通过减小奖励的方差来稳定训练过程,这在处理奖励幅度差异显著的环境时尤为重要。通过正则化奖励信号,模型降低对极值的敏感性,从而提高训练算法的鲁棒性和收敛性。然而在涉及大模型的推理任务中,奖励通常定义明确,不会出现在其他环境下的方差问题,以数学推理问题为例,实际对答案的奖励就是0和1。
文章认为A^i,t\hat{A}_{i,t}A^i,t在以往推理相关研究中尚未得到充分探讨,有必要进一步探究A^i,t\hat{A}_{i,t}A^i,t在推理任务中的作用与影响。目前尚存两项未解决的问题:
- A^i,t\hat{A}_{i,t}A^i,t 不应引入奖励偏差。奖励偏差会偏离原始问题的设定。GRPO将Fnorm=std{R(o)}F_{\text{norm}} = \text{std}\{R(o)\}Fnorm=std{R(o)},会显式引入奖励偏差。若移除该偏差项,令 Fnorm=1F_{\text{norm}} = 1Fnorm=1,实验发现对应模型性能(43.9%)相较于GRPO(43.7%)并无明显优势。这就引出了下一个关键问题——梯度估计偏差。
- 批次内同一分组全部为正确或错误样本的案例会给梯度估计引入偏差。设训练批次的批次大小为BBB,第iii个样本的梯度记为gig_igi。不失一般性,假设该批次内前MMM个样本均属于同一分组里全对或全错的样本。标准反向传播(BP)算法对梯度的估计公式为:g=∑i=1BgiB=∑i=M+1BgiBg = \frac{\sum_{i=1}^{B} g_i}{B} = \frac{\sum_{i=M+1}^{B} g_i}{B}g=B∑i=1Bgi=B∑i=M+1Bgi。但前MMM个样本无法用于梯度估计,其梯度贡献为零。因此精度更高的梯度估计方法(AGE)可写作:
g^=∑i=M+1BgiB−M=g⋅BB−M=αg,α=BB−M \hat{g} = \frac{\sum_{i=M+1}^{B} g_i}{B - M} = g \cdot \frac{B}{B - M} = \alpha g,\quad \alpha = \frac{B}{B - M} g^=B−M∑i=M+1Bgi=g⋅B−MB=αg,α=B−MB
其中 α=BB−M\alpha = \frac{B}{B-M}α=B−MB 是一个梯度缩放系数。在多卡训练中,为了避免跨 GPU 收集非零梯度带来的巨大通信开销,GPG 巧妙地通过乘以动态的 α\alphaα 系数实现了等价的梯度修正。最终目标函数变为:J^GPG(θ)=αJGPG(θ)\hat{J}_{GPG}(\theta) = \alpha J_{GPG}(\theta)J^GPG(θ)=αJGPG(θ)。
若采用:舍弃M组梯度为0的样本,并重新采样输出结果,直至M值归零,此时将α取值设为1。但该配置的训练效率较低,原因在于整体训练时长由采集目标样本耗时最久的工作单元决定。因此,文中提出了如下方法:
阈值机制与重采样。针对有效样本占比设置阈值βth=1αth\beta_{\text{th}} = \dfrac{1}{\alpha_{\text{th}}}βth=αth1,当有效样本的比例 1α<βth\frac{1}{\alpha} < \beta_{th}α1<βth 时,不再直接使用当前 batch 更新,而是将当前的有效样本累积到下一个重采样的 batch 中,直到有效样本比例超过阈值。这既保证了无偏估计,又有效控制了方差。
三、实验
- 单模态数学推理:无论1.5B模型还是7B模型,GPG都相比其他方法有显著优势。
- 多模态任务:在视觉推理(CV-Bench)、几何推理(GEOQA)、图像分类和推理定位(LISA)任务上,GPG 全面超越 GRPO,例如在 CV-Bench 上提升 16.68%,在分类任务上平均提升 7.1%。
更多推荐

所有评论(0)