Group Sequence Policy Optimization
·
论文原址
https://arxiv.org/pdf/2507.18071
研究背景与动机
- 强化学习已成为提升语言模型能力的关键范式,但现有算法(如 GRPO)在训练大型模型时存在稳定性问题,常导致模型崩溃。
- GRPO 的问题源于其在重要性采样权重应用上的缺陷:采用 token 级别的重要性权重,因依赖单一样本而无法有效修正分布不匹配,引入高方差噪声,且随序列长度增加累积,最终引发模型崩溃。
GSPO 的核心创新
- 基于序列似然定义重要性比率,符合重要性采样的基本原理,使序列级别的奖励与优化相匹配。
- 采用序列级别的裁剪、奖励机制和优化目标,避免了 token 级别处理带来的不稳定性;通过对序列重要性比率进行长度归一化,减少方差并控制数值范围。
- 衍生出 GSPO-token 变体,支持 token 级别的优势调整,适用于多轮 RL 等场景。
实验结果与优势
- 相比 GRPO,GSPO 在训练稳定性、效率和性能上表现更优,能通过增加计算量、更新查询集和延长生成长度持续提升性能。
- 解决了混合专家(MoE)模型 RL 训练的稳定性问题,无需复杂的路由重放(Routing Replay)策略,简化了训练流程并释放模型全部能力。
- 降低了对训练与推理引擎精度差异的敏感性,可直接使用推理引擎返回的似然值进行优化,有利于简化 RL 基础设施。
实验验证


- 训练曲线:GSPO在MoE模型(Qwen3-30B-A3B-Base)训练中保持稳定上升,GRPO依赖Routing Replay才可收敛。
- 剪裁效率:GSPO剪裁比例比GRPO高两个量级,但梯度估计更高效,验证序列级优化的噪声抑制能力。
- 基准性能:在代码生成(CodeForces Elo评分)和数学推理(AIME’24)任务中,GSPO模型表现持续提升。
应用价值
GSPO 为大型语言模型的大规模 RL 训练提供了稳健且可扩展的算法基础,助力最新 Qwen3 模型实现显著性能提升,推动语言模型能力的持续进步。
- MoE模型训练:消除专家路由波动影响,支持更深层稀疏模型的高效RL训练。
- 基础设施简化:兼容训练/推理引擎的精度差异,可直接使用推理引擎生成的概率,降低重计算开销。
结论与展望
- GSPO为大规模RL训练提供可扩展且稳定的算法基础,已成功应用于Qwen3系列模型性能提升。
- 未来方向包括长序列任务优化和训练-推理架构解耦,进一步释放RL算力投入的潜力。
更多推荐


所有评论(0)