论文原址
https://arxiv.org/pdf/2507.18071

研究背景与动机

  • 强化学习已成为提升语言模型能力的关键范式,但现有算法(如 GRPO)在训练大型模型时存在稳定性问题,常导致模型崩溃。
  • GRPO 的问题源于其在重要性采样权重应用上的缺陷:采用 token 级别的重要性权重,因依赖单一样本而无法有效修正分布不匹配,引入高方差噪声,且随序列长度增加累积,最终引发模型崩溃。

GSPO 的核心创新

  • 基于序列似然定义重要性比率,符合重要性采样的基本原理,使序列级别的奖励与优化相匹配。
  • 采用序列级别的裁剪、奖励机制和优化目标,避免了 token 级别处理带来的不稳定性;通过对序列重要性比率进行长度归一化,减少方差并控制数值范围。
  • 衍生出 GSPO-token 变体,支持 token 级别的优势调整,适用于多轮 RL 等场景。

实验结果与优势

  • 相比 GRPO,GSPO 在训练稳定性、效率和性能上表现更优,能通过增加计算量、更新查询集和延长生成长度持续提升性能。
  • 解决了混合专家(MoE)模型 RL 训练的稳定性问题,无需复杂的路由重放(Routing Replay)策略,简化了训练流程并释放模型全部能力。
  • 降低了对训练与推理引擎精度差异的敏感性,可直接使用推理引擎返回的似然值进行优化,有利于简化 RL 基础设施。

实验验证

在这里插入图片描述
在这里插入图片描述

  • 训练曲线:GSPO在MoE模型(Qwen3-30B-A3B-Base)训练中保持稳定上升,GRPO依赖Routing Replay才可收敛。
  • 剪裁效率:GSPO剪裁比例比GRPO高两个量级,但梯度估计更高效,验证序列级优化的噪声抑制能力。
  • 基准性能:在代码生成(CodeForces Elo评分)和数学推理(AIME’24)任务中,GSPO模型表现持续提升。

应用价值

GSPO 为大型语言模型的大规模 RL 训练提供了稳健且可扩展的算法基础,助力最新 Qwen3 模型实现显著性能提升,推动语言模型能力的持续进步。

  • MoE模型训练:消除专家路由波动影响,支持更深层稀疏模型的高效RL训练。
  • 基础设施简化:兼容训练/推理引擎的精度差异,可直接使用推理引擎生成的概率,降低重计算开销。

结论与展望

  • GSPO为大规模RL训练提供可扩展且稳定的算法基础,已成功应用于Qwen3系列模型性能提升。
  • 未来方向包括长序列任务优化和训练-推理架构解耦,进一步释放RL算力投入的潜力。
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐