img

导读

强化学习(RL)在大语言模型(LLMs)中的近期成功,如Kimi-K1.5和DeepSeek-R1,显示了其在激发模型长链推理能力方面的潜力,使大语言模型能够处理复杂任务,如数学和科学推理。这些进展的核心设计(例如,Deepseek-R1中的广义近端策略优化(GRPO))在于无需奖励模型的在线强化学习,它鼓励大语言模型生成一组推理路径,并通过基于规则的奖励函数的组相对优势估计机制迭代改进其推理过程。通常,采用一种简单的奖励策略:导致正确答案的推理路径获得更高的奖励,而导致错误答案的推理路径获得较低的奖励,其中模型通过从奖励中估计的组相对优势进行优化。

简介

在这项工作中,我们旨在通过强化学习(RL)激发多模态大语言模型(MLLMs)的推理能力,并开发一种有效的方法来缓解强化学习过程中的稀疏奖励和优势消失问题。为此,我们提出了共享广义近端策略优化(Share-GRPO),这是一种新颖的强化学习方法,通过在扩展的问题空间中探索和共享多样化的推理轨迹来解决这些问题。具体来说,Share-GRPO首先通过数据转换技术为给定问题扩展问题空间,然后鼓励多模态大语言模型在扩展的问题空间中有效探索多样化的推理轨迹,并在强化学习过程中在扩展的问题之间共享发现的推理轨迹。此外,Share-GRPO还在优势计算过程中共享奖励信息,该信息在问题变体之间和内部进行分层估计解决方案优势,从而能够更准确地估计相对优势并提高策略训练的稳定性。在六个广泛使用的推理基准上的大量评估展示了我们方法的优越性能。

方法与模型

本节首先介绍组相对策略优化(GRPO)的基础知识,然后介绍我们提出的Share - GRPO,该方法将信息共享的概念引入多模态大语言模型强化学习中。后续小节将详细阐述更多细节。

1. 基础知识

组相对策略优化(Group Relative Policy Optimization,GRPO)。GRPO [3] 是近端策略优化(Proximal Policy Optimization,PPO) [47] 的一种变体,旨在提升大语言模型在复杂推理任务(如数学和科学推理)上的性能。从一个待优化的预训练多模态大语言模型开始,GRPO首先用它初始化一个策略模型 和一个参考模型 。对于给定的图像 - 文本对 (I, T),参考策略模型 生成一组响应 。然后,基于组的奖励函数计算相应的奖励 ,这些奖励随后用于估计每个响应相对于组的优势 :

与PPO类似,GRPO采用带有KL惩罚项的裁剪目标函数:

奖励稀疏和优势消失问题。尽管GRPO有效,但在应用于多模态大语言模型时,通常面临两个挑战:奖励稀疏问题和优势消失问题。奖励稀疏是由于当前多模态大语言模型的推理能力有限,只有少数推理路径能获得正奖励,导致探索效率低下和训练不稳定。为缓解这一问题,如R1 - VL [4] 等先前工作引入了逐步奖励信号,在整个推理过程中提供密集奖励。优势消失问题发生在多模态大语言模型针对同一问题生成同质响应并获得相同奖励时,导致相对优势降为零,从而使强化学习无效。为解决这一问题,VL - Rethinker [6] 和Skywork R1 [48] 选择优势值较大的样本并在强化学习过程中重复使用,而MM - Eureka [5] 采用在线过滤策略去除优势为零的样本。与先前工作不同,我们的Share - GRPO通过在扩展的问题空间中探索和共享多样化的推理轨迹,有效解决了这两个挑战,从而促进奖励多样性和稳定的策略优化。

2. 共享广义近端优化(Share-GRPO)

我们提出了共享广义近端优化(Share-GRPO),这是一种新颖的在线多模态大语言模型(MLLM)强化学习框架,它通过在扩展的问题空间中探索和共享多样化的推理轨迹,缓解了稀疏奖励和优势消失的问题。具体来说,对于给定的问题,Share-GRPO首先应用语义一致的转换来生成一组不同但语义等价的问题,从而扩展问题空间。然后,它鼓励MLLM在扩展的问题空间中探索多样化的推理路径,并在强化学习过程中促进在扩展的问题之间共享已发现的推理轨迹及其奖励,如图2所示。

img

图2:所提出的共享广义近端优化(Share-GRPO)的概述。对于给定的问题,Share-GRPO首先应用语义一致的转换来生成一组不同但语义等价的问题,从而扩展问题空间。然后,它鼓励MLLM在扩展的问题空间中探索多样化的推理路径,并在强化学习过程中促进在扩展的问题之间共享已发现的推理轨迹及其奖励。

2.1. 推理空间扩展

问题空间扩展。为了扩展给定问题的问题空间,我们引入了语义一致转换(SCT),它为每个给定问题 生成一组问题变体 。具体来说,我们提出了两种类型的转换技术,即离线文本语义一致转换和在线多模态语义一致转换,以实现更多样化、全面和灵活的问题空间扩展。

(1) 离线文本语义一致转换。在在线强化学习之前,我们首先使用离线文本语义一致转换 来重写每个给定问题的文本提示 。具体来说,我们提示GPT - 4o生成 个语义一致的变体,从而得到一个扩展的问题集。生成的变体的文本提示在句法结构和词汇表达上与原始问题 不同,同时保留了原始意图和相应的正确答案:

(2) 在线多模态语义一致转换。在在线强化学习期间,我们引入了一种多模态语义一致转换策略,以动态地进一步扩展问题空间。对于输入问题中的图像 ,我们应用视觉转换 来改变其视觉内容。具体来说,我们仔细选择能够保留推理所需的关键视觉线索的转换(例如,旋转、噪声注入),并避免可能破坏关键信息的转换(例如,裁剪、颜色失真)。每个图像以概率 进行一次随机选择的转换。

此外,为了缓解视觉变化后视觉输入和文本输入之间可能存在的语义不一致,我们执行手动文本转换 ,即在相应的文本提示中添加特定于转换的提示,以提供与视觉修改一致的上下文指导:

解决方案空间扩展。通过扩展的问题空间 ,Share-GRPO能够在扩大的解决方案空间中为每个给定问题探索多样化的推理轨迹。具体来说,对于每个问题 ,策略模型 生成 个候选推理响应,从而得到一个扩展的响应集: 。

2.2 共享优势估计

通过扩展的推理空间,Share-GRPO在优势计算期间共享奖励信息,该信息在问题变体之间和内部分层估计推理轨迹优势。

遵循GRPO [3]的方法,我们采用基于规则的奖励函数来计算每个生成的推理轨迹的奖励,即 。具体而言,我们采用结果级别的准确率奖励,该奖励会给导向正确答案的推理路径分配更高的奖励,而给导向错误答案的推理路径分配较低的奖励。此外,我们还采用了一种格式奖励,鼓励推理轨迹在给出最终答案之前遵循详细的逐步推理过程。

利用计算得到的奖励 ,我们提出了一种分层优势估计方法,该方法在两个层面上计算优势:全局层面,它聚合同一原始问题的所有变体的响应;局部层面,它考虑从每个单独的问题变体生成的响应。

(1) 全局层面的优势估计。我们首先从全局视角估计优势,其中相对优势是使用从所有问题变体 获得的奖励来计算的。

(2) 局部层面的优势估计。我们还在局部层面估计优势,其中相对优势是在从每个单独的问题变体 生成的响应中计算的。具体而言,对于每个问题变体 ,局部优势的估计如下:

通过公式5和6估计出全局层面的优势和局部层面的优势后,我们可以得到最终的优势如下:

其中,局部优势 仅在响应是从同一问题变体生成时计算,即当 时。通过纳入分层优势估计,Share - GRPO实现了更准确的相对优势计算,从而实现更稳定、有效的策略训练。

2.3 共享策略优化

借助扩展的推理空间和共享的优势估计,Share - GRPO能够探索和共享多样化的推理轨迹,并能为每个给定问题进行更准确的优势估计。然后,我们通过在问题变体 之间共享多样化的推理轨迹 来优化策略模型 :

实验与结果

在本节中,我们首先在4.1节提供实现细节,然后在4.2节展示主要结果,以证明Share - GRPO的有效性。在4.3节,我们进行全面的消融研究,以检验Share - GRPO中每个设计的影响。4.4节对Share - GRPO进行更多的讨论和分析。后续小节将详细阐述更多细节。

1. 实现细节

在这项工作中,我们采用Qwen2.5-VL-7B和Qwen2.5-VL-32B [49]作为基础模型。对于训练数据,我们从MM-Eureka [5]中随机采样 多模态数据。模型优化使用EasyR1 [50]代码库进行,7B模型在8块NVIDIA H100 GPU上训练,32B模型在32块H100 GPU上训练。对于滚动参数,我们使用问题变体 为2,每个问题的采样数量 为6,概率 为0.3。对于与强化学习相关的超参数,我们使用全局批量大小为128,滚动批量大小为512,滚动温度为0.7,学习率为 。

2. 主要结果

为了全面检验我们提出的Share-GRPO的有效性,我们在不同规模(即7B和32B)的模型上进行了实验。值得注意的是,与先前的研究[4, 33, 30]不同,我们不涉及额外的有监督微调冷启动阶段。如表1所示,我们在6个广泛使用且具有挑战性的基准测试中与最先进的模型进行了广泛比较,涵盖了从专业领域到通用推理的各种推理任务。基准测试的详细描述可在附录中找到。

img

与基线模型的比较。我们首先将通过Share-GRPO训练的R1-ShareVL 7B和R1-ShareVL 32B与相应的基础模型,即Qwen2.5-VL-7B和Qwen2.5-VL-32B进行比较。如表1所示,Share-GRPO显著提高了多模态大语言模型(MLLMs)的长链推理能力。例如,在像MathVista和MathVerse这样具有挑战性的数学基准测试中,R1-ShareVL-7B分别实现了+7.2%和+3.6%的提升。值得注意的是,根据先前的研究,强化学习可以提高MLLMs在数学任务上的长链推理能力,但这通常会以多学科和通用基准测试性能下降为代价。例如,ThinkLite-7B在MMStar和MMMU上分别下降了-0.2%和-5.5%。相比之下,我们的R1-ShareVL-7B模型在MMStar上实现了+3.1%的提升,在MMMU上达到了相当的准确率,证明了Share-GRPO在增强跨不同任务推理方面的泛化能力。当我们将方法扩展到具有更强基础能力的更大模型(即Qwen2.5-VL-32B)时,我们的方法仍然稳健,并持续提高性能。特别是,R1-ShareVL-32B在MathVerse上比基线模型提高了+9.1%,平均性能提升了+2.7%。

与通过强化学习训练的MLLMs的比较。然后,我们将R1-ShareVL与其他通过强化学习方法训练的最先进的MLLMs进行比较。我们使用相同基础模型且训练数据更少的R1-ShareVL-7B优于MM-Eureka-7B,平均性能提升了+2.1%,特别是在MathVista上有显著的+1.4%的提升。值得注意的是,除了在长链数学推理方面的能力外,R1-ShareVL在多学科和通用推理任务上也表现出更强的推理泛化能力。具体来说,与同样在数学推理方面表现出色的ThinkLite-7B相比,R1-ShareVL在多学科基准测试MMMU和通用基准测试MMStar上表现更好,分别比其高出+5.0%和+3.3%。此外,在更大的模型上也可以观察到类似的结论:与MM-Eureka-32B相比,我们的R1-ShareVL 32B进一步将整体性能提高了+3.4%,证明了Share-GRPO的有效性和泛化能力。

3. 消融实验

共享广义强化策略优化(Share-GRPO)的消融研究。如表2所示,我们进行了消融研究,以考察共享广义强化策略优化(Share-GRPO)中每个设计的单独贡献,包括共享策略优化(即离线和在线语义一致转换)和共享优势估计(即全局和局部优势估计)。与广义强化策略优化(GRPO)基线相比,仅在离线问题变体之间进行信息共享并结合全局共享优势估计,性能提升了 。进一步在在线多模态语义一致转换之间进行信息共享,能够探索和共享更多样化的推理路径,性能提高了0.9%。最后,同时启用全局和局部优势估计,在数学视觉数据集(MathVista)上取得了 的最佳结果,凸显了分层优势计算的有效性。这些结果表明,策略共享和优势共享对共享广义强化策略优化(Share-GRPO)的最终性能都有显著贡献。

img

4. 讨论

共享广义相对策略优化(Share-GRPO)与动态采样的互补性。我们将共享广义相对策略优化(Share-GRPO)与动态采样 [58] 进行比较,并进一步探讨它们的互补性,如表 3 所示。动态采样执行多次滚动以生成候选响应,从中选择具有有效奖励的子集来更新策略。与动态采样不同,共享广义相对策略优化(Share-GRPO)增强了推理响应的多样性,并在策略优化期间共享这些响应,从而产生更丰富的奖励信号。平均而言,结合动态采样的广义相对策略优化(GRPO)的性能达到 65.1%,而共享广义相对策略优化(Share-GRPO)的得分更高,达到 ,这表明利用不同的推理路径来丰富奖励反馈和增强策略学习的潜力。此外,将共享广义相对策略优化(Share-GRPO)与动态采样相结合,平均准确率更高,达到 ,凸显了共享广义相对策略优化(Share-GRPO)的强大互补性。

共享广义策略优化(Share GRPO)的超参数研究。我们在表4中研究了语义一致变换(SCT)中问题变体数量 的影响,每个问题的回复数量固定为6。当 时,共享广义策略优化(Share-GRPO)在数学视觉数据集(MathVista)上的准确率达到75.4%,显著优于基线广义策略优化(GRPO)。当 增加到4时,使用共享广义策略优化(Share-GRPO)训练的模型性能进一步提升,这表明增加问题变体数量是有益的。

img

采样数量N的影响。在表5中,我们将不同采样数量 的广义策略优化(GRPO)与共享广义策略优化(Share-GRPO)的性能进行了比较。我们观察到,当 时,训练的模型

<img src="https://cdn.noedgeai.com/01970802-ff57-73d9-9bd1-9da659954a5e_8.jpg?x=281&y=283&w=1079&h=488&r=0"/>

图3:R1-共享视觉语言模型(R1-ShareVL)在数学问题上推理能力的定性结果。

在MathVista数据集上,使用广义近端策略优化(GRPO)方法取得了72.3%的得分。随着采样数量的增加,在 处性能提升至72.8%。然而,进一步将采样数量 增加到24时,仅带来了0.2%的微小提升,同时还引入了额外的计算开销。因此,增加采样数量会遇到性能瓶颈,使其无法有效进一步提升推理强化学习的效果。与单纯增加 不同,共享广义近端策略优化(Share - GRPO)方法增强了推理路径的多样性,并利用信息共享的概念来放大奖励信号,提高训练的稳定性。通过共享回答并引入分层优势估计,我们的R1 - ShareVL 7B模型在每个问题仅生成6个回答的情况下,就取得了75.4%的得分,甚至超过了采样24个回答的GRPO方法的性能。

5. 定性结果

图3表明,共享广义近端策略优化(Share - GRPO)方法能有效提升模型解决复杂数学问题的推理能力。在这个示例中,模型准确解读了问题并得出了正确答案,在符号推理和函数分析方面表现出色。这凸显了Share - GRPO方法能够引导模型在数学要求较高的任务中找到精确且连贯的解决方案。

img

结论

在本文中,我们提出了共享广义近端策略优化(Share - GRPO),这是一种用于多模态大语言模型(MLLMs)的新型强化学习框架,该框架引入了信息共享的概念,有效缓解了稀疏奖励和优势消失的问题。Share - GRPO通过生成语义一致的变体来扩展问题空间,并鼓励MLLMs在更多样化的解决方案空间中探索和共享回答。此外,Share - GRPO在全局和局部层面上对问题变体内部和之间的优势进行分层估计,以有效引导优化过程。我们进行了广泛的实验、消融研究和讨论,结果表明我们提出的方法在各种推理基准测试中具有优越性。

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范

第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署

第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建

第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。

如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐