Lei Chen 1{ }^{1}1 Xuanle Zhao 2{ }^{2}2 Zhixiong Zeng 1†{ }^{1 \dagger}1 Jing Huang 1{ }^{1}1 Yufeng Zhong 1{ }^{1}1 Lin Ma 1∗{ }^{1 *}1
1{ }^{1}1 美团 2{ }^{2}2 中国科学院自动化研究所
leichen1997@outlook.com zengzhixiong@meituan.com forest.linma@gmail.com

摘要

近期,受OpenAI-o1/o3和Deepseek-R1的启发,基于强化学习微调的R1-Style方法在社区中获得了广泛关注。以往的R1-Style方法主要集中在数学推理和代码智能领域。验证其在更通用的多模态数据上的优势具有重要的研究意义。图表是一种信息丰富的多模态数据类型,为复杂推理带来了重要的研究挑战。在本工作中,我们引入了Chart-R1,这是一种通过强化学习微调来实现复杂图表推理的图表领域视觉-语言模型。为了支持Chart-R1,我们首先提出了一种新颖的程序化数据合成技术,生成高质量的逐步图表推理数据,涵盖单一图表和多子图表,弥补了图表领域推理数据的不足。然后我们开发了两阶段训练策略:Chart-COT(逐步思维链监督)和Chart-RFT(数值敏感强化微调)。Chart-COT旨在通过逐步监督将复杂的图表推理任务分解为细粒度、可理解的子任务,从而为提高强化学习的推理水平奠定良好基础。Chart-RFT利用典型的组相对策略优化策略,其中采用相对温和的奖励来响应数值,强调图表领域中的数值敏感性。我们在开源基准和自建的图表推理数据集(即ChartRQA)上进行了广泛的实验。实验结果表明,Chart-R1相比图表领域的方法具有显著优势,甚至可与开源/闭源的大规模模型(例如GPT-4o、Claude-3.5)相媲美。我们的代码和数据集将在https://github.com/DocTron-hub/Chart-R1上提供。

1 引言

近期,受OpenAI的o1/o3 OpenAI [2025]和DeepSeek-R1 Guo et al. [2025]的成功启发,利用强化学习(RL)进行微调在研究社区中引起了广泛关注。尽管这些方法在文本领域如数学推理、代码生成和跨学科知识方面显示出潜力,但将这些高级推理能力转移到视觉领域仍然是一个开放性挑战。虽然最近的方法如Vision-R1 Huang et al. [2025]和VLM-R1 Shen et al. [2025]已成功利用RL来增强视觉感知和基础,但它们主要关注于简单问题,忽略了需要深度推理能力的任务。

图表作为信息密集型图像,是图像理解和推理研究的重要领域 Wang et al. [2024]。先前的研究通过监督微调(SFT)在增强图表感知和理解能力方面取得了进展,这些数据集通过思维链(CoT)或程序思维(PoT)方法进行增强 Wei et al. (2022); Chen et al. (2022)。SFT的一个关键限制在于它会导致模型过度拟合特定的推理模式,阻碍其泛化能力。继DeepSeek R1之后,最近的方法 Jia et al. (2025); Ni et al. (2025) 利用RL来增强VLM的推理能力。然而,这些努力的范围主要局限于视觉感知和理解,而不是深度图表分析所需的复杂推理。

在本工作中,我们提出了Chart-R1,这是一种图表领域的VLM,利用RL来增强复杂推理能力。为此,我们引入了两个关键贡献。首先,我们提出了一种新颖的程序化合成策略,以生成高质量的推理数据。其次,我们引入了一种有效的两阶段训练策略,显著增强了推理能力。具体而言,为了支持Chart-R1训练,我们首先通过程序化合成方法生成复杂的图表推理数据。我们利用LLM生成图表绘制代码,然后使用生成的代码制定复杂问题、多步骤CoT推理过程和最终答案。为此,我们构建了ChartRQA,这是一个包含258k个多步骤推理样本的复杂推理数据集,涵盖单一图表和多图表任务。为了确保图表数据的保真度,我们从arXiv论文中整理了真实世界表格作为数据源。ChartReasoner Jia et al. (2025) 提出将图表转换为代码以生成推理数据。然而,其依赖于有损解析过程,直接限制了最终推理数据的范围和多样性。Chart-R1的训练分为两个阶段:Chart-COT(逐步思维链监督)和Chart-RFT(数值敏感强化微调)。在初始的Chart-COT阶段,模型通过在逐步推理数据上进行SFT微调,建立其将复杂任务分解为细粒度子任务的核心能力。在Chart-RFT阶段,我们利用组相对策略优化(GRPO)策略,其中奖励信号是软匹配和编辑距离的组合。这种设计特别针对并增强了数值和字符串答案的准确性。值得注意的是,这两个阶段使用了不同的数据集,基于我们发现,在相同数据上训练会损害模型在RL过程中的探索能力。此外,我们引入了一个人工验证的基准,ChartRQA,以评估复杂图表推理的边界。与以往的工作 Xia et al. (2024); Wang et al. (2024) 不同,其问题具有更高的复杂度,需要多步骤的思考过程。现有VLM在ChartRQA上的显著性能下降暴露了其图表推理能力的关键限制。

总之,我们的贡献如下:

  • 我们提出了一种新颖的两阶段训练策略,包括Chart-COT和Chart-RFT,以增强VLM的图表推理能力。通过这种策略训练的模型Chart-R1在各种图表理解和推理基准上建立了新的SOTA。
    • 我们引入了一种程序化数据合成策略,利用代码作为关键起点来生成逐步推理数据。数据源基于arXiv论文中的真实世界表格,确保了生成图表的高保真度。
    • 我们引入了ChartRQA,一个用于复杂图表推理的综合数据集,包括一个人工验证的基准和一个大规模训练数据集。现有VLM在ChartRQA基准上的显著性能下降暴露了其图表推理能力的关键限制。
  • 我们进行了一系列全面的实验,系统评估了各种设置的影响。我们的发现提供了有价值的见解,并为未来该领域的研究提供了明确的指导。

2 相关工作

2.1 图表 VLM

图表理解和推理是研究社区的重要领域,涵盖低级和高级任务 Singh et al. [2019], Methani et al. [2020]。最近,许多图表领域的模型被提出以增强VLM的图表理解能力 Han et al. [2023], Liu et al. [2023]。然而,以往的工作集中在描述性任务 Masry et al. [2024a,b],例如从图表中提取显式内容 Masry et al. [2022]。相比之下,最近的工作则集中在利用VLM的推理能力来解释图表中的复杂和隐含信息。例如,TinyChart Zhang et al. [2024] 使用基于模板的方法生成程序思维(PoT)Chen et al. [2022] 的推理数据。ChartCoder Zhao et al. [2025b] 提出了思维片段以增强图表到代码的生成。ChartReasoner Jia et al. [2025] 利用图表到代码模型将图表图像转换为代码,并基于代码生成推理过程。然而,生成的推理数据由于图表到代码的准确性 Shi et al. [2024], Xu et al. [2024] 存在局限性。

2.2 长推理 VLM

最近,随着 DeepSeek-R1 Guo et al. [2025] 的成功,许多工作尝试通过基于规则的奖励和 RL 来增强 LLM 的推理能力 Shao et al. [2024]。在视觉-语言领域,最近的工作遵循 DeepSeek-R1 方法来增强 VLM 的长链推理能力 Shen et al. [2025], Wang et al. [2025]。例如,Vision-R1 Huang et al. [2025] 和 R1-OneVision Yang et al. [2025] 应用组相对策略优化 (GRPO) 和多模态推理数据,使 VLM 能够进行长推理。MMEureka Meng et al. [2025] 和 R1-Zero Liu et al. [2025] 通过改进的 RL 训练策略进一步推进了视觉长期推理。Point-RFT Ni et al. [2025] 利用基于基础的 CoT 推理进行视觉理解,但仅使用 ChartQA 进行 RL,限制了最终模型的推理能力。

2.3 图表理解和推理

为了改进 VLM 在图表相关任务上的性能,已经开发了各种训练数据集和评估基准 Xia et al. [2024], Shi et al. [2024], Zhao et al. [2025a], Wu et al. [2025]。以往的工作通常集中在描述任务上,例如 ChartQA Masry et al. [2022], PlotQA Methani et al. [2020] 和 Chart-to-text Kantharaj et al. [2022] 主要训练和评估模型从图表中提取信息的能力。尽管存在许多相关工作,但描述任务的挑战主要由图表复杂性驱动。最近的工作如 Charxiv Wang et al. [2024] 和 CharMuseum Tang et al. [2025] 引入了更具挑战性的推理任务,要求模型在回答之前进行思考。与描述性任务不同,推理任务呈现出双重挑战,既来自图表的感知复杂性,也来自问题所需的推理深度。

3 方法

为了增强模型在图表推理任务中的推理能力,我们引入了我们提出的数据合成和两阶段训练策略。我们首先程序化生成一个大规模的训练数据集,包含 CoT 推理过程,随后在 CoT 数据上进行 SFT 作为冷启动阶段,以启动后续的 RL 策略进行训练。
表 1:我们提出的 ChartRQA 训练集与其他图表数据集的比较。ChartRQA 特征包括单/多图表的整合、思考过程和可验证的答案格式。

数据集 类型 唯一图表 多图表 思考过程
ChartQA Masry et al. (2022) 3 21.9k x\boldsymbol{x}x x\boldsymbol{x}x
MMC Liu et al. (2023) 7 600k ✓\boldsymbol{\checkmark} x\boldsymbol{x}x
ChartLlama Han et al. (2023) 10 11k x\boldsymbol{x}x x\boldsymbol{x}x
NovaChart Hu et al. (2024) 18 47k x\boldsymbol{x}x ✓\boldsymbol{\checkmark}
ChartRQA (Ours) 24 93.3k ✓\boldsymbol{\checkmark} ✓\boldsymbol{\checkmark}

3.1 程序化数据合成

尽管已经提出了几个用于图表推理的CoT数据集,但它们大多是ChartQA数据集的衍生品,通过在现有问答对中添加生成的推理过程构建 Zhang et al. (2024); Jia et al. (2025)。然而,这种方法类似于从SOTA VLM中蒸馏推理过程,这是有问题的,因为这些模型在复杂任务上的失败本质上限制了生成数据的质量。生成高质量的CoT推理数据是一个公认的重大挑战,主要是因为当前的方法仅使用最终答案的正确性作为唯一的监督信号。这个问题在复杂图表推理领域尤为突出,因为现有模型已经表现出显著的局限性。因此,通过这种方法生成的数据本质上存在低质量和多样性不足的问题。尽管最近的ChartReasoner方法 Jia et al. (2025) 通过首先将图表解析为代码来生成推理数据,但生成数据的多样性和质量从根本上受到图表到代码解析器性能的限制。相比之下,我们的程序化数据生成策略逆转了这一范式,利用代码作为关键的起始源。首先,我们提示强大的LLM生成Matplotlib绘图代码以渲染高质量和多样化的图表图像。然而,我们的分析显示,直接在绘图代码中生成合成数据值往往会产生单调的趋势,缺乏复杂性和多样性。为了解决这个问题,我们首先从现实世界中的arXiv论文中整理表格,这些表格作为真实的数据源。其次,为了增强生成代码的多样性,我们手动编写了不同图表类型的种子代码示例。为了确保生成代码的多样性,我们随机组合整理的表格和种子代码作为LLM的上下文学习源,生成绘图代码。为了生成复杂的多图表场景,我们在种子代码中包含大量多图表示例,并在生成过程中明确提示LLM使用plt.subplots()函数创建复合图形。我们的工作显著扩展了可用于图表推理的图表类型,代表了最多样化的数据集。我们执行所有生成的代码样本并丢弃任何无法成功运行的样本。

推理数据生成 以可执行的绘图代码为基础,我们提示LLM合成一个完整的推理实例,包括一个问题、其答案和一个逐步推理路径。为了增加多样性,我们将绘图代码分为单图表和多图表,并使用不同的指令生成实例。特别是对于多图表问题,我们提示LLM生成需要在子图表之间交叉引用信息的问题。结果表明,这种策略显著增强了多图表任务的复杂性。我们的结果表明,与仅使用图表图像的方法相比,基于代码的方法使LLM能够生成更复杂的问题和详细的推理。我们推测,基于代码的方法在生成复杂图表推理方面具有优势,因为底层代码提供了细节的无损文本表示,同时能够独立于现有语料库合成新的数据。我们过滤掉不符合思考和回答格式的数据样本以及有缺陷的图表图像。

数据集构建 利用上述方法,我们构建了ChartRQA,一个包含258k个实例的综合性图表推理语料库,包括推理路径以及人工验证的基准。训练数据集分为两个子集,用于我们的两阶段训练策略,即ChartRQA-SFT和ChartRQA-RL,分别包含228k和30k个样本。关于ChartRQA与其他图表领域训练集的详细比较见表1。该基准通过人工验证构建,专家审查每个样本的问题难度和答案正确性,随后构建1702个高质量样本(933个单图表和769个多图表任务)用于评估。如表2所示,我们还计算了训练和测试集中问题、推理路径和最终答案的平均标记数,按单图表和多图表问题分别统计。分析表明,与多图表问题相关的组件显著长于单图表问题。此外,训练集和测试集之间的分布是平衡的。图2展示了我们生成的ChartRQA示例。

质量评估 为了评估我们生成数据的质量,我们随机抽取1k个实例并邀请人类专家进行评估。结果表明,超过85%的实例没有错误。值得注意的是,我们故意省略了任何数据清洗过程。事实证明,我们的模型Chart-R1即使在这些原始、未整理的数据集上训练也能表现出强大的性能,这验证了我们提出的基于代码的生成策略的鲁棒性。

3.2 Chart-COT

为了增强图表推理能力,我们提出了一种两阶段训练策略。以Qwen2.5VL-7B-Instruct作为基线模型,我们首先在其上进行我们提出的ChartRQA-SFT的SFT。具体而言,基线模型首先在我们生成的逐步推理数据上进行SFT,这作为代码启动阶段,使模型具备将复杂任务分解为细粒度子任务的基本能力。我们的消融研究表明,初步的SFT阶段对于CoT数据至关重要,因为其性能显著优于从头开始应用RL。

我们使用标准的自回归语言建模目标训练模型。损失函数是目标序列的负对数似然:

L(θ):=−E(x,y)∼DCoT∑t=1Tlog⁡P(yt∣x,y<t;θ),\mathcal{L}(\theta):=-\mathbb{E}_{(x,y)\sim\mathcal{D}_{\text{CoT}}}\sum_{t=1}^{T}\log P\left(y_{t}\mid x,y_{<t};\theta\right),L(θ):=E(x,y)DCoTt=1TlogP(ytx,y<t;θ), (1)

其中(x,y)(x,y)(x,y)是查询和目标响应,包含推理过程。

3.3 Chart-RFT

在Chart-COT阶段之后,尽管微调后的模型在分解复杂问题方面表现出增强的能力,但其在域外(OOD)任务上的性能明显下降。我们假设这是由于ChartRQA-SFT与一些简单图表理解任务之间的分布不匹配,损害了其泛化能力。为了解决泛化能力的下降,我们随后应用强化微调(RFT)来泛化其推理能力。

组相对策略优化 继最近的推理工作 Guo et al. (2025) 之后,我们采用组相对策略优化(GRPO)Shao et al. (2024) 算法进行RFT。GRPO省略了评论家模型,而是从组得分中估计基线,显著减少了训练资源。对于每个输入(x,y)(x,y)(x,y),策略πθ\pi_{\theta}πθ采样一组GGG个候选响应{oi}i=1G\{o_{i}\}_{i=1}^{G}{oi}i=1G

JGRPO(θ)=E(x,y)∼DCoT,{oi}i=1G∼πθold(O∣x)[1G∑i=1Gmin⁡(πθ(oi∣x)πθold(oi∣x)Ai,\mathcal{J}_{GRPO}(\theta)=\mathbb{E}_{(x,y)\sim\mathcal{D}_{\text{CoT}},\{o_{i}\}_{i=1}^{G}\sim\pi_{\theta_{\text{old}}}(O|x)}\left[\frac{1}{G}\sum_{i=1}^{G}\min\left(\frac{\pi_{\theta}(o_{i} \mid x)}{\pi_{\theta_{\text{old}}}(o_{i} \mid x)}A_{i},\right.\right.JGRPO(θ)=E(x,y)DCoT,{oi}i=1Gπθold(Ox)[G1i=1Gmin(πθold(oix)πθ(oix)Ai,
clip⁡(πθ(oi∣x)πθold(oi∣x),1−ε,1+ε)Ai)−βDKL(πθ∥πSFT)]\left.\left.\operatorname{clip}\left(\frac{\pi_{\theta}\left(o_{i} \mid x\right)}{\pi_{\theta_{\text{old}}}(o_{i} \mid x)},1-\varepsilon, 1+\varepsilon\right) A_{i}\right)-\beta \mathbb{D}_{K L}\left(\pi_{\theta} \| \pi_{\mathrm{SFT}}\right)\right]clip(πθold(oix)πθ(oix),1ε,1+ε)Ai)βDKL(πθπSFT)]
外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

图2:我们提出的ChartRQA数据集的展示。ChartRQA包括需要逐步思考过程回答的单图表和多图表图像。

其中ε和β是超参数,π_SFT、π_θ和π_θ_ω分别是SFT后的模型、优化模型和旧策略模型。第i个响应的组归一化优势为:

Ai=ri−mean({r1,r2,…,rG})std({r1,r2,…,rG})A_i = \frac{r_i - \text{mean}\left(\left\{r_1, r_2, \dots, r_G\right\}\right)}{\text{std}\left(\left\{r_1, r_2, \dots, r_G\right\}\right)}Ai=std({r1,r2,,rG})rimean({r1,r2,,rG})

奖励设计 为了有效的RFT,我们遵循DeepSeek-R1 Shao et al. (2024) 并采用由准确性和格式奖励组成的基于规则的奖励。我们为图表问题引入了一个软准确性奖励,该奖励利用不同的函数分别评估数值和字符串任务。这允许根据预期答案类型进行更合适的评估。

  • 准确性奖励 我们采用不同的奖励函数来衡量模型输出的正确性,每个函数针对特定的答案类型。对于数值答案,我们采用 Point-RFT Ni et al. (2025) 中的软匹配技术,允许±5%的相对误差容忍度。对于基于字符串的答案,我们利用编辑距离作为奖励信号。
    • 格式奖励 格式奖励通过语法级正则表达式解析器确定。该解析器通过检查两个条件来验证输出的结构完整性:(1) 推理过程正确包含在和标签内,(2) 最终答案可以从指定的答案标签和中提取。
      数据比例 对于Chart-COT和Chart-RFT阶段,我们使用ChartRQA的不同子集。这一设置至关重要,因为我们的实验表明,使用相同的CoT数据进行两个阶段会导致模型过度拟合,复制SFT数据中的推理路径,从而降低RL阶段策略模型的多样性和探索能力。我们发现,Chart-RFT阶段的稳定性和收敛性关键取决于前一Chart-COT阶段数据的模式一致性。使用模式不一致的SFT数据显著阻碍RFT的收敛,强调了在Chart-COT阶段需要分布对齐的数据集以确保有效的下游RFT。
      表3:现有图表理解和推理基准的主要结果。我们提出的Chart-R1在评估基准上优于所有小规模VLMs(<20 B)。粗体表示开源VLM的最佳性能。
模型名称 ChartQA CharXiv-RQ ChartQAPro ChartRQA
(单 / 多)
专有
GPT-4o 85.7 47.1 37.67 44.37/46.5544.37 / 46.5544.37/46.55
Gemini-1.5-Flash 79.0 33.9 42.96 -
Gemini-1.5-Pro 87.2 43.3 - -
Gemini-2.5-Flash - - - 59.12/59.1759.12 / 59.1759.12/59.17
Claude-3.5-Sonnet 90.8 60.2 43.58 -
通用领域开源
InternVL3-8B 86.6 37.6 - -
InternVL3-38B 89.2 46.4 - -
Qwen2.5-VL-7B 87.3 42.5 36.61 44.59/40.5744.59 / 40.5744.59/40.57
图表领域
ChartLlama 69.66 14.2 - -
TinyChart 83.60 8.3 13.25 6.75/6.116.75 / 6.116.75/6.11
ChartGemma 80.16 12.5 6.84 -
ChartReasoner 86.93 - 39.97 -
Chart-R1-7B (Ours) 91.04\mathbf{9 1 . 0 4}91.04 46.2\mathbf{4 6 . 2}46.2 44.04\mathbf{4 4 . 0 4}44.04 52.09/49.93\mathbf{5 2 . 0 9 / 4 9 . 9 3}52.09/49.93

4 实验

4.1 实现细节

在数据生成方面,我们使用Gemini-2.5-Flash生成绘图代码和QA对。在训练阶段,我们的ChartRQA-SFT用于SFT,而ChartQA和ChartRQARL的组合用于GRPO。SFT阶段训练一个周期,批量大小为48,RL阶段训练3个周期,批量大小为128。最终的Chart-R1模型是通过对初始的SFT训练模型Chart-R1-SFT应用此RL过程获得的。对于这些各自阶段,学习率分别设置为1e−51 \mathrm{e}-51e51e−61 \mathrm{e}-61e6。最后,SFT和RL的训练过程分别需要大约3和30小时,在配备24 H 800 GPU的系统上。

4.2 实验设置

我们进行实验以评估从各种训练设置中获得的结果。首先,我们评估训练阶段和训练数据的范围,包括:(1) 使用CoT数据的SFT,(2) 直接RL与CoT-RL,以及(3) 使用和不使用ChartRQA数据的RL。

基准 为了全面评估我们提出的Chart-R1的理解和推理能力,我们选择ChartQA Masry et al. [2022],Chaxiv-RQ(推理问题)Wang et al. [2024],ChartQAPro Masry et al. [2025] 和我们提出的ChartRQA作为评估基准。

基线 我们将我们提出的Chart-R1与三种设置中的现有模型进行比较:(1) 专有模型包括GPT-4oOpenAI [2024],Gemini-1.5-(Flash, Pro)Team et al. [2023],Gemini-2.5Flash和Claude-3.5-SonnetAnthropic [2024]。(2) 通用领域开源VLM包括InternVL3(8B, 38B) Zhu et al. [2025],Qwen2.5-VL(7B) Bai et al. [2025]。(3) 图表领域VLM包括ChartLlama Han et al. [2023],TinyChart Zhang et al. [2024],ChartGemma Masry et al. [2024b] 和ChartResoner Jia et al. [2025]。

4.3 主要结果

表3显示了Chart-R1与其他基线模型的性能。结果表明,Chart-R1在小规模(<20 B)VLM中达到了最先进的性能,包括通用和图表领域模型在所有基准上的表现。特别是在ChartQA中,Chart-R1取得了最佳性能,即使与专有和大规模VLM相比也是如此。在图表推理基准中,Chart-R1在CharXiv-RQ、ChartQAPro和我们提出的ChartRQA上显著超越了现有的图表领域模型。由于Chart-R1的训练数据仅包含ChartRQA
表4:关于不同SFT和RL训练设置的消融研究。QA和RQA分别是ChartQA和ChartRQA的缩写。

模型名称 训练设置 ChartQA CharXiv-RQ ChartRQA(单 / 多)
SFT RL
Qwen2.5-VL-7B 87.3 42.5 44.59 / 40.57
Qwen2.5-VL-7B-SFT QA 86.16 36.0 24.76 / 18.34
Qwen2.5-VL-7B-RL RQARQARQA-SFT QAQAQA 89.32 42.1 37.73 / 36.15
QA+RQA−RLQA+RQA-RLQA+RQARL 90.28 45.2 44.16 / 40.44
QA+RQA−RLQA+RQA-RLQA+RQARL 91.04 46.2 52.09 / 49.93

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

图3:仅使用ChartQA数据集的RL阶段训练曲线。

和ChartQA,这些结果表明我们提出的ChartRQA数据集和CoT-RL训练策略的多样性。

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

图4:使用ChartQA和ChartRQA数据集的RL阶段训练曲线。橙色曲线代表我们提出的两阶段训练策略,而蓝色曲线对应于仅基线RL设置。

4.4 消融研究

我们首先评估不同训练设置的影响,结果如表4所示。研究结果表明,使用我们的两阶段训练策略,即使用Chart-SFT数据进行逐步SFT,并使用ChartQA和ChartRQA-RL数据进行RL,可以达到最平衡的性能。值得注意的是,省略Chart-COT会导致ChartRQA基准上的性能显著下降。我们将其归因于ChartRQA的性质,即需要在回答前进行多步骤思考的复杂图表。第一个Chart-COT阶段使模型具备了此类逐步任务分解的必要能力。此外,仅在ChartQA数据集上进行SFT会导致所有基准上的性能下降,包括ChartQA本身。我们认为,尽管SFT可以提高域内任务的能力,但训练在简单且低多样性的数据集上会破坏调优的分布,从而损害域内(ChartQA)和域外(CharXiv-RQ,ChartRQA)任务的能力。

先前的研究已经确立了训练数据的复杂性对于有效RL的重要性 Guo et al. [2025]。我们生成的ChartRQA训练集满足了这一要求,包含了具有单图表和多图表图像以及需要逐步推理的问题。在RL阶段包含我们的ChartRQA数据集对于实现最佳性能至关重要。结构
表5:关于准确性奖励的消融研究。结果表明,针对不同任务类型使用专门的奖励函数可以获得更优的性能。

准确性奖励 ChartQA CharXiv-RQ ChartRQA
编辑距离 软匹配 (单 / 多)
✓\checkmark 89.88 44.0 45.02 / 39.79
✓\checkmark ✓\checkmark 90.28 45.2 44.16 / 40.44

表6:关于SFT数据组合的消融研究。

SFT训练集 ChartQA CharXiv-RQ ChartRQA
(单 / 多)
RQA-SFT 89.88 44.5 48.02 / 48.11
RQA-SFT + QA-Train+ RQA-RL 88.40 41.2 45.98 / 44.60

和逻辑复杂性在我们Chart-RFT阶段的性能提升中观察到。我们发现,仅在ChartQA数据集上进行训练不足以开发出一个强大的推理模型。ChartQA的有限复杂性未能促使模型学习多样化的、长路径的推理策略。这一局限性通过图3所示的训练过程进行了实证演示。准确性奖励迅速收敛到约0.9,随后几乎没有增长,而响应长度则受限于约100个标记。

我们进一步研究了我们两阶段训练策略的影响,该策略包括Chart-COT和Chart-RFT阶段。通过与没有Chart-COT阶段的基线进行比较,我们分析了由此产生的训练过程,特别是奖励和响应长度。我们发现,首次在CoT数据上的SFT有两个关键好处。首先,它显著增加了RL阶段生成的标记长度。其次,它导致了一个更有效的准确性奖励曲线,该曲线在训练开始时迅速上升,然后在更高的最终值处收敛。
外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

图5:案例研究的可视化结果,Chart-R1(含和不含Chart-COT)正确回答,但Qwen2.5VL-7B失败。

奖励函数 对于奖励函数,我们进行了实验以评估准确性奖励的不同设置。结果如表5所示。为了更好地评估由不同准确性奖励引起的影响,我们进行了消融研究,仅对RL阶段训练Qwen2.5VL-7B-Instruct。结果显示,采用软准确性奖励,结合基于字符串任务的编辑距离和基于数值任务的软匹配,可以在我们大多数基准上产生更优的性能。这一发现强调了根据特定答案类型调整奖励函数的重要性。

SFT数据 在训练Chart-R1时,我们的SFT数据集由我们ChartRQA-SFT中的228k个样本组成。然后我们通过添加两个来源,ChartQA数据集和30k个与RL数据重叠的ChartRQA-RL,来消融SFT数据的组成,以评估对性能的影响。我们分别对每个设置进行2k步和1个周期的SFT和RL训练。表6中的结果显示,结合ChartQA和ChartRQA-RL,最终性能明显下降。我们的分析表明,使用重叠数据进行SFT和RL会导致过拟合,模型会记忆SFT阶段的推理路径,导致思维过程更加僵化,输出多样性显著减少。此外,ChartQA数据的直接答案格式阻碍了模型发展将问题分解为逐步思考过程的能力。

可视化 我们以定性案例研究结束,我们的Chart-R1模型成功生成了复杂问题的详细推理和正确答案。在这些相同实例中,基线Qwen2.5VL-7B模型失败,直接展示了我们方法的卓越性能和更先进的推理能力。
外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

图6:案例研究的可视化结果,Chart-R1(含Chart-COT)正确回答,但Qwen2.5VL-7B和Chart-R1(不含Chart-COT)失败。

5 结论

本文中,我们提出了Chart-R1,一种用于复杂图表推理的图表领域VLM。为了提高Chart-R1的推理能力,我们引入了一种程序化数据生成方法和一种新颖的两阶段训练策略,以优化数据构建和训练方法。此外,我们提出了ChartRQA,包含258k个训练样本,每个样本都以可验证的格式构建,并提供了一个评估复杂图表推理的基准。结果表明,结合我们提出的训练策略,Chart-R1在与其他VLM的比较中表现出优越的性能。

参考文献

Anthropic. Introducing the next generation of claude, 2024. URL https://www.anthropic.com/ news/claude-3-family.
S. Bai, K. Chen, X. Liu, J. Wang, W. Ge, S. Song, K. Dang, P. Wang, S. Wang, J. Tang, et al. Qwen2. 5-vl technical report. arXiv preprint arXiv:2502.13923, 2025.
W. Chen, X. Ma, X. Wang, and W. W. Cohen. Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks. arXiv preprint arXiv:2211.12588, 2022.
D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, Q. Zhu, S. Ma, P. Wang, X. Bi, et al. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948, 2025.
Y. Han, C. Zhang, X. Chen, X. Yang, Z. Wang, G. Yu, B. Fu, and H. Zhang. Chartllama: A multimodal llm for chart understanding and generation. arXiv preprint arXiv:2311.16483, 2023.
L. Hu, D. Wang, Y. Pan, J. Yu, Y. Shao, C. Feng, and L. Nie. Novachart: A large-scale dataset towards chart understanding and generation of multimodal large language models. In Proceedings of the 32nd ACM International Conference on Multimedia, pages 3917-3925, 2024.
W. Huang, B. Jia, Z. Zhai, S. Cao, Z. Ye, F. Zhao, Z. Xu, Y. Hu, and S. Lin. Vision-r1: Incentivizing reasoning capability in multimodal large language models. arXiv preprint arXiv:2503.06749, 2025.
C. Jia, N. Xu, J. Wei, Q. Wang, L. Wang, B. Yu, and J. Zhu. Chartreasoner: Code-driven modality bridging for long-chain reasoning in chart question answering. arXiv preprint arXiv:2506.10116, 2025.
S. Kantharaj, R. T. K. Leong, X. Lin, A. Masry, M. Thakkar, E. Hoque, and S. Joty. Chart-to-text: A large-scale benchmark for chart summarization. arXiv preprint arXiv:2203.06486, 2022.
F. Liu, X. Wang, W. Yao, J. Chen, K. Song, S. Cho, Y. Yacoob, and D. Yu. Mmc: Advancing multimodal chart understanding with large-scale instruction tuning. arXiv preprint arXiv:2311.10774, 2023.
Z. Liu, C. Chen, W. Li, P. Qi, T. Pang, C. Du, W. S. Lee, and M. Lin. Understanding r1-zero-like training: A critical perspective. arXiv preprint arXiv:2503.20783, 2025.
A. Masry, D. X. Long, J. Q. Tan, S. Joty, and E. Hoque. Chartqa: A benchmark for question answering about charts with visual and logical reasoning. arXiv preprint arXiv:2203.10244, 2022.
A. Masry, M. Shahmohammadi, M. R. Parvez, E. Hoque, and S. Joty. Chartinstruct: Instruction tuning for chart comprehension and reasoning. arXiv preprint arXiv:2403.09028, 2024a.
A. Masry, M. Thakkar, A. Bajaj, A. Kartha, E. Hoque, and S. Joty. Chartgemma: Visual instructiontuning for chart reasoning in the wild. arXiv preprint arXiv:2407.04172, 2024b.
A. Masry, M. S. Islam, M. Ahmed, A. Bajaj, F. Kabir, A. Kartha, M. T. R. Laskar, M. Rahman, S. Rahman, M. Shahmohammadi, et al. Chartqapro: A more diverse and challenging benchmark for chart question answering. arXiv preprint arXiv:2504.05506, 2025.
F. Meng, L. Du, Z. Liu, Z. Zhou, Q. Lu, D. Fu, T. Han, B. Shi, W. Wang, J. He, et al. Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning. arXiv preprint arXiv:2503.07365, 2025.
N. Methani, P. Ganguly, M. M. Khapra, and P. Kumar. Plotqa: Reasoning over scientific plots. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 1527-1536, 2020.
M. Ni, Z. Yang, L. Li, C.-C. Lin, K. Lin, W. Zuo, and L. Wang. Point-rft: Improving multimodal reasoning with visually grounded reinforcement finetuning. arXiv preprint arXiv:2505.19702, 2025.

OpenAI. Gpt-4o, 2024. URL https://openai.com/index/hello-gpt-4o. Accessed: 2024-0513 .

OpenAI. Introducing openai o3 and o4-mini. https://openai.com/index/ introducing-o3-and-o4-mini/, April 2025. Accessed: 2025-07-14.
Z. Shao, P. Wang, Q. Zhu, R. Xu, J. Song, X. Bi, H. Zhang, M. Zhang, Y. Li, Y. Wu, et al. Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.
H. Shen, P. Liu, J. Li, C. Fang, Y. Ma, J. Liao, Q. Shen, Z. Zhang, K. Zhao, Q. Zhang, et al. Vlm-r1: A stable and generalizable r1-style large vision-language model. arXiv preprint arXiv:2504.07615, 2025.
C. Shi, C. Yang, Y. Liu, B. Shui, J. Wang, M. Jing, L. Xu, X. Zhu, S. Li, Y. Zhang, et al. Chartmimic: Evaluating lmm’s cross-modal reasoning capability via chart-to-code generation. arXiv preprint arXiv:2406.09961, 2024.
A. Singh, V. Natarajan, M. Shah, Y. Jiang, X. Chen, D. Batra, D. Parikh, and M. Rohrbach. Towards vqa models that can read. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 8317-8326, 2019.
L. Tang, G. Kim, X. Zhao, T. Lake, W. Ding, F. Yin, P. Singhal, M. Wadhwa, Z. L. Liu, Z. Sprague, et al. Chartmuseum: Testing visual reasoning capabilities of large vision-language models. arXiv preprint arXiv:2505.13444, 2025.
G. Team, R. Anil, S. Borgeaud, J.-B. Alayrac, J. Yu, R. Soricut, J. Schalkwyk, A. M. Dai, A. Hauth, K. Millican, et al. Gemini: a family of highly capable multimodal models. arXiv preprint arXiv:2312.11805, 2023.
Y. Wang, S. Wu, Y. Zhang, S. Yan, Z. Liu, J. Luo, and H. Fei. Multimodal chain-of-thought reasoning: A comprehensive survey. arXiv preprint arXiv:2503.12605, 2025.
Z. Wang, M. Xia, L. He, H. Chen, Y. Liu, R. Zhu, K. Liang, X. Wu, H. Liu, S. Malladi, et al. Charxiv: Charting gaps in realistic chart understanding in multimodal llms. arXiv preprint arXiv:2406.18521, 2024.
J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q. V. Le, D. Zhou, et al. Chain-of-thought prompting elicits reasoning in large language models. Advances in neural information processing systems, 35:24824-24837, 2022.
Y. Wu, L. Yan, L. Shen, Y. Mei, J. Wang, and Y. Luo. Chartcards: A chart-metadata generation framework for multi-task chart understanding. arXiv preprint arXiv:2505.15046, 2025.
R. Xia, B. Zhang, H. Ye, X. Yan, Q. Liu, H. Zhou, Z. Chen, M. Dou, B. Shi, J. Yan, et al. Chartx & chartvlm: A versatile benchmark and foundation model for complicated chart reasoning. arXiv preprint arXiv:2402.12185, 2024.
Z. Xu, B. Qu, Y. Qi, S. Du, C. Xu, C. Yuan, and J. Guo. Chartmoe: Mixture of diversely aligned expert connector for chart understanding. arXiv preprint arXiv:2409.03277, 2024.
Y. Yang, X. He, H. Pan, X. Jiang, Y. Deng, X. Yang, H. Lu, D. Yin, F. Rao, M. Zhu, et al. R1onevision: Advancing generalized multimodal reasoning through cross-modal formalization. arXiv preprint arXiv:2503.10615, 2025.
L. Zhang, A. Hu, H. Xu, M. Yan, Y. Xu, Q. Jin, J. Zhang, and F. Huang. Tinychart: Efficient chart understanding with visual token merging and program-of-thoughts learning. arXiv preprint arXiv:2404.16635, 2024.
X. Zhao, X. Liu, H. Yang, X. Luo, F. Zeng, J. Li, Q. Shi, and C. Chen. Chartedit: How far are mllms from automating chart analysis? evaluating mllms’ capability via chart editing. arXiv preprint arXiv:2505.11935, 2025a.
X. Zhao, X. Luo, Q. Shi, C. Chen, S. Wang, Z. Liu, and M. Sun. Chartcoder: Advancing multimodal large language model for chart-to-code generation. arXiv preprint arXiv:2501.06598, 2025b.
J. Zhu, W. Wang, Z. Chen, Z. Liu, S. Ye, L. Gu, H. Tian, Y. Duan, W. Su, J. Shao, et al. Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models. arXiv preprint arXiv:2504.10479, 2025.

参考论文:https://arxiv.org/pdf/2507.15509

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐