精简阅读版本

大模型相关资讯原文第一时间获取 👉👉OCR “去幻觉” 新纪元!通义点金 OCR-R1 搞定模糊盖章+跨页表格,攻克 OCR 三大痛点!https://mp.weixin.qq.com/s/me3vxY7WWDqyrejKYE1tNA

本文解决了什么问题

OCR 场景下的 LVLM 幻觉与感知不足: 生成式大视觉语言模型(LVLM)在端到端文档解析上虽统一优雅,但容易“看图添字”,即输出图像中不存在的内容;与此同时,通用 LVLM 更偏重推理而非细粒度感知,在文本/表格/公式等 OCR 任务上常不如面向单任务训练的“专家模型”。论文第 1 页摘要与第 1 节、以及表 1(第 2 页)给出了“印章识别”中的典型幻觉例子。

通用 LVLM 与专家 OCR 模型各有短板: 专家模型架构为特定 OCR 子任务而定制,幻觉少、感知强,但只能做“一件事”;通用/专家 VLM 能端到端生成结构化结果,却依旧存在“似是而非”的输出。作者要解决的是:如何兼得 LVLM 的统一性与专家模型的可靠感知,并降低幻觉

论文基本信息:

作者:Qian Chen, Xianyin Zhang, Lifan Guo, Feng Chen, Chi Zhang团队:Qwen DianJin Team, Alibaba Cloud Computing

链接:

  • https://huggingface.co/DianJin

  • https://modelscope.cn/organization/tongyi_dianjin

  • https://github.com/aliyun/qwen-dianjin

  • https://tongyi.aliyun.com/dianjin

ICML|CVPR|AAAI|ICLR 2025 大模型顶会合集https://mp.weixin.qq.com/s/me3vxY7WWDqyrejKYE1tNA

核心创新点

(1)推理‑工具交替范式(Reasoning‑and‑Tool Interleaved): 给定图片与指令,模型先用自身 OCR 能力初识别(),再调用外部专家工具获取参考(),随后回看图片+反思对比(),最后输出()。流程见图 1(第 4 页);三种任务的数据构造与阈值保留规则见第 3.2 节与图 2(第 5 页)。这一范式用专家结果“照镜子”,在保持端到端统一输出的同时抑制幻觉。

(2)可验证的“推理链”数据与训练: 作者用 Qwen‑VL‑Max 通过多轮提示模板合成带标签的“推理‑工具交替链”(包含 /// 四段),分别构建印章/表格/公式三类数据集,并对输出质量用字符精确匹配、TEDS(表格)1‑NED(公式)等阈值过滤保真样本(第 3.2 节;第 12–14 页给出具体提示词模板)。随后在 Qwen2.5‑VL‑7B‑Instruct 上先 SFT 再 RFT

(3)GRPO‑RFT 与“双奖励”设计: RFT 采用 GRPO,增加格式奖励(必须严格包含四段标签)与准确率奖励(印章按全匹配、表格按 TEDS、公式按 CDM/ExpRate)以鼓励结构化、可核验的答案(第 3.3 节)。

(4)“以小带大”的低成本迭代思路: 论文主张无需频繁再训练 LVLM,只要升级外部专家 OCR 工具即可带动整体性能提升——因为工具结果会进入反思对比链路;替换工具的实验(表 6,第 8 页)验证了这一点。

结果:相较以往有哪些提升

整体胜过基线与多数对手(见表 4,第 7 页): 在相同测试集与仅“数千样本”训练规模(训练统计见表 2,第 6 页)下,DianJin‑OCR‑R1(RFT)相对基座 Qwen2.5‑VL‑7B‑Instruct 大幅提升,并普遍优于专家 VLM 与专家 OCR 模型:

  • 印章识别(ReST,Acc↑):0.766 vs 0.527(+0.239);SFT 版本也达 0.722

  • 表格识别(OmniDocBench,TEDS↑/STEDS↑/NED↓):0.901/0.939/0.072 vs 0.853/0.904/0.107。

  • 公式识别(OmniDocBench,CDM↑/ER↑/NED↓):0.976/0.787/0.179 vs 0.915/0.642/0.243。 同时对比专家 OCR:表格 TEDS 0.901 高于 PP‑StructureV3(0.818)与 RapidTable(0.832);公式指标亦超 UniMERNet‑B。

RFT > SFT,推理+工具 > 直接微调(见表 5,第 8 页):

  • 仅给工具结果作为参考即可把基线印章 Acc 从 0.527 提到 0.560

  • 加入推理链并微调,SFT 达 0.722,RFT 进一步到 0.766;表格/公式亦呈一致趋势。 说明:专家工具的引用显式推理链训练都对降低幻觉、提升鲁棒性有效。

“以工具升级带动模型”得到实证(表 6,第 8 页): 将公式任务的工具从 GOT+PP‑FormulaNet‑S 换成 MonkeyOCR‑3B+PP‑FormulaNet‑M 后,R1 的最终指标同步提升,印证了“迭代小工具,拉升大模型”的可行性与经济性。

局限性总结

任务与数据覆盖有限: 论文只在印章、表格、公式三类 OCR 上验证;其中印章任务因官方测试集无公开标注,作者仅用训练集做划分验证,虽做了“相似标题去重与社区检测”来避免记忆泄漏,但泛化到更复杂文档类型/更多语言脚本仍待检验(第 3.2 节)。

依赖外部工具质量与可用性: 框架把专家模型输出作为“参照物”。工具若失效或域外迁移不佳,会把噪声带入推理链,对最终答案造成偏置;替换工具的实验虽正向,但也侧面说明上限受工具天花板约束(第 3.2、4.3 节)。

数据构造与可复现性成本: 推理‑工具交替链依赖强模型(Qwen‑VL‑Max)合成阈值过滤(如表格 TEDS≥0.98、公式 1‑NED≤0.015),这一流程在不同机构可复现性、版权/调用成本与合成偏差方面仍需评估(第 3.2 节、附录提示词页 12–14)。

训练奖励与输出格式的约束: RFT 使用严格格式奖励(四段标签缺一不可),有利于结构化与可核验,但对开放式场景的表达灵活性可能形成限制;且论文主要以结构相似度与字符级指标为准,人审一致性部署端时延/成本未系统报告(第 3.3、4.1 节)。

深入阅读版本

导读

近年来,大视觉语言模型(LVLMs)的进展推动了端到端文档图像解析的新范式,在光学字符识别(OCR)任务中表现出色,如文本、表格和公式识别。然而,生成式 LVLMs 与大语言模型(LLMs)类似,容易产生幻觉——即生成输入图像中并不存在的词汇。此外,LVLMs 设计用于通用目的,在OCR 任务上的表现往往不如在特定领域数据集上训练的专家模型。

本文提出 DianJin-OCR-R1,一种增强推理能力的框架,通过训练推理与工具交替的视觉语言模型来解决上述局限性。给定一个识别指令,我们的 DianJin-OCR-R1 模型首先利用自身的 OCR 能力识别输入图像中的内容,然后调用其他工具(即其他专家模型)获取其结果作为参考,最后“再次审视”图像并重新思考推理过程,以提供最终的识别结果。由于专家模型的架构针对特定 OCR 任务进行了优化,因此较少产生幻觉,其结果有助于 LVLMs 减轻幻觉问题。

此外,专家模型通常规模较小且易于迭代,能够在较低成本下提升LVLMs 的性能。我们在 ReST (Yu et al., 2023) 和 OmniDocBench (Ouyanget al., 2025) 上评估了我们的模型,实验结果表明,DianJin-OCR-R1 模型始终优于非推理型对照模型及专家 OCR 模型,验证了我们方法的有效性。

引言

从包含正文、表格和公式等交织元素的文档图像中提取结构化内容,对于推动人工智能辅助文档理解至关重要,同时也是 RAG(检索增强生成)中最关键的步骤之一。传统的专家 OCR模型如 PP-Structure (Li et al., 2022a; Cui et al., 2025) 会分别训练不同任务的专家模型,例如 SLANet (Li et al., 2022a) 用于表格识别,PP-FormulaNet (Liu et al., 2025) 用于公式识别。与 PP-Structure 复杂的流程相比,大型视觉语言模型(LVLMs)如 Qwen2.5-VL (Baiet al., 2025) 能够以统一、优雅且端到端的范式处理各种文档元素。特别是,像 GOT (Weiet al., 2024) 这样的专家 VLM 在多种 OCR 任务上进行训练,可直接从文档图像生成结构 化内容。

尽管取得了这些进展,我们观察到当前的通用和专家视觉语言模型(VLMs)容易生成看似合理但实际上并未基于输入图像的答案,这种现象通常被称为幻觉。在光学字符识别(OCR)任务中,由于它们从大模型(LLMs)使用的训练数据集中学习了语言模式,而非仔细识别图像中的实际内容,因此常常输出图像中并不存在的内容。相比之下,虽然专家 OCR 模型仅能完成特定任务,但它们很少出现幻觉问题,因为其架构专为特定 OCR 任务而设计。最坏的情况也只是无法识别一个或少数几个字符。表 1 展示了一个幻觉的例子。此外,LVLMs主要关注视觉推理性能,其感知能力相对较弱,而专家 OCR 模型具有更强的细粒度感知能力,这有助于识别各种文本。

为融合两种方法的优势并克服其局限性,我们提出 Dianjin-OCR-R1,这是一种遵循“思维链与工具交替”范式的新型推理增强框架。受训练为通过思维链(CoT)方式阐述问题解决过程的推理模型启发,我们的 Dianjin-OCR-R1 模型首先利用自身 OCR 能力识别输入图像中的内容,然后调用其他专家模型或工具,并将其结果作为参考,最后再次审视图像并重新思考推理过程,以提供最终的识别内容。专家模型的结果有助于视觉语言模型(VLMs)反思自身输出,从而尽可能减少幻觉现象。此外,专家模型通常规模较小且易于迭代,这使得VLMs 能以较低成本提升性能。

我们基于 Qwen2.5-VL-7B-Instruct (Bai et al., 2025),通过监督微调(SFT)和强化微调(RFT)训练了我们的 DianJin-OCR-R1 模型。我们采用组相对策略最优化(GRPO) (Shaoet al., 2024),这是一种引入两种奖励信号的强化学习算法:格式奖励用于鼓励结构化输出,准确率奖励用于促进答案正确性。这些机制引导模型生成连贯且可验证的推理链以及可靠的答案。本工作的贡献主要有两点:

• 我们提出了一种新颖的推理与工具交替框架,即 Dianjin-OCR-R1,该框架在 LVLMs的推理能力与导出模型的 OCR 能力之间取得了平衡。在包括 ReST (Yu et al., 2023)和 OmniDocBench (Ouyang et al., 2025) 在内的多个基准测试中的实验结果表明,我们的模型始终优于其非推理类对比模型和专家模型,证明了我们方法的有效性。 

• 我们的框架仅需迭代导出 OCR 模型(通常参数量小于 LVLMs),无需对 LVLMs进行后训练,即可全面提升 OCR 性能,从而更有效地利用资源。

相关工作

通用视觉语言模型

通用视觉语言模型(VLM)如 GPT-4V (Yang et al., 2023b)、Claude 系列1, Gemini 系列 (Team et al., 2024),Qwen-VL 系列 (Bai et al., 2023; Wang et al., 2024c; Bai et al.,2025),MiniCPM 系列 (Yao et al., 2024),Intern-VL 系列 (Chen et al., 2024b;a; Zhu et al.,2025),以及 Seed-VL 系列 (Guo et al., 2025b) 在文档解析与理解方面展现了令人鼓舞的结果,且无需针对特定任务进行训练。然而,通用的 LVLMs 更注重视觉推理性能,例如 VQA,其在感知能力方面表现相对较弱。鉴于这一局限性,一些研究认为 LVLMs 并不适用于 OCR任务。

专家级视觉语言模型 专家级视觉语言模型(VLMs)如 GOT (Wei et al., 2024)、Monkey 系列 (Liu et al., 2024;Li et al., 2025)、mPLUG-DocOwl 系列 (Ye et al.; 2023)、olmOCR (Poznanski et al., 2025)、Ocean-OCR (Chen et al., 2025) 以及 Mistral-OCR2 专门针对文档解析与理解任务设计和训练。它们采用了一种创新的统一模型来处理各种文档元素,但仍存在幻觉问题且迭代成本较高。

专家级 OCR 模型 研究人员通常为不同的 OCR 任务分别训练不同的专家 OCR 模型。PP-OCR 系列 (Duet al., 2020; 2021; Li et al., 2022b; Liu et al., 2025) 专注于多场景、多语言的文本检测与文本识别任务。TableMaster (Cao & Liu, 2025)、SLANet (Li et al., 2022a) 和 UniTable (Penget al., 2024) 被提出用于识别表格的结构和内容。LaTeX-OCR3, PP-FormulaNet (Liu et al.,2025).和 UniMERNet (Wang et al., 2024a) 是为公式识别任务设计的。然而,一个不便之处在于,研究人员常常需要在不同模型之间切换以满足各种识别需求。

推理模型 最近在通过强化学习优化的推理模型方面的进展,凸显了基础模型在提升推理阶段缩放能力并实现更高智能水平方面的潜力,例如 OpenAI o3。4, DeepSeek-R1 (Guo et al., 2025a).在纯文本推理模型取得成功之后,多模态视觉语言模型(LVLM)推理研究应运而生,重点关注有效的多模态思维链结构以及高质量训练数据构建方法。然而,大多数研究集中于视觉问答(VQA)任务,针对光学字符识别(OCR)任务的研究较少。

方法

在本节中,我们对 DianJin-OCR-R1 进行了全面概述,深入探讨了其推理范式、数据构建以及模型训练的细节。

推理范式

我们提出的 DianJin-OCR-R1 专注于识别任务,为 LVLMs 建立了一种直接的推理范式,使得推理过程更加透明且可验证。给定一张图像和一个文本问题,DianJin-OCR-R1 首先利用自身的 OCR 能力识别输入图像中的相关内容。随后,它调用其他专家模型或工具,并将其结果作为参考或补充信息。接着,模型“再次审视”图像,综合分析自身结果及其他模型的结果,反思在识别过程中是否出现错误或遗漏。最后,模型提供最终的识别内容。

图 1 展示了我们所提出方法的推理流水线可视化效果。

数据构建

为了证明我们方法的有效性,我们在三个 OCR 任务上进行了实验,即印章、表格和公式识别任务。我们将原始的印章、表格和公式识别数据集分别记为 Dsr /Dtr /Dfr = (ii, qi, ai) ,其中 ii 表示第 i 个印章、表格或公式图像,qi 指示模型进行识别的指令,ai 对应于印章、表格(以 HTML 格式)或公式(以 LaTeX 格式)的内容。

我们利用强大 LVLMs 的先进能力,例如 Qwen-VL-Max5, 通过精心设计的提示和一个示例,生成一个交错的推理-工具链 ri 以及输出 oi 。推理链 ri 由三部分组成:模型自身识别的内容用 标签包围,多个工具响应用 标签包围,反思内容用 标签包围。生成的输出用 标签包围。如果输出 oi 与真实答案 ai 匹配,我们保留该样本 (ii, qi, ri, oi) 作为有效的推理样本,最终据此构建三个推理数据集 Rsr /Rtr /Rfr = (ii, qi, ri, oi) 。图 2 展示了构建推理数据的流水线。

鉴于三项任务之间的差异,我们在构建推理链时选择不同来源的数据并使用不同的工具。

印章识别。 我们从 ReST (Yu et al., 2023) 中选取数据,该数据来自 ICDAR 2023 阅读印章标题竞赛,包含一个包含 5,000 张图像的训练集和一个包含 5,000 张图像的测试集。由于测试集的标注信息未公开,我们仅使用训练集来验证我们的方法。我们发现印章标题中存在大量重复内容。为防止大语言模型部分记忆印章标题中的固定短语,我们在划分训练集和测试集时对数据进行了隔离处理(采用社区发现进行粗粒度过滤,再通过特定关键词进行细粒度过滤)。在生成推理链时,我们使用了 PP-StructureV3 和 Qwen-VL-OCR 的结果。6 作为参考。如果输出 o 和答案 a 在字符层面完全匹配,我们保留该实例。

表格识别 我们从内部数据集和 TabRecSet (Yang et al., 2023a) 数据集中选取数据,该数据集是目前最大且首个面向端到端 TR 的双语数据集,包含 38.1K 张表格,其中 20.4K 张为英文,17.7K 张为中文。在生成推理链时,我们以 PP-StructureV3 和 MonkeyOCR-3B的结果作为参考。如果输出 o 与答案 a 之间的基于 Tree-Edit-Distance 的相似度(TEDS)

(Zhong et al., 2020) 得分大于模型自身识别的内容,并且超过阈值(设定为 0.98),则保留该样本作为有效的推理样本。

公式识别 我们从 UniMER-1M (Wang et al., 2024a) 数据集选取数据,该数据集包含超过一百万个实例,代表了多样且复杂的数学表达式值域。类似地,我们以 PP-StructureV3 和MonkeyOCR-3B 的结果作为推理链中的参考。如果输出 o 与答案 a 之间的 1-规范化编辑距离(1-NED) (Zhang et al., 2019) 得分小于模型自身识别内容的得分,并且低于阈值(设定为 0.015),则保留该样本作为有效的推理样本。

模型训练

在本节中,我们详细介绍如何训练视觉语言模型(VLMs)以执行 OCR 推理。该训练过程包含两种常见的后训练策略:通过监督微调(SFT)学习推理,以及通过强化微调(RFT)进行优化。

通过 SFT 进行学习推理。 推理数据集 Rsr 、Rtr 和 R f r 被用于微调视觉语言模型(VLM),使其生成思维链(CoT)并给出最终答案。每个训练实例 (p, i, r, o) 包含一张图像 i 、一个问题 q 、一个推理链 r 和一个输出 o 。在 SFT 阶段,图像 i 和问题 q 作为模型的输入,而推理链 r 和输出 o 则被视为目标输出,使模型能够学习生成连贯的推理步骤并得出正确答案。

通过 RFT 进行学习推理。 经过过滤的数据集 D′sr 、D′tr 和 D′fr (大小相同,输入与 Rsr、Rtr 和 R f r 相同)来自 Dsr 、Dtr 和 Dfr ,用于强化学习微调,旨在提升基础模型的推理能力。具体而言,我们在 RFT 阶段采用 GRPO 算法,并引入两种奖励机制:格式奖励以确保生成的输出符合预期结构,准确率奖励以鼓励得出正确答案。

• 格式奖励。我们引入了格式奖励以促进结构良好的输出。对于给定的 CoT,如果CoT 中恰好包含 、、 和 标签,且这些边界之外无其他内容,则给予 1.0 的奖励得分。若未满足此严格格式准则,则得分为 0.0。

• 准确率奖励。我们使用准确率奖励来促进答案的正确性。具体而言,对于印章识别,如果输出 o 与答案 a 完全匹配,则模型获得 1.0 的奖励得分;否则获得 0.0 的得分。对于表格识别,使用 o 与 a 之间的 TEDS 得分作为奖励得分。对于公式识别,使用o 与 a 之间的字符检测匹配(CDM) (Wang et al., 2024b) 指标作为奖励得分,若该得分等于 1.0,则额外增加 0.5 分。

实验

实验设置

训练数据 表 2 显示了训练集的统计量。

模型训练 我们基于 Qwen2.5-VL-7B-Instruct 训练 DianJin-OCR-R1。模型训练包含两种策略,在单个结点上使用 8 张 NVIDIA A100 GPU 进行。在 SFT 阶段,我们采用 DeepSpeed的 ZeRO-3 进行最优化,学习率为 1.0 × 10−5 ,序列长度为 16K,精度为 bf16,共进行 2轮次。我们通过 4 步梯度累积来模拟更大的批量大小。在 RFT 阶段,每个样本执行 8 次采样,训练批量大小为 128,采样批量大小为 32。我们使用学习率 1.0 × 10−6 和温度为 1.0,在 3 轮次内平衡学习动态。

评估数据集 我们在三个基准上评估了我们的模型,包括 ReST 测试集、OmniDocBench 表格集和 OmniDocBench 公式集。这些测试集包含多种语言,如中文、英文以及两者混合。这些测试集的详细统计量汇总在表 3 中。对于 ReST 测试集,结果通过准确率进行评估。对于 OmniDocBench 表格集,我们报告 TESD、结构 TEDS(STEDS)和规范化的编辑距离。对于 OmniDocBench 公式集,我们使用 CDM、ExpRate@CDM (Wang et al., 2024b) 和规范化编辑距离来评估结果。

基准线

我们将我们的模型与三类模型进行对比。

第一类为通用视觉语言模型(General LVLMs):Qwen2.5-VL-7B-Instruct (Bai et al., 2025),以及 Intern3VL-8B (Zhu et al., 2025)。

第二类为专家级视觉语言模型(Expert VLMs),包括 Qwen-VL-OCR、GOT (Wei et al., 2024),以及 MonkeyOCR-3B (Li et al., 2025)。

第三类为专家级 OCR 模型:用于印章识别的 PP-StructureV3(PP-OCRv4_server_seal_det + PP-OCRv4_server_rec),以及用于表格识别的 PP-StructureV3(PP-LCNet_x1_0_table_cls + SLANeXt_wired + SLANeXt_wireless)和 RapidTable7 (SLANet_plus) 用于表格识别,PP-StructureV3 (PP-FormulaNet_plus-M)和 UniMERNet-B (Wang et al., 2024a) 用于公式识别。

实验结果

表 4 比较了我们的 DinJin-OCR-R1 模型与其他模型的性能。结果揭示了以下关键点:

• 在三个测试集上,我们的 DianJin-OCR-R1 模型显著优于基础模型(Qwen2.5-VL-7B-Instruct)。例如,通过 SFT 训练的 DianJin-OCR-R1 模型在印章识别任务中的准确率从 0.527 提升至 0.722,在表格识别任务中的 TEDS 从 0.858 提升至 0.895,在公式识别任务中的 CDM 从 0.915 提升至 0.977。 

• 我们的 DianJin-OCR-R1 模型在推理链中使用的表现优于专家 OCR 模型,这表明它们能够融合多种模型的优势。 

• 仅使用数千个训练样本,我们的模型便取得了最佳效果。在相同数据条件下,RFT训练的模型通常优于 SFT 训练的模型,表明 RFT 更具优势。

消融研究

为了评估我们 DianJin-OCR-R1 框架中每个组件的贡献,我们进行了全面的消融实验。表 5总结了我们的研究结果。

• 基准 与带 工具 的 基准 对比。 直接 将两 个工 具的 输 出作 为参 考提 供给 基 准模 型Qwen2.5-VL-7B-Instruct,显著提升了其性能(例如,在封印识别任务中准确率从0.551 提升至 0.708),这表明利用专家模型能够有效增强视觉语言模型在 OCR 任务上的能力。

 • 直接微调 vs 带推理和工具的微调。我们对基础模型进行了直接 SFT 和 RFT,仅以图像 i 和问题 a 作为输入,答案 a 作为输出,省略了推理链 r 。结果表明,包含推理链和工具的模型始终表现出更优的性能,凸显了推理与工具成功融合的优势。 

• 带工具的基准模型 vs 带推理和工具的微调模型。与使用两个工具的基准模型相比,通过 SFT 结合推理和工具训练的模型表现更优,这表明了蒸馏方法的有效性。

此外,我们还更换了工具以进行更深入的探索。在公式识别任务中,我们将 MonkeyOCR-3B 和 PP-FormulaNet_plus-M 替 换 为 GOT 和 PP-FormulaNet_plus-S。 如 表 6所示,使用 MonkeyOCR-3B 和 PP-FormulaNet_plus-M 的性能优于使用 GOT 和 PP-FormulaNet_plus-S,这表明仅优化一个成本较低的专业 OCR 模型即可提升我们模型的OCR 能力。

结论

我们提出了 DianJin-OCR-R1,这是一种用于大型视觉语言模型在 OCR 任务上的增强推理框架。该框架在 VLM 中促进了一种简洁的推理范式,使得复杂文档 OCR 任务中的推理过程更加透明且可验证。通过在多种基准上的大量实验,我们证明了感知推理的训练能显著提升性能。

本文使用的提示词

如图 3、图 4 和图 5 所示,我们采用多轮对话的方式生成数据。具体而言,在第一轮中,让大视觉语言模型(LVLM)自行识别图像内容。在第二轮中,我们提供其他工具的结果作为参考,使模型能够进行分析并给出最终答案。

▍往期推荐 

杀疯了!2025 最新Agent Memory顶会论文,拿捏发文密码!

ICCV 2025|FrDiff:频域魔法+扩散模型暴力去雾,无监督性能刷爆榜单!

NeurIPS 2025 | 港科大&上交大HoloV:多模态大模型“瘦身”新突破,剪枝88.9%视觉Token,性能几乎无损

太牛了!北大:Unified-GRPO让理解生成正反馈,超 GPT-4o-Image

Nature | 记忆管理天花板来了!MOOM 双分支框架 + 竞争抑制遗忘,各项指标碾压现有方法!

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐