#Paper Reading# DeepSeekMath_V2
论文题目: DeepSeekMath_V2
论文地址: https://github.com/deepseek-ai/DeepSeek-Math-V2/blob/main/DeepSeekMath_V2.pdf
论文发表于: Github 2025年11月
论文所属单位: DeepSeek
论文大体内容
本文为了优化LLM的数学推理能力(严谨性),提出「会自省的学生 -> 老师 -> 督导」的模块来训练LLM,最终达到IMO金牌的水平。
Motivation
LLM推理模型解决数学推理问题的常用做法是通过RL,看最后答案是否正确、解题过程是否正确,但是这种做法存在2个问题:
①答案正确但是有可能过程不正确;
②不适用于定理证明等开放任务;
也就是现有做法并不能做一些严谨推理的事情。
Contribution
本文的核心贡献是:
①训练了一个准确且忠实的基于大型语言模型(LLM)的数学证明验证器;
②使用元验证大大减少了幻觉问题,并确保了验证质量;
③激励证明生成器通过自我验证来最大化证明质量;
④扩展验证计算能力,以自动标记越来越难以验证的证明,从而在无需人工标注的情况下改进验证器。
1. 我们的方法基于以下几个关键观察:
①人类即使在没有参考解决方案的情况下也能识别出证明中的问题—这是解决开放性问题时至关重要的能力;
②当经过一定规模的验证工作后仍无法发现任何问题时,该证明更有可能有效;
③识别有效问题所需的努力可以作证明质量的代理指标,该指标可用于优化证明生成。
2. 验证器将实现一个迭代改进循环:
①利用验证反馈优化证明生成;
②扩展验证计算能力以自动标记难以验证的新证明,从而创建训练数据来改进验证器本身;
③使用这个增强的验证器来进一步优化证明生成;
此外,一个可靠的证明验证器使我们能够训练证明生成器像验证器一样评估证明。这使得证明生成器能够迭代地改进其证明,直到它无法再识别或解决任何问题。本质上,我们使模型明确意识到其奖励函数,并使其能够通过深思熟虑的推理而不是盲目的试错来最大化这一奖励。
3. 证明验证器:对证明评分
(1) 验证器的标准:
①1分表示证明完整且严谨,所有逻辑步骤都有明确依据;
②0.5分表示证明整体逻辑合理,但存在小错误或遗漏的细节;
③0分表示证明存在根本性缺陷,包含致命的逻辑错误或关键漏洞;

(2) 数据集获取:Art of Problem Solving (AoPS)中获取17k个问题,使用DeepSeek-V3.2-Exp-Thinking来进行生成答案,然后人工打分0/0.5/1。
(3) RL的reward:
①R_format:格式分数
②R_score:预估分数和真实分数的diff

(4) 存在的问题是对于有问题的证明,验证器会虚构问题原因,预测正确的分数,来拿到reward。因此这里引入元验证(Meta-Verification)去验证这个验证器是否有问题(二重验证)。加入元验证器后,验证器的分数从0.85提升到0.96。

4. 证明生成器
证明生成器的Reward如下,其中Y是证明生成器生成的证明,对应的预估分数是R_Y=s,Z是自我分析(证明生成器中的验证器,可以看成Pre-verification),对应的预估分数是R_Z=s',Reward含义是:
①s与s'的diff代表:诚实地承认错误会得到嘉奖,而谎称正确则会受到惩罚;
②R_Y+R_Z代表:最高回报来自于提供正确的证明并准确认识到其严谨性;
③R_meta(Z)代表:获得高奖励的一个好策略是在最终确定响应之前,尽可能多地识别和解决问题。
总的来说,就是要让模型不仅会做,还要能自己检查,并诚实地承认自己哪里错了。三者的关系可以看成:会自省的学生 -> 老师 -> 督导[1]。

5. 证明验证器和证明生成器的协同:自动化标注扩展数据(左脚踩右脚)
多次验证和元验证,多数投票来确定证明是否1分,或者发现的问题是否对。
实验
6. 数据集
①IMO 2025(6个问题):国际数学奥林匹克竞赛,面向大学前学生的全球顶级数学竞赛;
②CMO 2024(6个问题):中国数学奥林匹克竞赛,中国的全国性锦标赛;
③Putnam 2024(12个问题):北美最杰出的本科生数学竞赛;
④ISL 2024(31个问题):国际数学奥林匹克(IMO)候选名单;
⑤IMO-ProofBench(60个问题):DeepMind开发,分为基础组(30个问题,难度从IMO简单到IMO中等)和高级组(30个挑战性问题,模拟完整的IMO 考试,难度最高可达IMO高级);
7. 单次生成的评测:DeepSeekMath-V2优于GPT-5-Thinking-High和Gemini 2.5-Pro。

8. 多次生成
因为对于困难问题,128K的token不足以解决,因此这里进行多次评估,不断完善证明,评估的分数也在不断往上涨。

9. IMO比赛能拿到金牌水平。


参考资料
[1] https://mp.weixin.qq.com/s/FctcBGr76_geN0FAVjXWQQ
以上均为个人见解,因本人水平有限,如发现有所错漏,敬请指出,谢谢!
更多推荐


所有评论(0)