困在局部最优的“自我改良”:AI后训练的策略路径依赖与能力天花板
·
困在局部最优的“自我改良”:AI后训练的策略路径依赖与能力天花板
清华大学 (Tsinghua University)、中国人民大学 (Renmin University of China)和电子科技大学 (University of Electronic Science and Technology of China)联合发布研究报告,这份研究报告通过对大规模LLM后训练轨迹的实证分析,揭示了AI智能体在自动化研发中的关键瓶颈。研究者将能力划分为执行层面与策略层面,发现智能体虽然擅长编写代码、调试和优化超参数,但其高层训练策略往往在项目初期便已固化。即便引入了实验记录、外部知识库以及人工引导等干预措施,智能体依然倾向于在错误或低效的初始路径上进行局部微调,而非根据实验反馈主动重构整体方案。实验结果表明,后训练AI并不缺乏经验、指令或计算资源,而是缺乏在执行过程中自发重新评估并调整宏观策略的机制。因此,当前自动化AI研发的性能天花板主要取决于初始策略的质量,而非后续的迭代频率或算力投入。该研究强调,未来实现递归自我改进的核心在于开发能够打破思维惯性、具备战略灵活性且能闭合策略反馈环路的交互协议。
核心观点
-
“执行层能力”与“策略层能力”的系统性混淆:
- 论文在 AI 的自动后训练(Post-Training)任务中,区分了两种截然不同的能力:
- 执行层能力(Execution-Level Capability):指在既定的训练策略范围内进行局部迭代,例如进行数据清洗与重构、微调超参数、修复 Bug 以及选择 Checkpoint 等。
- 策略层能力(Strategy-Level Capability):指根据实验证据的积累,主动、自发地重新评估并修改高层的策略性判断,例如改变整体训练范式(如监督微调 SFT 转向强化学习 RL)、增加或精简训练阶段,或者重新分配预算等。
- 论文指出,当前对“AI 自动开发/优化 AI(AI-for-AI)”的普遍讨论,系统性地混淆了这两种能力,而策略层能力的缺失才是限制自动化 AI 研发的关键瓶颈。
- 论文在 AI 的自动后训练(Post-Training)任务中,区分了两种截然不同的能力:
-
策略锁定瓶颈(Strategy Lock-in):
- 在后训练开始前(即智能体写任何代码、跑任何实验前),其高层训练策略就已经被锁定了。
- 后续的全部时间和算力预算,实际上都被浪费在锁定策略范围内的“局部调整”上,使得迭代轨迹呈现“局部闭环,全局线性”的特征,无法从初始的策略偏误中走出来。
- 这种“锁定”不反映任务本身的差异(同一智能体在所有任务中几乎都倾向于采用相同初始策略),而是高度依赖于智能体自身固有的先验默认配置(Prior)。
-
对策略锁定的三大解释及干预实验结论: 论文通过由浅入深的干预措施,测试了导致策略锁定的三个自然解释:
- 缺乏经验?(Missing experience)
- 干预:构建由实验日志(记录实验历程)、技能库(积累后训练知识库)和评估智能体(给出诊断反馈)组成的“经验驱动框架”。
- 结论:这大幅度提升了智能体的执行与失败修复能力,使下游性能明显增加,但未能改变策略静态锁定的事实。智能体会完全采纳诸如微调参数、奖励塑造等所有“执行层建议”,但却直接拒绝任何战略性的“策略层建议”。
- 缺乏引导?(Missing guidance)
- 干预:在训练前的规划阶段,引入人类专家进行审查和策略纠正,通过后进行全自动运行(Human-Guidance)。
- 结论:人类引导能有效纠偏初始的规划路径,智能体也能自主理解和延伸,但一旦进入运行执行阶段,智能体又会迅速跌回局部调整的死循环,优秀的初始策略逐渐崩塌,这证明单次的、局限于前期的引导并不能替代持续的自发审视能力。
- 推理算力不足?(Insufficient reasoning)
- 干预:为智能体注入 2 至 8 倍的推理 Token 算力和多轮评估。
- 结论:对于简单任务,算力堆叠能显著提高执行收益;但对于极困难任务(如 AIME 2025),由于其策略已经错误锁定,额外的推理算力完全沦为在该错误策略下的密集局部搜索,几乎产生不了性能提升。
- 缺乏经验?(Missing experience)
-
核心结论:
- 自动化后训练中 AI 的核心缺失既不是经验、不是引导,也不是推理算力,而是缺乏在运行过程中自发启动(Spontaneous)策略重新评估的机制。
- 自动化后训练的性能上限由初始策略的好坏决定,无法通过更多的迭代轮数或更高的推理开销来扭转。
- 未来的解法不应单纯寄希望于更大规模的模型,而是应该设计促使策略修正的优化信号(如对“纠偏决定”给予奖励),或者在交互协议中显式地将策略审视设置为特定的决策点。
关键数据
-
大规模轨迹库统计数据:
- 论文共分析了来自 PostTrainBench 的 1,338 条 公开智能体后训练轨迹,涵盖了 7 个 基准测试(如 GSM8K、HumanEval、AIME 2025 等)、4 款 开源基础模型(1.7B 到 4B 参数)及 20 种 不同的智能体配置。
- 在这之中,共计有 900 条 轨迹至少启动过一次模型更新,合计包含了 5,111 次 验证过的训练实验。
- 强烈的默认策略锁定:80.7% 的 Claude Code 轨迹均锁定在全参数 SFT(监督微调),而多达 89.6% 的 Codex CLI 轨迹则锁定在 PEFT(参数高效微调)上。
- 极低战略性探索率:在 3,557 对 相邻的训练实验中,仅有 74 次(2.08%) 发生了实际的策略改变(如改变训练范式、数据源、阶段结构),其余均是超参数或数据的局部优化。
-
经验驱动干预实验数据(以 Qwen3-1.7B-Base 为基础模型的实验结果):
- GSM8K 数学基准:基础模型仅有 10.84%。自主基线升至 64.70% (±9.6),而在经验驱动脚手架下,其准确率进一步飙升至 77.30% (±3.8)(相较于基线显著上升了 +12.60 pp)。
- HumanEval 代码生成:基础模型仅有 5.48%。自主基线升至 22.00% (±10.4),在经验驱动干预下,大幅度提升至 62.80% (±6.1)(相较于基线极速缩窄差距,获得了 +40.80 pp 的提升)。
- AIME 2025 挑战性数学:基础模型 0.00%。自主基准为 3.33% (±0.0),经验驱动干预后为 5.56% (±1.57)(微幅提升了 +2.23 pp)。
-
建议采纳率的不对称数据:
- 主智能体在面对评估智能体的反馈时,其对微调参数、奖励值改变等执行层建议的采纳率高达 100% (8/8 采纳)。
- 然而,当评估智能体建议其跳转宏观训练策略时,其采纳率却跌落至 0% (0/8 采纳,0/3 采纳)。
-
人类引导效果数据:
- 在最艰难的 AIME 2025 测试上,仅通过在训练前规划阶段人类纠偏策略(例如让智能体放弃过度 SFT,直接采用 RL 策略),就能在后续自主执行中,将 pass@8 准确率从自主基线的 3.33% 和经验驱动的 6.67% 提高到最佳运行时的 13.33%(4/30)。
-
Token 消耗开销及瓶颈数据:
- 经验驱动框架消耗了比普通自主基线高出 2.1 倍至 7.9 倍 的 Token 处理总量。
- GSM8K:Token 消耗是基线的 7.9 倍,平均下游每提升 1 分需要处理约 7.3M 个 tokens。
- HumanEval:Token 消耗是基线的 2.8 倍,由于任务较易,每提升 1 分仅需 2.6M 个 tokens。
- AIME 2025:Token 消耗是基线的 2.1 倍,在最佳运行中,智能体为了多解出一道题(+3.3 分,在评估方差内),额外疯狂消耗了 66.7M 数量的 Token,相当于该测试上每提高 1 分就需要付出 20.0M tokens,这表明纯粹扩展推理算力来微调错误的锁定策略,收益会极快遭遇天花板。
https://arxiv.org/abs/2608.19072
更多推荐



所有评论(0)