用AI训练AI,用AI评估AI:Anthropic的"递归自进化",正在让大模型研发进入指数级加速

开篇:两个数字,一个时代的拐点

80%。

8倍。

这不是某个运营指标的环比增长,也不是某家创业公司的PR话术。这是2026年5月,Anthropic——Claude背后的公司——内部正在发生的事实:超过80%的合并代码由Claude撰写,工程师的日常代码产出相比2024年飙升了8倍。

当一家AI公司的代码主力已经是它自己造出来的AI;当这个AI已经开始自主提出假设、执行长达数百小时的强化安全实验,甚至展现出参与下一代模型设计与训练的潜力——我们面对的就是一个关于递归自我改进的拐点信号。

2026年6月初,Anthropic发布了一篇研究文章,标题直白得让人后背发凉:《When AI Builds Itself》(当AI构建自身)。

这篇文章是一份正在发生的事实报告。


一、什么是"递归自进化":从工具到闭环

先说清楚概念。

传统的大模型研发流程是线性的:人类研究员设计架构→人类标注数据→人类训练模型→人类评估模型→人类迭代。每一步的瓶颈都在人。团队规模决定速度,标注预算决定数据质量,研究员的认知边界决定模型能力天花板。

递归自进化打破了这条线性链。它的核心思路是:用AI完成研发链条上的每一个环节——从数据获取、数据筛选、模型优化到推理细化,然后用自动评估贯穿全程,形成闭环。模型自己造数据,自己筛数据,自己训练自己,自己评估自己。

这是AI接管研发本身,不是"AI辅助开发"。

Anthropic在文章中给出了一个清晰的LLM自我提升系统闭环框架,包含四个核心环节:

1. 数据获取

三条路径并行:

  • 静态筛选:从已有的大规模数据池中,用模型自身能力筛选出高质量、高价值的训练样本。相当于让AI自己当"数据标注主管",从海量数据里挑出最值得学的东西。
  • 环境交互:让AI智能体在真实或模拟环境中行动,通过试错获取新数据。比如让AI自己写代码、跑测试、看报错、修正——这个过程中产生的"经验"本身就是高质量训练数据。
  • 合成生成:AI根据自身的能力缺口,主动生成针对性的训练数据。哪里弱,就给自己出哪里的题。

2. 数据筛选

拿到数据后,怎么判断哪些该用、哪些该扔?两类机制:

  • 模型引导评分:用一个模型(可以是自身的一个版本)给数据打分,高分保留,低分淘汰。相当于AI自己当"质检员"。
  • 自适应选择:根据模型当前的弱点动态调整数据配比。数学差就多喂数学题,代码弱就多给代码样本。

3. 模型优化

这是闭环的引擎。Anthropic将其抽象为GRO框架——生成(Generation)、奖励(Reward)、优化(Optimization)三步循环。

4. 推理细化

训练完不是终点,推理阶段还可以继续优化,四条路径:

  • 解码策略:调整采样温度、top-p等参数,让模型在推理时表现更好。
  • 推理式增强:类似Chain-of-Thought,让模型在回答前先"想一想"。
  • 智能体系统增强:把模型放进一个多智能体框架里,通过工具调用、多轮交互来增强能力。
  • 测试时训练:在推理阶段对模型做轻量级微调,让它适应当前任务。

这四个环节首尾相连,自动评估贯穿全程,就构成了一个不需要人类持续介入的自我提升飞轮。


二、GRO框架拆解:生成、奖励、优化的三角关系

GRO是整个闭环里最关键的部分,值得单独拆开讲。

生成(Generation):AI怎么给自己造题?

三种方式:

  • 自我探索:模型自由生成内容,不设限制。类似于让AI"自由发挥",看能产出什么有价值的东西。
  • 精炼生成:在已有数据基础上做改进和增强。给AI一篇普通文章,让它改写成更好的版本,用改进后的版本训练自己。
  • 交互式生成:模型与环境或多智能体交互产生数据。比如两个AI对弈、对话、辩论,过程中产生的高质量交互数据可以反哺训练。

奖励(Reward):怎么判断"好"与"不好"?

奖励信号是整个框架里最微妙的部分。奖励信号错了,模型就会朝着错误的方向"自我进化"。三类信号:

  • 启发式奖励:用预设的规则给输出打分。简单直接,但规则本身是人写的,天花板被人限定。
  • 模型奖励:用另一个模型(或自身的另一个实例)来评估输出质量。这是最接近"AI评估AI"的方式,但也存在"评分模型本身有偏差"的问题。
  • 可验证奖励:用客观标准验证。代码能不能跑通、数学题答案对不对、测试用例过没过。这是最可靠的奖励信号,但只适用于有明确对错的任务。

优化(Optimization):拿到奖励信号后怎么更新?

  • 监督微调(SFT):用筛选后的高质量数据做监督学习。最稳定,但天花板受限于数据质量。
  • 强化学习(RL):用奖励信号驱动模型探索更优策略。上限高,但不稳定,容易"跑偏"。
  • 混合优化:SFT和RL结合,先用SFT打好基础,再用RL突破上限。目前主流做法。

GRO框架的核心洞察是:生成、奖励、优化三者必须协同。生成能力弱,训练数据就差;奖励信号有偏差,模型就会学歪;优化方法不当,再好的数据也发挥不出价值。任何一个环节掉链子,整个飞轮就转不起来。


三、六大挑战:飞轮不是想转就能转

递归自进化听起来很美,但Anthropic自己也很清醒地列出了六大挑战。这些已经在实践中碰到的硬骨头。

1. 数据自噬(Data Cannibalization)

模型用自己生成的数据训练自己,几轮之后,输出会逐渐收敛到一个越来越窄的分布上。就像一个人只读自己写的日记,视野会越来越窄,最终陷入信息茧房。这是递归自进化最根本的风险——自我繁殖不等于自我提升,没有外部信息注入,模型会退化。

2. 反馈信号缺陷

如果奖励模型本身不够好,它给出的信号就是错的。模型会朝着错误的方向"越努力越糟糕"。更棘手的是,奖励模型通常也是同一个大模型家族的产物,它和被评估的模型共享同样的偏见和盲区。

3. 优化驱动失败

强化学习本身就不稳定。在自我提升的场景下,模型可能找到"钻空子"的策略——比如学会生成看起来高质量但实际上无意义的内容来骗取高分。这就是著名的"奖励黑客"问题,在自进化场景下会更加严重,因为评估者也是AI。

4. 无效自我精炼

模型反复打磨同一段输出,表面上看分数在涨,但实际能力没有提升。这就像一个学生反复修改作文的措辞,但论点始终肤浅——形式在进步,实质在原地踏步。

5. 评估瓶颈

整个闭环依赖自动评估来判断"模型是不是变强了"。但如果评估体系本身覆盖不全,模型可能在某些维度上退化而不自知。尤其是在安全、伦理、长尾能力这些难以量化的维度上,自动评估几乎一定会漏掉很多东西。

6. 监督瓶颈

即便飞轮转起来了,人类仍然需要在关键节点上把关——确认方向没偏、安全没出问题、能力提升是真实的。但随着模型能力指数级增长,人类的监督能力变成整个系统最慢的瓶颈。模型一周迭代三轮,人类评估一轮要一个月,这个时间差会越来越大。


四、不止Anthropic:递归自进化正在成为行业共识

Anthropic不是唯一在这条路上狂奔的玩家。

田渊栋——前Google DeepMind研究科学家、Meta大模型团队核心成员——新创立的公司也已经推出了能够自主推进AI研究循环的系统,并且在三个基准测试上刷新了最好成绩。

这意味着什么?意味着递归自进化整个行业正在汇聚的方向。当多家独立团队从不同起点出发,都走到了同一个地方,这。

六大应用场景也说明了这个框架的普适性:代码、数学、医疗、金融、算法发现、科学研究。前两个是"可验证奖励"天然适用的领域——代码能跑通就是对的,数学题有标准答案。后四个则复杂得多,医疗诊断的对错、金融预测的好坏、科学假说的真伪,都不是简单能自动验证的。递归自进化在"有明确对错"的领域会率先爆发,在"没有明确对错"的领域则面临更大的挑战。


五、Anthropic的态度:愿有条件暂停

这是整篇文章里最值得玩味的一个细节。

Anthropic——一家正在把递归自进化推向现实的公司——公开表示,愿有条件暂停前沿研发。

这不是谦虚,也不是公关话术。这是一家比谁都清楚技术威力(和危险)的公司发出的预警信号。

想一想:如果模型真的能在未来两年内实现递归自我改进,意味着什么?意味着模型的能力增长曲线可能从"线性"跳变到"指数"。人类监管者面对的"每天都在变强"的系统。

更关键的问题是:当模型自己造自己、自己评自己的时候,人类还能理解它吗?

一个由人类逐行编写代码、逐条标注数据训练出来的模型,人类是可以"读懂"的——我们知道它的能力边界在哪,知道它为什么会犯某个错误。但一个由AI自主训练出来的模型,其内部结构和行为模式可能逐渐脱离人类的理解范围。就像你养了一只猫,你能理解它的行为;但如果这只猫开始自己繁殖,几代之后出现了一个你不认识的物种,你还敢说你"了解"它吗?

这就是监督瓶颈的深层含义:不仅仅是速度跟不上,更是认知能力跟不上。


六、判断与展望:我们该乐观还是恐惧?

我的判断是:两者都是,而且不矛盾。

乐观的一面:

递归自进化是解决"AI研发人才瓶颈"的根本路径。全球能做前沿大模型研发的工程师和研究员不超过几万人,这个数字远远支撑不了AGI的实现。但如果研发流程本身可以被AI接管,瓶颈就从"人类研究员的数量"变成了"算力规模"——而算力是可以用钱买的。

悲观的一面:

当一个系统能够自我改进、自我评估、自我迭代,且改进速度超过人类理解速度时,我们实际上是在建造一个人类无法完全掌控的黑箱。六大约束挑战中的每一个,单拿出来都不是小问题,六个叠加在一起,风险是乘法关系而非加法关系。

最现实的担忧是"AI会不会在不为人知的情况下跑偏"这种工程现实。 一个系统在代码能力上突飞猛进的同时,可能在安全对齐上悄悄退化,而自动评估系统——因为它和模型同源——很可能发现不了这个问题。


结语

80%的代码由AI撰写,8倍的工程师产出,数百小时的自主安全实验,下一代模型设计中的AI参与——这些不是预测,是2026年5月正在发生的事实。

递归自进化的飞轮已经开始转动。问题"转多快"和"谁来踩刹车"。

Anthropic给出的时间窗口是两年。两年时间,说长不长,说短不短。足够让行业格局天翻地覆,也足够让监管框架彻底滞后。

对于开发者和技术从业者来说,现在最该做的搞清楚这个飞轮的每一个齿轮是怎么转的。因为无论你愿不愿意,这个飞轮都会改变你的工作方式、你的行业,甚至你对"智能"这个概念的理解。

用AI训练AI,用AI评估AI——这不仅仅是技术范式的转变,这是人类与智能关系的一次根本性重构。

而我们,正站在这个拐点上。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐