自演化与自改进智能体 · 两篇综述合集
第一篇 · A Comprehensive Survey of Self-Evolving AI Agents(Fang, Peng, Zhang et al., 2025)
Fang, Peng, Zhang et al. — 把"自演化 AI agent"作为衔接 foundation model 与 lifelong agentic system 的新范式,用一个统一反馈环框架系统综述单 agent / 多 agent / 领域专用三类进化与优化技术。
Quick Overview
问题 现有 LLM agent 系统(单 agent 或多 agent)部署后依赖人工静态配置——架构、提示、工具、通信协议一旦设定即冻结,无法适应动态演变的真实环境(用户意图、任务需求、外部工具都会变)。问题是:如何让 agent 系统在与环境的持续交互中自主优化自身组件。
动机 ① 通常做法:大多数 agent 系统靠人工设计 workflow 与固定配置,部署即冻结;② 为何现在重要:真实环境持续演变,人工重配耗时、难扩展,而近年 agent evolution 与优化技术已积累到可被系统化的规模;③ 本文主旨:提出统一概念框架,把 feedback loop(System Inputs / Agent System / Environment / Optimiser)作为主线,把分散的自演化技术拢成可比的整体。
核心贡献
- 形式化 Self-Evolving AI Agents 的「三定律」(Endure / Excel / Evolve),并勾勒 LLM 中心学习范式从 MOP→MOA→MAO→MASE 的演进;
- 提出统一的概念框架,抽象出自演化反馈环(System Inputs / Agent System / Environment / Optimisers);
- 系统综述单 agent、多 agent、领域专用三类自演化与优化技术;
- 全面梳理评测、安全与伦理考量;
- 指出关键开放挑战并勾勒未来研究方向。
概览图:

图 3(Original)—— 看四件事如何闭合成一个反馈环:System Inputs 给定任务设定 → Agent System 执行 → Environment 给反馈 → Optimiser 据此更新 Agent System,直到达到性能阈值。
1 Introduction
论文先把困境放进一条更长的范式演进线索里。下表把四个范式在四个维度上摊开——四个维度本身是笔记从全文行文中归并出的比较框架(论文表 1 用的是另一组列),故整表标 Author,单元格里的事实均可在正文中找到对应。
| 范式 | 是否改参数 | 反馈 / 交互来源 | 单 / 多 agent | 人工配置程度 |
|---|---|---|---|---|
| MOP(离线预训练) | 否(冻结部署) | 静态语料预训练 | 单 | 全静态,人工设定后不再动 |
| MOA(在线适应) | 是(SFT / LoRA / RLHF) | 标注 / 评分 / 指令 | 单 | 部署后可更新,但仍人工触发 |
| MAO(多 agent 编排) | 否(不改参数) | agent 间消息 / 辩论 | 多 | 手工 workflow、固定协议、人工工具链 |
| MASE(多 agent 自演化) | 否(自精炼 prompt / memory / tool / 拓扑) | 环境反馈 + meta-reward | 多 | 群体自演化,人工配置最少 |
表(图源:Author)—— 四范式在「改不改参数 / 反馈来源 / 单多 agent / 人工配置程度」上的递进;四个维度是笔记的比较框架,单元格事实可在正文找到;读法:沿行看每一范式,沿列看某一维度如何从静态走向自主。

图 1(Original)—— LLM 中心学习的演化:从纯静态数据训练,到与动态环境交互,再到多 agent 协作与自演化的终身学习。
表 1(Original)—— 论文自带的四范式对比(交互反馈机制、核心技术、示意)。它的列比上表少一维"人工配置程度",上表是在其基础上重新归并而成。
四个范式不是并列,而是一条每一跳都有驱动力的演进链(驱动力的"为何跃迁"框架是笔记的归纳,标 Author)。
-
MOP(离线预训练) —— 起点:大规模静态语料预训练后冻结部署,不再适应。
-
MOA(在线适应)—— 驱动:部署后环境与任务会变,需要 SFT / LoRA / RLHF 等手段更新模型本身。
-
MAO(多 agent 编排) —— 驱动:单模型能力不足以应付复杂任务,需要多 agent 通信协作(此时不改参数)。
-
MASE(多 agent 自演化)
—— 驱动:手工 workflow、固定协议与人工工具链在动态环境下成为瓶颈,需要 agent 群体据环境反馈与 meta-reward 持续自我精炼。
时间线(图源:Author)—— MOP→MOA→MAO→MASE 四跳;每一跳解决前一阶段留下的一种"静态性"。
在进入技术综述前,论文用一张总图给出整篇的技术地图。

图 2(Original)—— 自演化与优化技术的可视分类树:单 agent / 多 agent / 领域专用三大方向,标注 2023–2025 的代表方法。读法:先看三大分支,再看每分支下的代表方法。
Definition
知识卡(图源:Derived)—— self-evolving AI agent 是一类自主系统:它通过与环境的交互,持续且系统地优化自身内部组件,以适应变化的任务、上下文与资源,同时保持安全、提升性能。"持续系统优化内部组件 + 在安全约束下"这两点把它和一次性微调、静态 agent 区分开。它衔接的是 foundation model 的静态能力与 lifelong agentic system 的持续适应。
Three Laws of Self-Evolving AI Agents
受 Asimov 机器人三定律启发,论文给出自演化的三条约束定律,后者以前者为前提。
| 定律 | 目标 | 约束对象 | 优先级 |
|---|---|---|---|
| I. Endure(安全适应) | 任何修改中都保持安全与稳定 | 安全性、稳定性 | 最高,是前置条件 |
| II. Excel(性能保持) | 保留或提升既有任务性能 | 任务性能 | 次之,以 I 为前提 |
| III. Evolve(自主演化) | 自主优化内部组件以应对变化 | 组件、结构 | 再次,以 I、II 为前提 |
表(图源:Derived)—— 三定律的目标、约束对象与优先级嵌套;关键在读"优先级"列:Excel 服从 Endure,Evolve 服从前两者,安全永远最高。
2 Foundation of AI Agent Systems
2.1 AI Agents
单 agent 由 foundation model(LLM)做核心推理,外加感知、规划、记忆、工具四个支撑模块;论文在此只做简要回顾,重点放在多 agent 系统的组织方式。
2.2 Multi-Agent Systems
多 agent 系统的两个关键设计维度是系统架构与通信机制。
2.2.1 System Architecture
MAS 的系统架构有三种,差别在控制方式与失败模式。
| 架构 | 控制方式 | 优点 | 缺点 / 失败模式 | 典型应用 |
|---|---|---|---|---|
| Hierarchical(层级) | 静态层级(线性 / 树) | 模块化、易开发、领域可优化 | 固定拓扑、适应性差 | 软件、医学、科研 |
| Centralised(中心) | manager-follower | 全局规划与具体执行兼顾 | 中心节点瓶颈、单点故障 | 通用任务编排 |
| Decentralised(去中心) | 对等分布式网络 | 无单点故障、鲁棒 | 信息同步 / 安全 / 协作成本高 | 世界模拟 |
表(图源:Derived)—— 三种 MAS 架构的取舍;层级结构牺牲适应性换可开发性,中心结构换来了单点风险,去中心结构换来协调成本。
2.2.2 Communication Mechanisms
通信方面,标准化协议是较新的一层,把 agent 间通信从临时消息推向可互操作。
| 协议 | 通信方向 | 身份 / 协商机制 | 特点 |
|---|---|---|---|
| A2A | 水平(peer-to-peer 任务委派) | 未说明 | 结构化委派,执行对调用方不透明 |
| ANP | 水平(去中心化 “agent internet”) | 内置 DID + 动态协议协商 | 安全、开放的横向通信 |
| MCP | 垂直(agent ↔ 外部工具 / 数据) | 统一 client-server 接口 | 标准化工具与数据接入 |
| Agora | 水平(元协议) | 动态协商通信方式 | 在自然语言与结构化之间切换 |
表(图源:Derived)—— 四类标准化协议;读法:A2A / ANP / Agora 管横向 agent 间,MCP 管纵向 agent↔工具。
2.3 The Vision of Lifelong, Self-Evolving Agentic Systems
MASE 愿景把监控自身性能、受控增量更新、自主改写 prompt / 记忆 / 工具 / 拓扑三件事嵌入架构核心,把 agent 从静态执行器变成持续学习的协作者。
3 A Conceptual Framework of MASE
论文用一个反馈环把"自演化"抽象成可比较的四组件闭环。
3.1 Overview of the Self-Evolving Process
(图源:Original,沿用论文图 3)

图 3(Original)—— 自演化过程的四组件闭环。读法:沿箭头看一轮迭代,Optimiser 的回边是"闭环"的关键。
一轮迭代按以下顺序流动(机制流,图源:Derived,把图 3 展开为步骤):
-
System Inputs 给定任务设定(任务级或实例级)。
-
Agent System (单或多 agent)在
Environment 中执行任务。
-
Environment 据评测指标给出反馈信号。
-
Optimiser 在搜索空间 𝒮 上用算法 ℋ 更新 𝒜(改参数 / 改 prompt / 改结构);必要时合成新训练样本反哺 Inputs。
-
更新后的 𝒜 重新部署,进入下一轮;直到达到性能阈值或收敛。
上述第 1–4 步分别落在 第 3.2 节 System Inputs / 第 3.3 节 Agent Systems / 第 3.4 节 Environments / 第 3.5 节 Optimisers,下文逐一展开。
Optimiser 的目标是公式 (1):
𝒜*=argmax𝒜∈𝒮 𝒪(𝒜; ℐ)
公式(图源:Original)—— 在搜索空间 S 中找让评测函数 O(A; I) 最大的 agent 配置 A*。
各符号汇总如下(记号表,图源:Derived):
| 符号 | 含义 | 定义处 |
|---|---|---|
| ℐ | system inputs(任务设定) | 第 3.2 节 |
| 𝒜 | agent system(被优化的对象) | 第 3.3 节 |
| 𝒮 | search space(可探索的 agent 配置集合) | 第 3.5 节 |
| 𝒪(𝒜;ℐ) | 评测函数,把 A 在 I 上的性能映射为标量 | 公式 (1) |
| ℋ | 优化算法(启发式 / 梯度 / BO / MCTS / RL / 进化 / 学习策略) | 第 3.5 节 |
| 𝒜* | 最优 agent 配置(argmax O) | 公式 (1) |
3.2 System Inputs
系统输入 ℐ 定义问题设定与优化范围,分两种粒度,各自的输入构成与优化目标不同(对比表,图源:Derived)。
| 粒度 | 输入构成 ℐ | 优化目标 | 缺标注数据时 |
|---|---|---|---|
| 任务级(Task-Level) | {τ, 𝒟train},可另留 𝒟test 评估 | 提升整个任务上的整体性能 | 用 LLM 合成替代训练集 |
| 实例级(Instance-Level) | {(x,y), 𝒞}(输入输出对 + 可选上下文) | 提升某一具体样本上的性能 | 未说明 |
表(图源:Derived)—— 系统输入两粒度;读法:任务级面向一类任务的整体性能,实例级面向单个样本、是更细粒度的设定。
3.3 Agent Systems
被优化的核心对象是 agent 系统 𝒜,可单 agent 也可多 agent。𝒜 可分解为多个组件——底层 LLM、prompting 策略、memory 模块、tool-use 策略,多 agent 系统再加 inter-agent 拓扑;后续 第 4、5 节 的方法分别落在这些组件上。优化范围是 𝒜 的一个设计维度:只动一个组件,还是联合多个(对比表,图源:Derived)。
| 优化范围 | 改什么 | 论文举例 | 在本笔记 |
|---|---|---|---|
| 单组件优化 | 只动 𝒜 的一个组件 | 微调 LLM;或调 prompt / 选工具(不改 LLM 本身) | 第 4 章多数方法 |
| 多组件联合优化 | 同时动多个组件 | 单 agent:LLM + prompt;多 agent:prompt + 拓扑 | 第 5.2.3 节 unified |
表(图源:Derived)—— 𝒜 的优化范围;读法:多数现有工作只动单组件,联合优化更新、能建模组件间耦合——后者正是 第 5.2.3 节 unified 一脉的动机。
3.4 Environments
环境既提供运行上下文(从 benchmark 数据集到真实动态环境;代码任务里是编译器 / 解释器 / 测试用例,科研里是文献库 / 仿真 / 实验设备),也产生反馈信号;反馈来源分两种,差别在"有无 ground-truth"(对比表,图源:Derived)。
| 反馈来源 | 适用条件 | 形式 | 例子 |
|---|---|---|---|
| 任务评测指标 | 有 ground-truth 或可执行验证 | 定量(accuracy / F1 / success rate) | 代码:编译器 + 测试用例的执行反馈 |
| LLM evaluator | 无 ground-truth | 代理指标或文本反馈(正确性 / 相关性 / 连贯性 / 对齐) | 评输出的 correctness / relevance / coherence |
表(图源:Derived)—— 环境反馈两来源;读法:有 ground-truth 时直接用任务指标,没有时退而用 LLM 当裁判给代理信号——这正是 第 7.2 节 LLM-based 评测的由来。评测策略详见 第 7 节。
3.5 Optimisers
优化器据环境反馈在搜索空间 𝒮(粒度从 prompt / 工具策略到连续 LLM 参数 / 架构结构)上,用算法 ℋ 找最优配置;论文把 ℋ 归为七类(启发式 / 梯度 / BO / MCTS / RL / 进化 / 学习策略)。(𝒮,ℋ) 共同决定优化器行为,目标即公式 (1)。后续 第 4、5、6 节 分单 agent / 多 agent / 领域三种设定展开(总览见图 5)。
框架落地后,方法如何分布?论文用一张总层级图把全书方法挂上去。

图 5(Original)—— 自演化方法的完整层级分类(单 agent / 多 agent / 领域专用),配代表工作。读法:三层从上到下,叶子是具体方法。
4 Single-Agent Optimisation
单 agent 优化按"被优化的组件"分成四类(图源:Original,沿用图 4)。

图 4(Original)—— 单 agent 优化按目标组件的分类(prompt / memory / tool;正文另把 LLM 行为列为第四类)。读法:先看三类组件,再看各自方法。
四个目标组件构成一棵两层分类树(分类,图源:Derived):根为单 agent 优化,第一层为 LLM 行为 / prompt / memory / tool 四类,每类下再分方法族。
注:图 4 的标题只列 prompt / memory / tool 三类,而正文明确说"四大类(含 LLM 行为优化)";笔记按正文更完整的四类组织。
4.1 LLM Behaviour Optimisation
LLM 行为优化分训练式(第 4.1.1 节,改参数)与测试式(第 4.1.2 节,不改参数)两路,再各分两族;四族在"优化信号 × 更新方式"上不同(对比表,图源:Derived)。
| 子路 | 优化信号 / 反馈来源 | 更新方式 | 代表方法 |
|---|---|---|---|
| 训练式 · SFT(第 4.1.1 节) | 标注推理轨迹(自身 rollout / 教师演示) | 监督微调(模仿轨迹) | STaR、NExT、Deepseek-Prover |
| 训练式 · RL(第 4.1.1 节) | 偏好对 / 可验证奖励 / 过程奖励 | 强化学习(奖励驱动策略更新) | DPO、Absolute Zero、DeepSeek-R1(GRPO)、R-Zero |
| 测试式 · 反馈(第 4.1.2 节) | 外部 verifier(编译器 / 过程奖励模型) | 据分数 refine 当前输出 | CodeT、LEVER、Baldur |
| 测试式 · 搜索(第 4.1.2 节) | 多候选 + verifier | 采样多条再选最优 | CoT-SC、Tree-of-Thoughts、Graph-of-Thoughts |
表(图源:Derived)—— LLM 行为优化四子路;读法:沿"子路"看训练式改参数、测试式不改,沿"优化信号"看从轨迹到奖励到 verifier 的递进。
4.2 Prompt Optimisation
prompt 优化是四类中方法族最齐整的一类,论文 第 4.2.1–4.2.4 节 给出四族,各自搜索操作与信号不同(第 4.2.1 节 Edit-based / 第 4.2.2 节 Generative / 第 4.2.3 节 Text-gradient / 第 4.2.4 节 Evolutionary)。
| 方法族 | 搜索操作 | 优化信号 | 探索范围 | 代表方法 |
|---|---|---|---|---|
| Edit-based | 插入 / 删除 / 替换等局部编辑 | 评测分数 | 局部(prompt 邻域) | GRIPS、TEMPERA |
| Generative | 让 LLM 整体重写 prompt | 历史 prompt + 分数 / exemplar / meta-prompt | 全局(更广 prompt 空间) | ORPO、PromptAgent、MIPRO |
| Text-gradient | 生成"文本梯度"再反向更新 | 自然语言 critic | 沿"梯度"方向 | ProTeGi、TextGrad |
| Evolutionary | 变异 / 交叉 / 选择 | 种群适应度 | 种群演化 | EvoPrompt、Promptbreeder |
表(图源:Derived)—— prompt 优化四族;读法:沿"搜索操作"列看四族如何各走一条搜索路径,沿"探索范围"看从局部走向种群。
4.3 Memory Optimisation
记忆优化只覆盖推理时策略(不改参数),分短期(第 4.3.1 节)与长期(第 4.3.2 节),两者优化目标与机制不同(对比表,图源:Derived)。
| 类别 | 优化目标 | 核心机制 | 代表方法 |
|---|---|---|---|
| 短期记忆(第 4.3.1 节) | 管理有限上下文、保持局部连贯 | 摘要 / 选择性保留 / 稀疏注意力 | Reflexion、MemoryBank、MoT |
| 长期记忆(第 4.3.2 节) | 跨会话持久检索、扩展记忆范围 | RAG / 向量索引 / 知识图 | MemGPT、HippoRAG、A-MEM、Mem0 |
表(图源:Derived)—— 记忆优化两类;读法:短期管"当下上下文"靠压缩保留,长期管"跨会话知识"靠检索;短期不足以泛化,故需长期补。
4.4 Tool Optimisation
工具优化分三个方向,差别在"优化对象 × 做法"(对比表,图源:Derived)。
| 方向 | 优化对象 | 做法 | 代表方法 |
|---|---|---|---|
| 训练式(第 4.4.1 节) | LLM 参数 | SFT / RL 教模型何时用、怎么用工具 | ToolLLM、ReTool、Tool-N1 |
| 推理式(第 4.4.2 节) | 工具文档 / prompt | 重构文档或树搜索选工具 | EASYTOOL、ToolChain、Tool-Planner |
| 功能优化(第 4.4.3 节) | 工具本身 | 修改或创造新工具 | CREATOR、LATM、CRAFT |
表(图源:Derived)—— 工具优化三方向;读法:沿"优化对象"看从模型参数到文档到工具本身——前两向让 agent 更会用既有工具,第三向让 agent 自造工具。
5 Multi-Agent Optimisation
多 agent 优化的总图把"手动设计 → 自演化"这条轴,与自演化下的四条优化维度一起画出。

图 6(Original)—— 多 agent 优化:左侧核心元素(空间 / 方法 / 目标),右侧优化维度(prompt / topology / unified / backbone)。读法:左看优化要素,右看四条优化维度。
5.1 Manually Designed Multi-Agent Systems
手动设计端给出三种现成 workflow 作为基线,它们拓扑固定、靠人工编排,是自演化方法的对照起点;三者在"拓扑 × 取舍"上不同(对比表,图源:Derived)。
| Workflow | 拓扑 / 协作方式 | 优点 | 代价 / 失败模式 |
|---|---|---|---|
| Parallel(并行) | 并发执行 + 投票聚合 | 吞吐横向扩展、多层聚合降误差 | 协调一致性工程成本随规模指数增长 |
| Hierarchical(层级) | 多层自上而下 / 顺序流水线 | 擅长复杂目标驱动任务(深度研究、代码生成) | 固定拓扑、适应性差 |
| Debate(辩论) | 对抗-协商-仲裁循环 | 平衡准确性与可解释性;置信度门控可降推理成本 | 实现与维护成本高 |
表(图源:Derived)—— 三种手动 workflow;读法:并行换扩展性、层级换可控性、辩论换可解释性,共性是拓扑固定——这正是自演化要松开的。
5.2 Self-Evolving Multi-Agent System
自演化端把工作流优化当成搜索问题,按被优化的维度分四类(分类,图源:Derived):prompt / topology / unified / backbone,对应 第 5.2.1–5.2.4 节;四类各自优化什么、在什么空间上搜,见下表(对比表,图源:Derived)。
| 优化维度 | 优化对象 | 搜索空间 | 代表方法 |
|---|---|---|---|
| prompt(第 5.2.1 节) | agent 指令 / 角色 / 团队配置 | prompt 文本 / 角色设置 | AutoAgents、DSPy |
| topology(第 5.2.2 节) | agent 间连接 / 通信结构 | 代码图 / 通信图 | AFlow、GPTSwarm、AgentPrune |
| unified(第 5.2.3 节) | prompt + topology(+ tool)联合 | 统一代码 / 配置 | ADAS、EvoAgent、MASS、MaAS |
| backbone(第 5.2.4 节) | 底层 LLM 参数 | 模型权重 | Sirius、MALT、OPTIMA |
表(图源:Derived)—— 四条优化维度;读法:沿"优化对象"看从指令到连接到联合到模型参数,搜索空间随之从文本到图到代码到权重。
前三类(prompt / topology / unified)在"搜索空间表示 × 优化算法"上分布很广,论文按方法叙述、未列表;下表把它们的代表方法重新归并(图源:Derived)。
| 方法 | 优化维度 | 搜索空间表示 | 优化算法 | 特点 |
|---|---|---|---|---|
| AutoAgents | prompt(团队配置) | 角色与执行计划 | 结构化对话(meta-agents) | 从单 agent 扩到整队配置 |
| AFlow | topology | 可复用算子组成的代码图 | MCTS(LLM 引导扩展) | 比 RL over CoRE 更样本高效 |
| GPTSwarm | topology | 计算图中的连接 | RL(松弛为连续边概率) | 学习最优 agent 连接 |
| ADAS | unified | Python 代码(prompt+workflow+tool) | 元 agent 搜索 | 代码即统一表示,prompt 与拓扑共演化 |
| EvoAgent | unified | 文本 agent 设置(角色 / 技能 / prompt) | 进化(变异 / 交叉 / 选择) | 显式演化配置级特征 |
| MASS | unified | prompt + workflow 拓扑 | 三阶段条件耦合优化 | 局部 prompt → 拓扑 → 全局 prompt 交替 |
| MaAS | unified | agent 超网(架构分布) | 控制器 + MC + 文本梯度 | 查询级采样,推理成本大降 |
| AgentPrune | topology(剪枝) | 时空通信图的边 | 低秩引导图掩码(一次性剪枝) | 以 token 经济为优化目标 |
表(图源:Derived)—— 八个代表方法在"维度 / 表示 / 算法"上的分布;读法:沿"搜索空间表示"看从代码到图到文本配置,沿"优化算法"看从 RL 到 MCTS 到进化。
5.2.4 LLM Backbone Optimisation
backbone 优化分两条路,差别在"练什么"。Reasoning-oriented(Sirius、MALT、MaPoRL、MARFT)用多 agent 协作轨迹做 SFT / DPO / RL,练推理与角色专精;collaboration-oriented(COPPER、OPTIMA)直接训"会不会协作",OPTIMA 报告 2.8× 性能、token 成本不到 10%。前者把 backbone 当推理器,后者把它当队友——前者依赖高质量轨迹,后者依赖通信效率信号。
6 Domain-Specific Optimisation
通用方法之外,领域系统把优化策略与领域约束紧耦合。论文按三领域组织:第 6.1 节 生物医学、第 6.2 节 编程、第 6.3 节 金融与法律,每领域两个子任务,共六个。
6.1 Domain-Specific Optimisation in Biomedicine
生物医学覆盖 第 6.1.1 节 医疗诊断与 第 6.1.2 节 分子发现,约束在临床流程、循证工具与化学可证性(对比表,图源:Derived)。
| 子任务 | 代表方法 | 优化目标 | 领域约束 / 特有机制 |
|---|---|---|---|
| 医疗诊断(第 6.1.1 节) | MDAgents、MedAgent-Pro、MedAgentSim | 多轮问诊 + 多模态证据推理 | 临床流程、循证工具、不确定性 |
| 分子发现(第 6.1.2 节) | CACTUS、ChemAgent、DrugAgent | 化学结构的符号推理 | 化学工具(RDKit)、可证性 |
表(图源:Derived)—— 生物医学两子任务;诊断绑临床流程与多模态证据,分子绑化学工具与可证性。
6.2 Domain-Specific Optimisation in Programming
编程覆盖 第 6.2.1 节 代码精炼与 第 6.2.2 节 代码调试,约束在软件工程最佳实践与运行时反馈(对比表,图源:Derived)。
| 子任务 | 代表方法 | 优化目标 | 领域约束 / 特有机制 |
|---|---|---|---|
| 代码精炼(第 6.2.1 节) | Self-Refine、CodeAgent、OpenHands | 迭代提升代码质量与结构 | 软件工程最佳实践、工具增强 |
| 代码调试(第 6.2.2 节) | Self-Debugging、PyCapsule、FixAgent | 故障定位 + 执行感知修复 | 运行时反馈、模块化角色 |
表(图源:Derived)—— 编程两子任务;精炼绑自反馈与最佳实践,调试绑运行时反馈与模块化角色。
6.3 Domain-Specific Optimisation in Financial and Legal Research
金融与法律覆盖 第 6.3.1 节 金融决策与 第 6.3.2 节 法律推理,约束在合规与判例锚定(对比表,图源:Derived)。
| 子任务 | 代表方法 | 优化目标 | 领域约束 / 特有机制 |
|---|---|---|---|
| 金融决策(第 6.3.1 节) | FinCon、PEER、FinRobot | 动态市场下的决策与报告 | 数值 + 新闻 + 专家知识、合规 |
| 法律推理(第 6.3.2 节) | LawLuo、AgentCourt、LegalGPT | 规则锚定的论证与审判模拟 | 法规与判例、程序一致性 |
表(图源:Derived)—— 金融与法律两子任务;金融绑合规与多源信息,法律绑判例与程序一致性;跨三领域共性是把领域约束写进优化目标。
7 Evaluation
评测被当作动态反馈机制,而不仅是终点。它沿三条线组织(分类,图源:Derived):benchmark-based / LLM-based / safety。
7.1 Benchmark-based Evaluation
benchmark-based 一支按所测 agent 能力分五类(工具 / API、Web 导航、多 agent 协作与通才、GUI 与多模态、领域任务),各类下挂着大量具名基准;下表选出代表,标出所测能力与盲点(对比表,图源:Derived)。
| Benchmark | 类别 | 评的能力 | 环境 / 指标 | 局限 |
|---|---|---|---|---|
| ToolBench、API-Bank | 工具 / API | API 调用正确性与效率 | 模拟 API / 沙箱 | 易过拟合特定 schema |
| GTA、AppWorld | 工具 / API | 多步规划 + 多工具协调 | 过程导向指标 | 未说明 |
| WebArena、VisualWebArena | Web 导航 | 导航 + 图文整合 | 模拟 / 真实网页 | 可复现性、界面变化 |
| GAIA、AgentBench、MultiAgentBench、SwarmBench | 多 agent 协作 / 通才 | 跨环境适应;协作 / 竞争 / 通信与策略质量 | 多任务聚合 | 指标聚合难、易过拟合 |
| OSWorld、AndroidWorld | GUI / 多模态 | 复杂动作序列 + 状态管理 | 真实 OS / App | 标准化难、界面脆弱 |
| SWE-bench | 领域(编程) | 真实仓库代码编辑 | 测试通过率 | 未说明 |
| AgentClinic、MMedAgent | 领域(医学) | 临床多模态推理 | 领域一致性 | 指标定义不一 |
表(图源:Derived)—— 代表基准;读法:沿"类别"看五类能力,沿"局限"看共同痛点——可复现性、泛化、指标定义不一。
7.2 LLM-based Evaluation
LLM-based 一支用大模型当裁判:LLM-as-Judge(pointwise / pairwise)只评最终输出,Agent-as-Judge 则评整条推理轨迹而非只看输出。
7.3 Safety, Alignment, and Robustness in Lifelong Self-Evolving Agents
safety 一支(AgentHarm、RedCode、MACHIAVELLI、SafeLawBench 等)测恶意顺从、权力寻租与法律对齐。共同短板:多数评测是快照式的,对 MASE 这种持续演化的系统,需要纵向、演化感知的评测。
8 Challenges and Future Directions
8.1 Challenges
挑战按三定律归组(Endure / Excel / Evolve,对应 第 8.1.1–8.1.3 节),共七个;每个挑战都点出成因与所需能力(对比表,图源:Derived)。
| 挑战 | 所属定律 | 成因 | 所需能力 / 方向 |
|---|---|---|---|
| 安全 / 监管 / 对齐 | Endure | 优化优先任务指标、忽视安全;动态 agent 冲击静态法规 | 演化感知审计、可证安全沙箱 |
| 奖励建模与优化不稳定 | Endure | 中间步骤奖励数据稀缺、监督噪声、反馈不一致 | 稳定的奖励与更新规则 |
| 科学 / 领域场景评测 | Excel | 缺乏可靠 ground-truth | 可信反馈信号的构造 |
| MAS 效率—效果平衡 | Excel | 大规模 MAS 算力 / 延迟 / 不稳定 | 显式建模性能—资源权衡 |
| prompt / 拓扑可迁移性 | Excel | 优化结果对 backbone 脆弱 | 跨 backbone 可迁移 |
| 多模态 / 空间环境优化 | Evolve | 多数算法仅文本 | 内部世界模型、感知—时序推理 |
| 工具使用与创造 | Evolve | 多假定固定工具集 | 工具的自主发现与共创 |
表(图源:Derived)—— 七个挑战;读法:沿"所属定律"看 Endure 管安全稳定、Excel 管性能、Evolve 管自主优化,沿"成因"看每个挑战的根。
8.2 Future Directions
五个未来方向各自承接范式演进的一个阶段(对比表,图源:Derived)。
| 未来方向 | 承接范式阶段 | 对应挑战(笔记归纳) | 关键举措 |
|---|---|---|---|
| 全自主自演化的仿真环境 | MASE | 工具共创 / 多模态 | 开放交互式仿真平台,闭环优化 prompt / memory / tool / workflow |
| 推进工具使用与创造 | MAO→MASE | 固定工具集假设 | 自适应选择 / 组合 / 创造工具 + RL + 评测管线 |
| 真实世界评测与基准 | Cross-stage | 评测快照化 | 反映真实复杂度、交互式 + 纵向评测 |
| MAS 效率—效果权衡 | MAO | MAS 算力 / 延迟 | 联合建模性能与资源约束 |
| 面向科学的领域感知演化 | MASE | 领域 ground-truth 缺失 | 异构知识源、定制评测、合规 |
表(图源:Derived)—— 五个方向;读法:沿"承接范式阶段"看每个方向推着 MOP→MOA→MAO→MASE 往前走哪一步。
9 Conclusions
洞察(图源:Author)—— 全文的主线是"把静态一路松开":MOP→MOA→MAO→MASE 松开的是参数、协作、最后是配置本身;统一反馈环(System Inputs / Agent System / Environment / Optimiser)给了这条松开过程一个共同骨架,三定律则给"能松到什么程度"加了护栏——安全永远高于性能、性能高于自主。框架是骨架,定律是边界,范式演进是动力,三者合力把 agent 从"训练一次"推向"活、学、持久"。一处需读者留意:结论把反馈环第三组件称为 “Objectives”,而第 3 节称为 “Environment”,论文自身在此命名不一致。
注:Acknowledgements 与 References 按非内容块略去,不单列。
第二篇 · Self-Improvements in Modern Agentic Systems: A Survey(Gao et al., 2026)
一篇把"自改进智能体"从经典 AI 根源到现代 FM 智能体打通的综述。笔记保留论文原章节顺序,在每节升级表征(对比表 / 演进时间线 / 设计矩阵 / 问题卡),并把论文全部 12 张图 + Table 4 图标悉数保留。
Quick Overview
问题 现代 foundation-model (FM) 智能体能否在极少乃至无人介入下,把自己跑出来的经验持续转成能力增益;而既有综述常把"改模型参数"与"改脚手架 (scaffold)"当两个孤立话题,术语(self-correction / meta-prompting / self-play)又彼此重叠,缺一个统一形式化与历史脉络。
动机
-
① 已有综述多按"改什么 / 何时改 / 怎么改"组织,或只覆盖静态 LLM 的自学习,常把 fine-tuning 与 scaffolding 割裂,也少追溯至经典 AI 的自改进根源;
-
② foundation model 让自然语言成为统一的语义介质,把过去在汇编码 / 原始权重空间里的低层自修改搜索空间骤然压缩,使自改进首次可规模化;
-
③ 本综述用一个系统级框架把智能体写成
𝒜=(θ,Σ),把自改进形式化为自诱导更新算子 𝒰,再按"改什么(θ 还是 Σ)"与"信号从哪来"两条轴统一组织文献。
核心贡献
- 历史脉络与演化:从经典 AI(最小二乘、控制论、Gödel 机、快速权重编程器)到现代 FM 智能体,梳理自改进机制如何迁入 agentic 时代;
- 统一形式化与系统分类法:在 𝒜=(θ,Σ) 框架下把机制分成 foundation model improvement 与 scaffold improvement 两条路径(覆盖 prompt / memory / tool / full-scaffold);
- 经验版图、评估范式与前沿:结合软件工程、网页导航、科学发现等应用与评估协议分析,指出可靠、可持续自改进需考虑的安全因素与挑战。
概览图(图源:Original)— 看两条路径如何分:

Figure 1
Figure 1 把"改什么"切成两条路:左路 Foundation Model Improvement 更新参数 θt→θt+1,信号来自内在生成式示范 𝒟t / 内在评估反馈 et / 外在探索经验 τt;右路 Scaffolding Improvement 非参数地更新脚手架 Σt→Σt+1,由统一信号 St 驱动 prompt p、memory m、tool 𝒯 或全脚手架 Σ。这张图是全文的总纲,后续每节都在这两条路上展开。
1 Introduction
论文先抛出 Good (1966) 的"超智能机器是人类需要做出的最后一项发明",把自改进定位成一个自指 (self-referential) 过程:系统自主审视、评估并刻意修改自身的优化机制与操作逻辑。古典机制(Schmidhuber 1987 自指学习、2003 Gödel Machine)能证明性地改写自身,但受困于在低层汇编码 / 权重空间搜索;现代 FM 用自然语言把搜索空间骤然压缩,让自改进首次可规模化。
要落地,作为认知核的 FM 外面通常裹一层 operational scaffold(指令、记忆、工具、控制逻辑,亦称 agent harness)。论文据此提出二分总纲:
自改进(按"改什么"切两条路)├─ Foundation Model Improvement 改 θ:慢、稳、可跨任务摊销└─ Scaffolding Improvement 改 Σ:快、可逆、任务相关 └─ 再按"信号从哪来"细分
(图源:Derived,依据 Figure 1 / Figure 3 重画的两层切分)
与既有综述的定位差异
论文用 Table 1 把自己和三篇近综述在 8 个组织维度上对比(图源:Original)。读法:✓=primary、◦=secondary、–=not focus;Ours 一列在 8 维全为 primary,凸显"统一形式化 + 历史根源 + 领域覆盖"三处是别家少做的。
| Dimension | Ours (2026) | Gao et al. (2026a) | Fang et al. (2025a) | Tao et al. (2024) |
|---|---|---|---|---|
| Agent formulation | ✓ | ✓ | ✓ | ◦ |
| Definition scope | ✓ | ✓ | ◦ | ◦ |
| Historical roots | ✓ | – | ◦ | ◦ |
| Signal lens | ✓ | ◦ | ✓ | ✓ |
| Update substrate | ✓ | ✓ | ✓ | ◦ |
| Evaluation lens | ✓ | ✓ | ✓ | ✓ |
| Domain coverage | ✓ | ◦ | ◦ | – |
| Outlook & issues | ✓ | ◦ | ✓ | ◦ |
论文据此主张:前人常把 fine-tuning 与 scaffolding 当孤立话题、缺乏统一形式视角,也很少把概念根源追到经典 AI;本综述要补的就是"统一形式化 + 历史演化 + 前瞻路线图"三件。
两条路的代表工作分布(2023–2026)
(图源:Original)下面 Figure 2 把代表性工作按发表年份排进左 (θ)、右 (Σ) 两道;读时注意左右两道在 2024 年后都迅速加密,且末端指向 AGI 路标——这是全文"长期向一般化智能演进"的伏笔。

Figure 2
Figure 2 显示:foundation-model 一侧(左道)多靠 RL/微调周期推进,scaffolding 一侧(右道)则在 2024–2026 间涌现大量 prompt/memory/tool/full-scaffold 的迭代工作;两条道都在加速,但节奏与可逆性不同。
2 Historical Context and Theoretical Foundations
论文的核心论点:自改进不是 FM 时代的新发明,而是 AI 的基础目标。区别于"在固定架构里优化参数"的标准机器学习,真正的自改进要求系统显式审视并改写自身的操作逻辑 / 启发式 / 学习算法。
下面的演进时间线(图源:Author)按论文第二章的五个历史范式整理,每跳点标出驱动它的瓶颈——即上一个范式卡在哪里、才逼出下一个:
| 时代 | 代表 | 关键机制 | 卡点 / 驱动下一跳 |
|---|---|---|---|
| ① 1790s–1960s 基础概念 | 最小二乘 (Legendre/Gauss)、Cybernetics (Wiener)、homeostasis (Ashby)、Turing child machine、perceptron、Samuel checkers | 误差驱动适配、反馈闭环 | 架构与学习算法固定,只是"高级学习"而非自指自改进 → 需要 Gödel 1931 的自指蓝图与 Good 1966 的概念 |
| ② 1960s–1980s 符号启发式 | von Neumann 自复制自动机、AM、EURISKO | 把启发式当一等公民对象来改写 | EURISKO 的成功重度依赖人类做外部评估信号,缺自主闭环信用分配 → 逼向连接主义元学习 |
| ③ 1980s–2000s 连接主义 & 元学习 | Schmidhuber 自指学习、fast-weight programmers (=1991 unnormalized linear Transformer)、自指权重矩阵、Gödel Machine (2003)、AIXI、NEAT | 把学习过程本身当搜索对象;连续程序空间的自修改 | 仍受限于低层权重 / 代码搜索,难 open-ended → 需要形式化安全与可规模化工程 |
| ④ 2000s–2020s 形式化 & 架构级 | Orseau & Ring(自欺、reward tampering)、reflective oracles、logical induction、NAS、self-play | 理论上界定自改进风险;工程上自动搜架构 | 理想模型与实际部署有鸿沟 → 等 FM 提供高表达力通用基底 |
| ⑤ 2020s–至今 可扩展 FM | in-context learning(=fast-weight programmers 的 KV cache 等价)、RLHF、Constitutional AI、ReAct、Reflexion、skill libraries | 自然语言作统一语义介质;快(in-context)+ 慢(参数)两层嵌套环 | 古典控制 / 评估 / 安全问题在新规模上重现 |
(图源:Original)Figure 4 是论文自己画的理论根源时间线(1790s 至今),与上表一一对应,可对照阅读:

Figure 4
Figure 4 的要点:从"误差驱动适配"到"自指机器"花了约两个世纪,真正的自指要到 1987 年 Schmidhuber 的自指学习框架才有了可操作算法,2003 年 Gödel Machine 给出理论天花板(可证明地改写自身),而 FM 让这些古典原则首次能 open-ended 地规模化。
一条贯穿主线的洞见(图源:Author):五个范式其实在反复解决同一个张力——“自改进需要系统改自身,但改自身又需要可靠的内部评估信号”。EURISKO 卡在外部人工评估,现代 self-judge 方法卡在 evaluator-policy 耦合,根是同一个。
3 Definitions
形式化框架:把智能体写成 𝒜=(θ,Σ)
论文把一个 FM 智能体在时刻 t 的配置定义为
𝒜t = (θt, Σt), Σt := (pt, mt, 𝒯t, gt),
其中 θt 是 FM 的神经参数,Σt 是动态操作脚手架:pt(结构化 prompt / 系统指令)、mt(记忆及其检索更新策略)、𝒯t(外部工具及调用接口)、gt(路由 / 调度 / 安全等控制逻辑)。FM 本身是无状态推理引擎,autonomy 来自把它与这个持久、可交互的 scaffold 耦合。
执行时还维持一个短暂执行态 Xt(KV cache、中间计划、工作记忆),它随交互流演化,但一旦任务边界跨过就被丢弃——因此 Xt不属于智能体的内在架构;内在的只有 (θt,Σt)。诱导策略记为 πθt,Σt(At Xt)。
(图源:Original)Figure 5 是该形式化的示意,读时盯住"哪些是内在 (θ,Σ)、哪些是短暂 Xt"这条分界:

Figure 5
Figure 5 表明:标准智能体只靠动态更新 Xt(如 in-context 例子)适配新情况,能力被初始配置封顶;自改进智能体则会持久地改 (θ,Σ)。
自改进算子 𝒰:执行相 + 更新相
承接 𝒜t=(θt,Σt),论文把 foundation-model 智能体的自改进(SI-FMA,Self-Improvement in Foundation-Model-based Agents)定义为持久的、内源的适配过程:智能体主动利用自身执行诱导出的信号——交互结果、批评、验证结果、编辑建议——去持久地修改自身的计算组件(θ 或 Σ),区别于 Xt 的常规演化;其根源是显式自指元学习(Schmidhuber, 1987/1993/1997)。该过程被进一步概念化为一个自诱导更新算子 𝒰,拆成两相:
𝒜t+1 = 𝒰(𝒜1:t, ℰ(πθt,Σt; Σt, 𝒞t)).
- ℰ:执行相——跑诱导策略、产出学习信号(轨迹 / 反思 / 批评 / 编辑建议);Σt 作为显式参数传入,允许自检(如批评 prompt 模板);
- 𝒰:更新相——把自产信号提交成 θ 或 Σ 的持久改动(区别于 Xt 的常规演化)。
两种自指模式:① 间接——策略生成经验 / 辅助产物当监督,再由外部优化过程改 θ(分布层自改进);② 直接——策略通过动作编辑 prompt / 改组记忆 / 重配工具 / 改控制逻辑,直接改 Σ(动作层自改进)。对应两条路径:foundation model improvement(参数空间,eq. 5)与 scaffolding improvement(执行空间,eq. 6)。
Skill:横跨两条路径的可复用更新
(图源:Author 洞见)论文把 skill 建模成算子 𝒰 的一个可复用实例——一个被保留、可复用的对 𝒜t 的命名更新。skill 的身份是"它编码的更新",基底只是"存到哪":
-
序列化到基底:工具及调用约定 (
𝒯)、指令 / 工作流 §、记忆条目 (m)、固化权重 (θ)、控制逻辑 (g)——这正是 skill 正交于分类法的基底轴;
-
两种复用:反复调用(跨任务多次跑某例程),或一次性安装(留下持久改动但仍是可移植产物);
-
两种作用域:object-level skill 作用于任务 / 世界态(≈ 分层 RL 的 option);
meta-level skill 作用于智能体自身配置
𝒜t(写新工具、重构 prompt、固化经验、打补丁自身 scaffold)——后者是自改进的核心。一旦 meta-level skill 自身又被改进,便恢复 Schmidhuber (1987/1993/2003b) 的自指环:改进者随它所改进的系统一同演化。
3.3 Connections to Related Learning Paradigms
SI-FMA(见 §3.2,Self-Improvement in Foundation-Model-based Agents——把自改进形式化为"持久、内源适配"的 FM 智能体范式)深植于既有学习理论。本节论断(claim):把 SI-FMA 映回三类经典框架(RL / online learning / active learning),可一次厘清三件事——它在哪继承了既有假设、在哪重组了熟悉机制、又在哪因 agent 架构而变得操作上本质不同。一条贯穿全节的发现:θ 更新基本落在经典框架内,Σ 更新则重塑决策过程本身(动态改变有效状态-动作空间与观测处理逻辑),是经典 RL / online learning 没有对应物的结构元学习;此外 SI-FMA 在信号来源上也偏离经典——越来越靠自产监督(自当 critic)而非外部标量奖励 / oracle 标签。下表(图源:Derived,依据该节三段整理)按 θ 通道、Σ 通道、信号来源三列对照:
| 范式 | θ 通道(改参数) | Σ 通道(改脚手架) | 信号来源 |
|---|---|---|---|
| Reinforcement Learning | 标准策略优化(RLHF、self-play,用 PPO/DPO),FM 当大规模策略网络 | 经典 RL 无对应物:改 Σ 会动态改变有效状态-动作空间与观测处理逻辑,即重塑 MDP 本身;优化对象是离散结构(prompt / 记忆 / 路由),靠搜索 / 生成 / 符号编辑而非梯度 | 经典 RL 靠外部标量奖励;SI-FMA 越来越多用自产监督(自当 critic) |
| Online Learning | 继承稳定性挑战:分布漂移、灾难性遗忘;用 replay / 正则 / PEFT / 显式版本化回滚缓解 | 通过 prompting / 记忆读写 / 工具路由 / 编排逻辑实现快速适配,透明可控但仍有自身失败模式(记忆投毒、工具语义漂移、模板脆性) | 交汇处: θ 更新=非平稳流下更新假设;Σ 更新=系统级适配 |
| Active Learning | — | — | 智能体主动控制数据获取(盯高频失败、找 verifier 分歧最大化、显式要人类反馈);因常靠自产验证而非 oracle 标签,超越经典主动学习,直连人工好奇框架(learning progress / Bayesian surprise / compression progress) |
要点(图源:Author):θ/Σ 两通道在经典框架里"内有 / 外无"之分,正是本综述信号透镜 (signal lens) 的立论点——其中 Σ 通道那块经典 RL / online learning 无对应物的结构元学习,是 §6 整条 scaffolding-improvement 路径的概念根基。
4 A Taxonomy of Existing Approaches
论文用统一记号 IMPROVEtarget(·; 𝒮t) 抽象自改进过程,其中 𝒮t 是执行自产的更新信号(operator ℰ)。先按改的目标分两条路径,再在每条路径内按信号形式或被改组件细分:
-
Foundation Model Improvement(eq. 7,
θt+1=IMPROVEθ(θ1:t;𝒮t),Σ 不变)按信号分三种:内在生成式示范 𝒟t、内在评估反馈 et、外在探索经验 τt;
-
Scaffolding Improvement(eq. 8,
Σt+1=IMPROVEΣ(Σ1:t;𝒮t),θ 不变)按组件分四种:prompt p、memory m、tool 𝒯、full scaffolding Σ。
(图源:Original)Figure 3 是论文的统一分类法总图,读法:顶层先分 FM/scaffold 两支,FM 支下挂三类信号,scaffold 支下挂四类组件,底部再接评估基准——这正是 §5–§8 的目录:

Figure 3
Figure 3 的价值在于把"改什么"与"信号从哪来"两个轴叠在一张图上:同一类方法(如 self-play)既可归到 θ 路径(作 τt),也可在 scaffold 路径出现(作组件更新信号),分类法给出了一致比较的公共语言。
5 Foundation Model Improvement
参数改进把 FM 当"可持续学习的系统",把改进存进参数记忆而非短暂执行态。通用更新环(Algorithm 1,图源:Derived,依据论文伪代码重画并译注)如下:
for t = 0 .. T-1: S_t ← ∅ if 含 intrinsic generative demonstrations: S_t ← S_t ∪ GenerateDemonstrations(A_t) # §5.1 if 含 intrinsic evaluative feedback: S_t ← S_t ∪ GenerateEvaluativeFeedback(A_t) # §5.2 if 含 extrinsic exploratory experience: S_t ← S_t ∪ CollectExperience(A_t, env) # §5.3 S_t ← FilterOrWeight(S_t) # 可选质量门控 θ_{t+1} ← Update(θ_{1:t}, S_t) # 参数更新(常从当前 checkpoint θ_t 起步) A_{t+1} ← (θ_{t+1}, Σ) # scaffold 不变 if Converged(A_{t+1}): breakreturn A_T
要点:三类信号不互斥,实际管线常在一个周期里混用;论文按主导信号源归类。θ1:t 历史用于验证与回滚(更新劣化时可回退 checkpoint)。
(图源:Original)Figure 6 把三类信号画成三条独立的参数更新环:

Figure 6
Figure 6 表明:三类环路共用同一个"生成信号 → 过滤 → 更新 θ"骨架,差别只在信号是示范、评估还是交互经验。
5.1 Intrinsic Generative Demonstrations
FM 同时当"认知学习者"和"数据合成器",靠权重里已压缩的语义先验,无需新外部观测就自构训练数据:指令-响应对、推理轨迹、执行日志。形式上 St≈𝒟t,从诱导分布 𝒫gen(x,y𝒜t) 采样(eq. 9),可选质量算子 Φt 过滤,参数更新 = 在 𝒟t 上优化经验目标 + 围绕 θ0 的正则(eq. 10–11)。
下表(图源:Derived,依据 §5.1 生成策略段整理)对比主要生成策略及其失败模式:
| 生成策略 | 机制 | 过滤 / 质量信号 | 失败模式 |
|---|---|---|---|
| 复杂度演化 (Evol-Instruct) | LLM 改写指令逐步加难 | — | 子问题构造破坏原任务约束 |
| 自一致性过滤 (Huang et al., 2023) | 取高置信推理路径 | 多路径自洽 | 模型"自信地错"时反复收敛到同一错误结论 |
| 验证器过滤 (Singh et al., 2024) | 只留能过 unit test 的解 | 外部验证器(单元测试) | 验证器覆盖不全时漏选 |
| 课程式分解 (Simonds & Yoshiyama, 2025) | 递归把难题拆成子问题 | — | 分解方法本身有缺陷 |
| 多样性池扩展 (Qin et al., 2025) | 显式扩样本池抗多样性衰减 | 多样性感知选择 | — |
| 测试期自改进 TT-SI (Acikgoz et al., 2025) | 推理时按不确定性检弱例、针对性 LoRA | 不确定性估计 | — |
关键张力:递归自训练会触发 model collapse / pattern collapse / knowledge bubbles——把缺陷样本内化、解空间收窄、反复加固既有偏置。论文列出的 safeguards:保留真实基准数据叠加其上(Gerstgrasser et al., 2024)、用专门验证器 / 定理证明器把关、多样性感知池化、不确定性驱动生成、以及人类审计。
5.2 Intrinsic Evaluative Feedback
把"获取监督"重构成内部评估过程:FM 当输出者、自评者,最终当内化自身判断的学习者,产出标量分、偏好对、一致性信号、自然语言批评,无需新环境交互。形式上 St≈ et:先采样候选 𝒴t(x)(eq. 12),内在评估器 φt 产出 et=φt(x,𝒴t;κt)(eq. 13),再 θt+1=IMPROVEθ(θ1:t;et)(eq. 14)。
下表(图源:Derived,依据 §5.2 三族整理)按信号形式把三族分开:
| 族 | 信号形式 | 代表系统 | 更新方式 | 失败模式 |
|---|---|---|---|---|
| Rubric feedback | 按显式准则打分 / 排序 / 偏好 | Constitutional AI (Bai et al., 2022)、Meta-Rewarding (Wu et al., 2025b)、Self-Evolved Reward Learning (Huang et al., 2025a) | 训偏好模型 → RL 优化策略 | 准则模糊 / 判官偏置时奖励表面顺从而非真改进 |
| Consistency feedback | 多候选间的一致 / 熵 / 自确信 | TTRL (Zuo et al., 2025, 多数投票)、SRT (Shafayat et al., 2025)、EMPO (Zhang et al., 2025h, 熵)、INTUITOR (Zhao et al., 2025c, 自确信) | 一致性当弱奖励 / 偏好信号做 RL | 模型系统偏置或校准差时,重复采样放大同一错误 |
| Corrective feedback | 自然语言批评 + 修订 y* | “ReST meets ReAct” (Aksitov et al., 2024)、SELF (Lu et al., 2024b)、RISE (Qu et al., 2024)、Reflect, Retry, Reward (Bensal et al., 2025)、AlphaAllM (Tian et al., 2024) | (y,y*) 当偏好、c 当解释监督 | 模型产出似是而非的批评,或学会满足批评的表面形式 |
主要风险:评估器与被改进策略紧耦合,会强化共同盲点、奖励顺从模型既有偏置的输出、过拟合表层准则。论文给的 safeguards:生成器与评估器用不同 checkpoint / 模型族、保留人类标注或上下文验证作外部锚、把评估器间分歧当不确定性信号、定期复核打分准则。
5.3 Extrinsic Exploratory Experience
学习信号来自 agent 行动之后发生的事:St≈τt,即跑策略 πθt,Σt 收集的轨迹。对 FM 智能体,轨迹不只是 (s,a,r,s’),还含网页、截图、代码日志、编译错误、工具调用、推理痕迹——这些 FM 可读,故同一份经验可灵活复用到 RL / SFT / 偏好构造 / 失败分析。
下表(图源:Derived,依据该节两模式整理)按"环境是真任务还是学出的代理"分两类:
| 模式 | 环境 | 反馈来源 | 代表系统 | 失败模式 |
|---|---|---|---|---|
| Grounded task env | 代码解释器 / Web API / 移动 UI / 物理环境 | 环境响应:状态变化、执行迹、单元测试 | 程序验证器:Agent-RLVR (Da et al., 2025);学得奖励模型:WebRL (Qi et al., 2025)、UI-Genie (Xiao et al., 2025)、MobileGUI-RL (Shi et al., 2025b);自产任务:Absolute Zero (Zhao et al., 2025a)、ETO (Song et al., 2024c);平台:AgentGym (Xi et al., 2024) | 奖励稀疏 / 噪声 / 昂贵(flaky test、覆盖不全) |
| Simulated proxy env | 学出的 world model W(sk+1,rk sk,ak) | 预测的下一状态 / 回报 / rollout | Web:WebEvolver (Fang et al., 2025b)、WebSynthesis (Gao et al., 2025b)、WebDreamer (Gu et al., 2025);SPA (Chen et al., 2025a);像素空间 WMPO (Zhu et al., 2025b);文本记忆 GLoW (Kim & hwang, 2026, 100–800× 更少真实交互) | 幻觉动力学:生成器伪造似真但错的转移,策略学会钻空子 |
论文强调两类不互斥:早期 controller-world-model 架构 (Schmidhuber, 1990) 就用真实交互训世界模型、再用模拟交互规划。FM 世界模型的优势在于:大规模预训练给环境动力学强先验;生成观测与策略输入同表示空间,无需表征对齐。
跨模式挑战(图源:Author 洞见):语言通道的 reward hacking(FM 能钻 LLM judge 的措辞漏洞而不真解题)、capability regression(窄外部奖励的 RL 会侵蚀预训练广能)、幻觉动力学、以及轨迹长度 vs 上下文窗口的张力(长程经验须压缩 / 摘要才能喂回)。
6 Scaffolding Improvement
scaffold 改进在冻结 θ 的前提下更新 Σ=(p,m,𝒯,g),由执行衍生的信号 𝒮t(任务结果、批评、执行错误)驱动,靠版本史 Σ1:t 支持验证与回滚。通用环(Algorithm 2,图源:Derived,依据论文伪代码重画):
for t = 0 .. T-1: S_t ← InteractAndEvaluate(A_t, env) # 轨迹 / 批评 / 成败 / 成本 S_t ← FilterOrWeight(S_t) if 子类 = Full scaffolding: Σ_{t+1} ← IMPROVE_Σ(Σ_{1:t}; S_t) # §6.4 else: p_{t+1}←p_t; m_{t+1}←m_t; T_{t+1}←T_t # 默认不变 if 含 Prompt: p_{t+1} ← IMPROVE_p(p_t; S_t) # §6.1 if 含 Memory: m_{t+1} ← IMPROVE_m(m_t; S_t) # §6.2 if 含 Tool: T_{t+1} ← IMPROVE_T(T_t; S_t) # §6.3 Σ_{t+1} ← (p_{t+1}, m_{t+1}, T_{t+1}) A_{t+1} ← (θ, Σ_{t+1}) # θ 始终冻结return A_T
要点(图源:Author):四类干预组合而非互斥——一次更新可同时改多个组件;full-scaffolding 自然吞并组件级编辑,并额外加 archive 式探索与更强验收测试。从 prompt → memory → tool → full,干预深度递增。
6.1 Prompt
prompt 是智能体的核心行为先验,prompt 优化是 scaffold 改进里最易上手的一类。论文按学习信号 𝒮t 的形式与丰富度分四范式(Figure 7),并由 Table 2 给出系统级对比。
(图源:Original)Figure 7 读法:信号从左到右越来越结构化——scalar score → 文本批评 → 群体选择信号 → 文本梯度;越往后越"少启发式、更自动化"。

Figure 7
Figure 7 的核心信息:四范式不是并列,而是信号信息量的演进——从只给"多好"的标量,到给"哪里错、怎么改"的方向性文本梯度。
Table 2(图源:Original)系统级对比(①②③④ 对应上四范式):
| ID | Signal St | Objective | Representative Systems | Advantages | Limitations |
|---|---|---|---|---|---|
| ① | Scalar score | argmaxp∈𝒫 f§ | RLPrompt, BBT, APE, OPRO, Dspy | model-agnostic;易部署;无需内部访问 | 可解释性低;样本低效;对搜索敏感 |
| ② | Text critique | Refine(pt,ct) | Self-Refine, Reflexion, Critic, ACE | 可解释编辑;定向纠错;反馈可复用 | 批评有噪声;可能漂移;依赖验证器 |
| ③ | Selection signal | Evolve(Pt,Fit) | Promptbreeder, STOP, GPTSwarm, AutoDAN, Evol-Instruct, GEPA | 强探索;保多样性;逃局部最优 | 计算重;fitness 域相关;群体漂移 |
| ④ | Textual gradient | pt⊕ g(pt) | APO, TextGrad, metaTextGrad, SkillOpt | 方向性更新;常样本高效;高度自动化 | 梯度脆;质量随 LLM 变;保证有限 |
形式化:scalar 求 p*=argmax f§(eq. 17);qualitative 迭代 pt+1=Refine(pt,ct)(eq. 18);population 做 selection/crossover/mutation(EvoPrompt 首倡把 LLM 当语义进化算子;Promptbreeder 更进一步,自指地连"变异 prompt"本身也一并进化);textual gradient 类比梯度下降 pt+1=pt⊕ g(pt)(eq. 19),TextGrad 把 agent workflow 当计算图做"文本反向传播",MetaTextGrad 更进一步优化"优化器 prompt"——让智能体改进自己的改进过程。
6.2 Memory
自改进智能体把记忆当主动演化的 scaffold 而非被动存储:持续评估所存信息的价值 / 相关性 / 强度,据经验流自主重构与扩展。论文把 memory 改进拆成三维——Memory Object(存什么)、Memory Structure(怎么组织)、Memory Processing(创建 / 检索 / 更新 / 遗忘机制)。形式上 mt:=(objectt,structuret),由 𝒮t(检索失败、任务反馈、容量上限)驱动 mt+1=IMPROVEm(mt;𝒮t)(eq. 20),由 CRUD 操作族参数化。
(图源:Original)Figure 8 是 memory 全景图,读法:沿"观察显著性 → 建对象 → 组织结构 → 按需检索 → 规划行动 → 评估得 st → 更新 / 删除"的闭环读:

Figure 8
Figure 8 表明:memory 从"被动缓存"升格为"自治引擎",其价值在于把 object / structure / processing 三维统一进一个信号驱动的生命周期。
范围说明:本节聚焦非参数、外置于 scaffold 的记忆,保持 FM 冻结假设;权重内的"参数记忆"不在此节讨论。
6.2.1 Memory Object
memory object 决定存储效率、表征保真与跨上下文迁移。自改进智能体倾向存处理后高密度抽象而非原始全量轨迹。Table 3(图源:Original)给四类 object 的定性记分卡(■ 多寡表 1=low–5=high 的文献综合判断,非单一基准):
| Object type | Best-for persistence | Fidelity | Interpretability | Compact | Write cost | Auditability | Most common failure modes |
|---|---|---|---|---|---|---|---|
| Processed trails | lessons / routines / summaries | ■■■ | ■■■ | ■■■ | ■■■ | ■■■ | summary bias / stale heuristics / weak credit assignment |
| Curated raw content | evidence / exact artifacts | ■■■ | ■■■ | ■■■ | ■■■ | ■■■ | context bloat / retrieval noise / privacy leakage surface |
| Integrated external knowledge | shared factual state / grounding | ■■■ | ■■■ | ■■■ | ■■■ | ■■■ | grounding failures / staleness / tool brittleness |
| Latent embeddings | associative carryover / fast recall | ■■■ | ■■■ | ■■■ | ■■■ | ■■■ | drift / contamination / hard-to-debug retrieval / silent corruption |
显式 object(processed trails / curated raw / integrated external)可解释、可审计,但需严格策展否则压爆上下文预算;隐式 object(latent tokens / hidden states / KV cache 增强)紧凑、快联想访问,但难检视、易表征漂移。processed trails 利泛化、curated artifacts 利精度、integrated knowledge 利可验证性。
6.2.2 Memory Structure
structure 指组织 schema 与关系拓扑,决定如何索引、链接、检索。下表(图源:Derived,依据 §6.2.2 四种结构整理)对比四种结构范式:
| Structure | 检索依据 | 优势 | 失败模式 |
|---|---|---|---|
| Flat | 严格时序 | 写入便宜、保因果叙事、利轨迹回放诊断 | 检索可扩展性差、recency bias、堆冗余低层轨迹 |
| Hierarchical | 多抽象层(高层摘要 / 中层计划 / 底层轨迹) | 降噪、支持长程一致 | 结构脆性:taxonomy 错配任务时碎片化证据、碍跨切检索 |
| Graph | 节点 + 语义 / 时序 / 因果边 | 按联想而非时序检索、多跳证据聚合 | 维护复杂:持续建图 / 更新边 / 冲突消解,结构易漂移 |
| Vector retrieval | 稠密嵌入相似度 | 自然语言查询下大尺度 episodic 召唤的默认引擎 | 相似 ≠ 有用:最近邻可能题相关但决策无关,召回噪声偏置后续学习 |
代表系统举例:Flat—SCM、Self-Notes;Hierarchical—MobileGPT、H-MEM、SHIMI、SALM;Graph—Mem0、Zep、CausalRAG、G-Memory;Vector—Generative Agents、MemoryBank、MIRIX、MrSteve。
Table 4(图源:Original,下图为其行首图标)是论文对 25 个 memory 系统的大表,按 Object(显式 / 隐式)× Structure(flat/hier/graph/vector retr.)× Processing(CRUD)× Governance(Select / Maintain)打点(●primary / •secondary / •absent)。读法:横看一个系统四维的侧重,竖看某机制在哪些系统里是 primary。

Table 4 icon
Table 4 的要点:多数系统显式 object + 单一结构;近作(A-MEM、Mem0)开始用 graph + vector 混合,并把 Select/Maintain 治理维度显式化——这正是 memory 从"存储"走向"自治理"的趋势。
6.2.3 Memory Processing
processing 是作用在 mt 上的信号驱动 CRUD 操作族,由 𝒮t(任务结果、效用、内部批评)参数化决定写什么、怎么取、何时忘。下表(图源:Derived,依据 §6.2.3 整理):
| 操作 | 信号驱动的模式 | 过度 / 不足的代价 |
|---|---|---|
| Create | 语义压缩成结构化元数据;上下文相关的离散决策(add/update/delete/no-op,按检索邻居条件化);受控边界插入 | 过写→召回噪声膨胀;欠写→牺牲长期能力 |
| Read | 混合启发式(语义×recency×importance);结构感知检索(粗到细遍历);检索门控(是否查、查多少);检索驱动适配(取历史轨迹当可执行案例) | 取到无关噪声或漏关键细节→后续规划执行直接失败 |
| Update | 定期复核衰减;局部刷新(新插入时更新拓扑邻居);迭代蒸馏(重复成功合成紧凑抽象);离线聚合(把贵的压缩移出在线环) | 无有效更新→记忆衰减:过时事实留存、结构崩塌、不当合并抹掉细节 |
| Delete | 多阶段剪枝(写入时 + 按访问频次 / 相关性定期清);共识式驱逐(分布式投票防误删共享关键知识);分层驱逐(OS 式规则跨层限容) | 过剪→丢关键知识;欠剪→淹没在过时噪声、拖慢检索 |
闭环(呼应 Figure 8):观察显著性 → 建对象 → 组织结构 → 按需读 → 规划行动 → 评估得 st → 更新 / 删除,把 memory 抬成自治引擎。
6.3 Tool
自改进要求从"静态、人工策展工具集"转向 Tool Governance Metacognition:智能体自主推理工具的必要性、效用、可靠性。形式 𝒯t+1=IMPROVE𝒯(𝒯t;𝒮t)(eq. 21),由三维构成——Dynamic Tool Routing、Iterative Tool Refinement、Autonomous Tool Creation。
(图源:Original)Figure 9 读法:三维构成一个"治理"闭环,把工具使用从静态查表变成生成式、自改进的循环:

Figure 9
Figure 9 表明:routing 决定"用哪个"、refinement 决定"修好它"、creation 决定"造新的",三者共同把工具集变成可持续扩张的技能库。
三维各自展开如下(图源:Derived,依据 §6.3.1–6.3.3 整理)。
6.3.1 Dynamic Tool Routing
routing 关心异质环境里如何选、序列化、协调工具。工具池一大,routing 即成自改进主瓶颈:覆盖更广但也更易误路由、复合失败、浪费算力——三者在 coverage / reliability / decision cost 间做权衡。论文按"把什么当 retrieval unit、如何随时间引入反馈"分三范式:
| 路由范式 | 检索单元 / 反馈机制 | 代表系统 | 失败模式 |
|---|---|---|---|
| Retrieval / graph-based | 优化检索空间或依赖表示(动态裁剪 / 扩展检索单元 / 把工具转移编码为有向图) | 检索空间:MemTool(裁剪)、TAR(原子 API ↔ 整 agent);轨迹即学习信号:VOYAGER、MetaAgent;图结构:ToolNet、OrchDAG、MassTool | 大池增覆盖但也增误路由、复合失败、算力浪费 |
| Policy-learning | 把工具选择内化为序列决策,从训练信号学调用行为 | SFT 启动:AUTOACT、MCP-Flow、Tool-Star、DeepEyesV2;稀疏 / 偏好信号塑形:AGENTFLOW、SPORT、AutoTIR、DeepAgent;生成式统一(检索+选择+调用合一):ToolGen | 过拟合训练环境;接口 / 分布漂移时脆;ToolGen 把可靠性全压在学得策略上 |
| Proactive / interactive | 把 routing 当交互过程:澄清欠指定意图、局部修复执行失败 | 澄清 / 主动发现:MCP-Zero、ASKTOACT;局部修复:Tool-Planner(聚成可互换 kit)、ToolACE-R(按难度分配修订算力) | 多花交互与算力换可靠性 |
6.3.2 Iterative Tool Refinement
refinement 把脆程序炼成可靠技能,兼调试 + 把关:不可靠工具若被存用,会经反复检索 + 复合错误腐蚀未来行为,故它控制什么能进结构化技能库。标准环是 VOYAGER 的生成-执行-修订——执行生成代码、把错误迹与环境反馈当 𝒮t 回喂,直到验证器通过。论文按三方向强化该环:
| 强化方向 | 机制 | 代表系统 | 失败模式 |
|---|---|---|---|
| Critique specialization | 超越通用自反思,部署专门 critic 诊断中间结果 | STELLA(专门 critic agent) | 单体模型易漏域特定失败模式 |
| API abstraction | 不改原始动作迹,蒸馏 / 抽象出可复用子例程 | SkillWeaver(蒸馏成 web 工具)、PyVision(稳定多模态工具) | 抽象不当反损跨任务迁移 |
| Interface alignment | 不改代码,迭代精修工具文档——多数执行失败源于 NL 指令与工具 affordance 错配 | DRAFT(改文档而非代码) | 文档与实现不一致时失效 |
6.3.3 Autonomous Tool Creation
creation 在现有工具不足时合成新可执行函数以扩张能力边界;对自改进智能体,其价值在于把一次性解题转成可复用过程知识。它自带风险:新工具须经验证 / 文档化 / 集成而不破坏 routing,否则工具膨胀反增脆性。论文按三方向推进:
| 推进方向 | 机制 | 代表系统 | 失败模式 |
|---|---|---|---|
| Synthesis triggers | 按需发明 vs 好奇 / 课程驱动自探索 | 按需:ATLASS、PyVision;好奇驱动:FRIDAY、STELLA | 无约束探索产出冗余 / 低质工具 |
| Lifecycle automation | 抽逻辑、装依赖、闭环调试、产出可调用接口(生成可执行才是真瓶颈) | TOOLMAKER(端到端生命周期) | 仅生代码而不解依赖 / 调试 → 不可部署 |
| Standardized integration | 协议驱动架构,确保工具增长不破坏既有 routing | Alita、Code2MCP(经 MCP 把代码库转标准服务);AgentOrchestra(意图解析→验证→注册) | 无标准化注册则工具膨胀破坏 routing |
闭环(呼应 Figure 9):routing 选、refinement 修、creation 造,三维共同把静态工具集抬成可持续扩张的技能库——这正是 §3.2 里 skill 作为"可复用更新算子"在 tool 基底上的落地。
6.4 Full Scaffolding
full scaffolding 是最深的架构干预:把整个操作逻辑与代码库当可变 substrate,做根本性结构重组。形式 Σt+1=IMPROVEΣ(Σt;𝒮t)(eq. 22),关键是改进过程本身就在当前 scaffold 内实现,使更新自指:Σt+1=ℐΣt(Σt;𝒮t)(eq. 23)——改进者随它改进的系统一同演化。scaffold 编码为可序列化程序,候选程序由"当前 agent-as-improver 跑自身代码"产出(eq. 24),常体现为补丁 Δt,由验证器门控(eq. 25):过则采纳、不过则回退。
下设计矩阵(图源:Author,依据 §6.4 各系统整理)把代表系统放进搜索范式 × 改动对象 × 门控 × 自指性四轴:
| 系统 | 搜索范式 | 改动对象 | 验证器 / 门控 | 自指性 |
|---|---|---|---|---|
| AlphaEvolve (Novikov et al., 2025) | 进化 | 科学 / 算法代码 | 多 evaluator 反馈 | 部分(改进器在 scaffold 内) |
| ShinkaEvolve (Lange et al., 2026) | 进化(探索-利用均衡父代采样 + 新颖性拒绝 + bandit 选 LLM) | 跨任务程序 | 少样本评估 | 部分 |
| ADAS (Hu et al., 2025) / EvoFlow | 搜索 agentic 系统设计空间 / Pareto 工作流集 | 整个系统结构 | 给定评估函数 | 弱 |
| Self-Taught Optimizer (Zelikman et al., 2024) | 递归自改进 | 自身程序(抽象为 improver) | 选最高分版本 | 强(递归环) |
| Gödel Agent (Yin et al., 2025c) | monkey patching 自修改 | 整个 agent 设计空间 | 自感知 / 自修改 / 递归 | 强(Gödel 机启发) |
| Darwin Gödel Machine (Zhang et al., 2026d) / HGM (Wang et al., 2026b) | open-ended 进化(保档案、长出 agent 树)/ clade 级元生产率 | 编码 agent 本身 | 基准 + 后代性能估计 | 强 |
(图源:Original)Figure 10 展示 full-scaffolding 跨迭代的更新:

Figure 10
Figure 10 的要点:每一代都把上一代的整个 scaffold 当起点,由执行迹与评估提信号、用验证器门控补丁,逐步长出更复杂的后代——这是"可证明自改进"在工程上的有界、可验证近似。
另一线:Agent Symbolic Learning (Ou et al., 2025) 把语言 agent 当"符号网络"(权重= prompt / tool / 组合),用自然语言 loss/gradient 模拟反传与梯度下降,联合更新 prompt / tool / pipeline。Live-SWE-Agent (Xia et al., 2025) 是首个能在运行时实时自演化的软件 agent(尤其演化自身工具组件)。
7 Applications
各域共性:用沙箱或受控环境提供反馈同时限制失败成本。Table 5(图源:Original)把六个域看成"自改进环",按 sandbox、学习信号、瓶颈、改进目标、迭代模式、范例系统六列对比:
| Domain | Sandbox & arena | Learning signal | Main bottleneck | Primary improvement target | Iteration mode | Exemplars |
|---|---|---|---|---|---|---|
| SWE | 仓库 + 编译器 / 单测 / CI,失败通常可逆 | 确定性二元(过 / 不过)、编译错、静态分析 | patch 正确性、工具 / 接口效率 | 主要 scaffold;部分自编辑代码或微调 | 逐 issue 在线调试 + 跨 issue 离线聚合 | DGM、HGM、Live-SWE-agent、AgentDevel |
| Web | 模拟 / 标准化浏览器,UI 部分可观测 | 稀疏任务完成、长程失败、部分启发式 | 动态布局的 grounding、跨站点分布漂移 | scaffold(感知-动作 grounding、规划、迭代修复)+ 轨迹策展 | 模仿式 + 轨迹上在线纠错 | WebRL、WebEvolver、SkillWeaver、WebRollback |
| Game | 游戏引擎可可靠重置、self-play | 胜负 / 标量奖励、清晰终局 | 长程规划、不完全信息、多智能体非传递性 | 模型 / 策略参数 + 搜索 / 规划组件 | self-play、迭代策略改进 | Richelieu、DipLLM、MARSHAL、SPAG |
| Sci | 工具增强研究环、变成本评估 | 实验指标、工具输出、批评式修订 | 评估昂贵且噪、知识碎片化、工具 / 接口异质 | scaffold(工具编排、规划、验证)+ 领域专精 | 提议-运行-批评-修订、在线离线混合 | The AI Scientist、AI-Scientist-v2、SciAgents、AI co-scientist |
| Emb | 仿真器 + 少量真实 rollout、安全约束 | 奖励 / 成功信号,真实数据贵 | 数据采集与安全、sim-to-real、动力学信用分配 | 策略 / 模型参数(数据飞轮)+ 课程 / 安全 scaffold | 采集-重训-重部署 | RoboCat、SOAR、SInViG、REMAC、SEEA-R1 |
| PC (general computer control) | 虚拟桌面、标准化 OS 任务、脆 UI | 任务完成与状态检查、长程目标 | 应用多样性、状态追踪、未见 app 的鲁棒探索 | scaffold(分层规划、检索、课程)+ 动作迹训练 | 经验复用 + 课程学习、迭代迹采集 | OS-Copilot、UI-Genie、GUI-Reflection、SEA |
(图源:Original)Figure 11 是六域示意:

Figure 11
Figure 11 的要点:六域各自的环境(其 fidelity / scalability / cost)塑造了该域主导的瓶颈、改进目标与迭代模式(论文 §7 原意,见 Table 5)。至于每域具体走 FM 改进还是 scaffold 改进,论文并未给统一规则——例如 SWE 虽反馈密集,Table 5 却标为 “mainly scaffolding”,可见可验证性高并不直接等于走参数改进。
各域的开放挑战(图源:Author 洞见,逐域一句):SWE—基准搜索 / 验证器过拟合,需基准变异 + 把 scaffold 发现蒸馏进 base model 仅当其能跨验证器迁移;Web—非平稳 + 弱可观测,需漂移感知评估 + sandbox 隔离不可逆动作;Game—self-play 造"脆性胜任"、非传递性使进展非单调,需群体评估;Sci—novelty / 正确性 / 可复现难自验,弱代理易被当真进步,需可复现中心评估 + 证据追踪;Emb—sim-to-real、传感器漂移、不可逆动作,需安全感知改进 + 跨具身评估;PC—安全(删文件 / 输密码 / 金融操作)+ 状态依赖验证 + 跨 app 迁移,需状态验证 + 保守不可逆策略。
8 Evaluation
自改进智能体的评估必须把"改进"当成随时间展开的过程,并把真能力增益与改进管线造的伪迹分开。先把整体能力形式化(eq. 26):在迭代 t、预算 bt≤ Bmax 下,能力 mt=𝔼x∼𝒟eval,τ∼𝒜t(x)[Φ(x,τ)],差别只在评估器 Φ 的实例化——Φmetric(确定性可执行)还是 Φjudge(参数化、条件化于 rubric κ 与辅助判官 θjudge)。
评估分类(图源:Derived)├─ 按 Φ 分:metric-based (§8.1.1) vs judge-based (§8.1.2)└─ 按基准分:mechanism benchmarks (隔离更新通道) vs domain benchmarks (真实任务反馈)
(图源:Original)Figure 12 是 paper–benchmark 关联矩阵:行=基准(按 FM-level / scaffold-level 分组),列=代表方法(颜色标改进机制),实心格表示该方法用了该基准,* 表基准族。读法:看一行知道某基准被哪些机制的方法检验,看一列知道某方法在哪些基准上验证:

Figure 12
Figure 12 的要点:FM-level 基准偏静态、model-centric,scaffold-level 基准偏交互、agent-centric;多数方法只覆盖少数基准族,跨机制的系统级比较仍稀缺。
该报什么(eval-setup,图源:Derived,依据 §8.1 整理)
| 报告项 | 要求 |
|---|---|
| benchmarks | 明确用了哪些基准族(mechanism / domain),held-out split 𝒟eval 不与优化数据重叠 |
| metrics | mt 轨迹而非单点峰值;附回归率、尾部风险、安全违规 |
| protocol | 固定预算 Bmax、checkpoint / 验收 / early-stop 规则;多 seed 报期望与方差;判官预算与执行预算隔离 |
| transfer / cost | held-out 或时移任务的迁移能力;成本分解(算力 / token / 时间 / 人工介入量——人工介入须显式量化,因其动摇"自"改进) |
metric-based 四要点:固定预算下报整条轨迹(非只报峰值)、测改进信号之外的迁移(hidden / 时移评估)、算清资源效率与监督量、长期追踪稳定性 / 回归 / 安全。judge-based 两要点:显式指定判官与判官预算(模型版本、prompt、rubric、暴露给判官的证据)、防过优化判官(最终报告用独立判官配置 θ’judge / 正交 rubric κ’,并用多样本方差、多判官聚合、对可验证子集校准支撑可靠性)。
9 Discussion
自改进智能体是闭环动力学系统;研究焦点不再是静态 agent,而是驱动其演化的机制。本节给出三条系统设计含义,每条都是一张问题卡(图源:Author)。
① 从快探索到慢固化
问题:改 Σ(prompt / memory / tool)是快、可逆的低开销环;改 θ 是慢、稳但模糊信用分配的环——坏 prompt 易回退,吸进参数的回归却极难追溯。 症状:参数固化是有损压缩,把复杂轨迹蒸进权重会偏向 average-case 执行,丢掉探索期发现的稀有但关键的错误恢复策略。 对策:反馈噪时先困在 scaffold 内、用严格执行测试验证;参数固化(蒸馏 / 微调)推迟到新行为证明稳定后;而一旦改了 θ,先前的安全边界即失效,须重做对抗测试确认边缘韧性保住。
② Critic 作为受管基础设施
问题:闭环里的 critic 是攻击面而非被动基准——agent 会优化它、从而有动机钻捷径,能力天花板常被 critic 的抗钻性卡住。 症状:若 agent 同时"提议更新"与"接受更新",会塌缩成自证环。 对策:把 critic 与生成器解耦;critic 自身可进化(如生成更严测试),但其更新不能由它评估的 agent 无约束控制——应限为单调变更(如纯加性测试生成)并由人工审计链门控。
③ 用分层门控保安全
问题:自改进使对齐对象非平稳;full-scaffolding 改进最危险——一次性 prompt 注入这类瞬时漏洞,可经投毒记忆 / 劫持工具逻辑被提交成持久架构漏洞。 症状:弱系统如何可靠推理更强的后继系统(Vingean reflection)是递归自改进的核心难题。 对策:把自改进 agent 当在受保护运行时里跑的不可信代码;安全不能只靠 FM 初始对齐,须分层门控——任何结构更新提交到 Σt+1 或 θt+1 前,补丁须过 verifier 门控(功能正确性、工具权限边界、对随机状态扰动的鲁棒性),改进只允许在显式定义并持续审计的安全边界内。
Theme A: Algorithmic Paradigms for Lifelong Adaptation
未来方向部分把前路归为两大瓶颈、六个方向。Theme A 三张问题卡(图源:Author):
方向 1 · Test-Time Continual Adaptation
问题:训练 / 部署的分离常损害真实鲁棒性。 对策与张力:要可扩展的测试期适应机制(动态改检索 / 路由 / 记忆策略);但on-the-fly 打补丁会悄然侵蚀系统长期全局性能——须小心管理局部更新。
方向 2 · Active Exploration and Curiosity
问题:智能体应主动寻高价值经验而非被动接受人工任务。 对策与张力:在稀疏反馈域,给高预测误差或 verifier 分歧的交互赋内在价值;但要避免滑入退化、自欺的循环。
方向 3 · Parametric Distillation and Joint Optimization
问题:scaffold 级改进擅发现复杂多步恢复策略(迭代调试、自反思)但上下文 / 延迟成本高昂。 对策与张力:把这些"System 2"算法结构自动化蒸馏进更小模型的"System 1"参数权重;另一方向是联合优化(θ 与 Σ 在同一环里共更新)——这要求解一个棘手的信用分配问题:失败时改进算子要自决"该改 prompt、重写工具封装、还是算梯度更新"。
Theme B: Complexity, Constraints, and Open-World Robustness
Theme B 三张问题卡(图源:Author):
方向 4 · Resource-Constrained Improvement Dynamics
问题:open-ended 场景里现法常导致无产出探索,耗尽预算与 token 而不可靠推进策略。 对策与张力:把评估从静态峰值改为改进效率;把自改进重述为资源优化——动态分配上下文、用轻量不变量检查给贵的神经评估加门、惩罚浪费的迭代。
方向 5 · Multi-Agent Cooperative Co-Evolution
问题:单智能体探索在巨搜索空间里极低效。 对策与张力:让专门化 agent 通过共享可复用产物(生成的回归测试、成功的代码补丁、改进的工具封装)协同进化;需要安全、版本控制的协议(产物仓库),让 agent 继承集体知识而无单点故障或多智能体奖励机制的级联攻击。
方向 6 · Surviving Open-World Distribution Drift
问题:自改进的鲁棒性取决于驱动它的环境,而现平台重度依赖静态仓库 / 不变模拟器。 对策与张力:真实部署要应对不断变的 API、重设计的 UI、对抗性用户输入;未来基建应弃静态 leaderboard、用非平稳模拟器让接口持续漂移;基底层面,neural-computer 构想还提示用学得的运行时状态替换固定外部执行接口,统一计算 / 记忆 / I/O——超越" merely 操作计算机的 agent"、走向自适应神经运行时。
10 Conclusion
自改进机器的愿景是 AI 的恒久主题。本综述用统一系统视角把范式转变收束为两条互补路径:foundation-model improvement(参数化、较慢的环,由内在生成式示范 / 内在评估反馈 / 外在探索经验驱动)与 scaffolding improvement(非参数、较快的环,更新 prompt / memory / tool / full-scaffold)。当 agent 走向自指架构——不仅改自身行为,也改自身推理结构——评估须从静态基准转为持续、集成的过程;本综述希望提供一套公共语言,助研究者构建可度量、可归因、安全有界、能持续扩展机器自治边界的自改进系统。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐


所有评论(0)