第一篇 · A Comprehensive Survey of Self-Evolving AI Agents(Fang, Peng, Zhang et al., 2025)

Fang, Peng, Zhang et al. — 把"自演化 AI agent"作为衔接 foundation model 与 lifelong agentic system 的新范式,用一个统一反馈环框架系统综述单 agent / 多 agent / 领域专用三类进化与优化技术。

Quick Overview

问题 现有 LLM agent 系统(单 agent 或多 agent)部署后依赖人工静态配置——架构、提示、工具、通信协议一旦设定即冻结,无法适应动态演变的真实环境(用户意图、任务需求、外部工具都会变)。问题是:如何让 agent 系统在与环境的持续交互中自主优化自身组件。

动机 ① 通常做法:大多数 agent 系统靠人工设计 workflow 与固定配置,部署即冻结;② 为何现在重要:真实环境持续演变,人工重配耗时、难扩展,而近年 agent evolution 与优化技术已积累到可被系统化的规模;③ 本文主旨:提出统一概念框架,把 feedback loop(System Inputs / Agent System / Environment / Optimiser)作为主线,把分散的自演化技术拢成可比的整体。

核心贡献

  • 形式化 Self-Evolving AI Agents 的「三定律」(Endure / Excel / Evolve),并勾勒 LLM 中心学习范式从 MOP→MOA→MAO→MASE 的演进;
  • 提出统一的概念框架,抽象出自演化反馈环(System Inputs / Agent System / Environment / Optimisers);
  • 系统综述单 agent、多 agent、领域专用三类自演化与优化技术;
  • 全面梳理评测、安全与伦理考量;
  • 指出关键开放挑战并勾勒未来研究方向。

概览图:


图 3(Original)—— 看四件事如何闭合成一个反馈环:System Inputs 给定任务设定 → Agent System 执行 → Environment 给反馈 → Optimiser 据此更新 Agent System,直到达到性能阈值。


1 Introduction

论文先把困境放进一条更长的范式演进线索里。下表把四个范式在四个维度上摊开——四个维度本身是笔记从全文行文中归并出的比较框架(论文表 1 用的是另一组列),故整表标 Author,单元格里的事实均可在正文中找到对应。

范式 是否改参数 反馈 / 交互来源 单 / 多 agent 人工配置程度
MOP(离线预训练) 否(冻结部署) 静态语料预训练 全静态,人工设定后不再动
MOA(在线适应) 是(SFT / LoRA / RLHF) 标注 / 评分 / 指令 部署后可更新,但仍人工触发
MAO(多 agent 编排) 否(不改参数) agent 间消息 / 辩论 手工 workflow、固定协议、人工工具链
MASE(多 agent 自演化) 否(自精炼 prompt / memory / tool / 拓扑) 环境反馈 + meta-reward 群体自演化,人工配置最少

表(图源:Author)—— 四范式在「改不改参数 / 反馈来源 / 单多 agent / 人工配置程度」上的递进;四个维度是笔记的比较框架,单元格事实可在正文找到;读法:沿行看每一范式,沿列看某一维度如何从静态走向自主。


图 1(Original)—— LLM 中心学习的演化:从纯静态数据训练,到与动态环境交互,再到多 agent 协作与自演化的终身学习。
表 1(Original)—— 论文自带的四范式对比(交互反馈机制、核心技术、示意)。它的列比上表少一维"人工配置程度",上表是在其基础上重新归并而成。

四个范式不是并列,而是一条每一跳都有驱动力的演进链(驱动力的"为何跃迁"框架是笔记的归纳,标 Author)。

  1. MOP(离线预训练) —— 起点:大规模静态语料预训练后冻结部署,不再适应。

  2. MOA(在线适应)—— 驱动:部署后环境与任务会变,需要 SFT / LoRA / RLHF 等手段更新模型本身。

  3. MAO(多 agent 编排) —— 驱动:单模型能力不足以应付复杂任务,需要多 agent 通信协作(此时不改参数)。

  4. MASE(多 agent 自演化)

    —— 驱动:手工 workflow、固定协议与人工工具链在动态环境下成为瓶颈,需要 agent 群体据环境反馈与 meta-reward 持续自我精炼。

时间线(图源:Author)—— MOP→MOA→MAO→MASE 四跳;每一跳解决前一阶段留下的一种"静态性"。

在进入技术综述前,论文用一张总图给出整篇的技术地图。


图 2(Original)—— 自演化与优化技术的可视分类树:单 agent / 多 agent / 领域专用三大方向,标注 2023–2025 的代表方法。读法:先看三大分支,再看每分支下的代表方法。

Definition

知识卡(图源:Derived)—— self-evolving AI agent 是一类自主系统:它通过与环境的交互,持续且系统地优化自身内部组件,以适应变化的任务、上下文与资源,同时保持安全、提升性能。"持续系统优化内部组件 + 在安全约束下"这两点把它和一次性微调、静态 agent 区分开。它衔接的是 foundation model 的静态能力与 lifelong agentic system 的持续适应。

Three Laws of Self-Evolving AI Agents

受 Asimov 机器人三定律启发,论文给出自演化的三条约束定律,后者以前者为前提。

定律 目标 约束对象 优先级
I. Endure(安全适应) 任何修改中都保持安全与稳定 安全性、稳定性 最高,是前置条件
II. Excel(性能保持) 保留或提升既有任务性能 任务性能 次之,以 I 为前提
III. Evolve(自主演化) 自主优化内部组件以应对变化 组件、结构 再次,以 I、II 为前提

表(图源:Derived)—— 三定律的目标、约束对象与优先级嵌套;关键在读"优先级"列:Excel 服从 Endure,Evolve 服从前两者,安全永远最高。

2 Foundation of AI Agent Systems

2.1 AI Agents

单 agent 由 foundation model(LLM)做核心推理,外加感知、规划、记忆、工具四个支撑模块;论文在此只做简要回顾,重点放在多 agent 系统的组织方式。

2.2 Multi-Agent Systems

多 agent 系统的两个关键设计维度是系统架构通信机制

2.2.1 System Architecture

MAS 的系统架构有三种,差别在控制方式与失败模式。

架构 控制方式 优点 缺点 / 失败模式 典型应用
Hierarchical(层级) 静态层级(线性 / 树) 模块化、易开发、领域可优化 固定拓扑、适应性差 软件、医学、科研
Centralised(中心) manager-follower 全局规划与具体执行兼顾 中心节点瓶颈、单点故障 通用任务编排
Decentralised(去中心) 对等分布式网络 无单点故障、鲁棒 信息同步 / 安全 / 协作成本高 世界模拟

表(图源:Derived)—— 三种 MAS 架构的取舍;层级结构牺牲适应性换可开发性,中心结构换来了单点风险,去中心结构换来协调成本。

2.2.2 Communication Mechanisms

通信方面,标准化协议是较新的一层,把 agent 间通信从临时消息推向可互操作。

协议 通信方向 身份 / 协商机制 特点
A2A 水平(peer-to-peer 任务委派) 未说明 结构化委派,执行对调用方不透明
ANP 水平(去中心化 “agent internet”) 内置 DID + 动态协议协商 安全、开放的横向通信
MCP 垂直(agent ↔ 外部工具 / 数据) 统一 client-server 接口 标准化工具与数据接入
Agora 水平(元协议) 动态协商通信方式 在自然语言与结构化之间切换

表(图源:Derived)—— 四类标准化协议;读法:A2A / ANP / Agora 管横向 agent 间,MCP 管纵向 agent↔工具。

2.3 The Vision of Lifelong, Self-Evolving Agentic Systems

MASE 愿景把监控自身性能、受控增量更新、自主改写 prompt / 记忆 / 工具 / 拓扑三件事嵌入架构核心,把 agent 从静态执行器变成持续学习的协作者。

3 A Conceptual Framework of MASE

论文用一个反馈环把"自演化"抽象成可比较的四组件闭环。

3.1 Overview of the Self-Evolving Process

(图源:Original,沿用论文图 3)


图 3(Original)—— 自演化过程的四组件闭环。读法:沿箭头看一轮迭代,Optimiser 的回边是"闭环"的关键。

一轮迭代按以下顺序流动(机制流,图源:Derived,把图 3 展开为步骤):

  1. System Inputs 给定任务设定(任务级或实例级)。

  2. Agent System (单或多 agent)在

    Environment 中执行任务。

  3. Environment 据评测指标给出反馈信号。

  4. Optimiser 在搜索空间 𝒮 上用算法 ℋ 更新 𝒜(改参数 / 改 prompt / 改结构);必要时合成新训练样本反哺 Inputs。

  5. 更新后的 𝒜 重新部署,进入下一轮;直到达到性能阈值或收敛。

上述第 1–4 步分别落在 第 3.2 节 System Inputs / 第 3.3 节 Agent Systems / 第 3.4 节 Environments / 第 3.5 节 Optimisers,下文逐一展开。

Optimiser 的目标是公式 (1):

𝒜*=argmax𝒜∈𝒮 𝒪(𝒜; ℐ)

公式(图源:Original)—— 在搜索空间 S 中找让评测函数 O(A; I) 最大的 agent 配置 A*。

各符号汇总如下(记号表,图源:Derived):

符号 含义 定义处
system inputs(任务设定) 第 3.2 节
𝒜 agent system(被优化的对象) 第 3.3 节
𝒮 search space(可探索的 agent 配置集合) 第 3.5 节
𝒪(𝒜;ℐ) 评测函数,把 A 在 I 上的性能映射为标量 公式 (1)
优化算法(启发式 / 梯度 / BO / MCTS / RL / 进化 / 学习策略) 第 3.5 节
𝒜* 最优 agent 配置(argmax O) 公式 (1)

3.2 System Inputs

系统输入 ℐ 定义问题设定与优化范围,分两种粒度,各自的输入构成与优化目标不同(对比表,图源:Derived)。

粒度 输入构成 ℐ 优化目标 缺标注数据时
任务级(Task-Level) {τ, 𝒟train},可另留 𝒟test 评估 提升整个任务上的整体性能 用 LLM 合成替代训练集
实例级(Instance-Level) {(x,y), 𝒞}(输入输出对 + 可选上下文) 提升某一具体样本上的性能 未说明

表(图源:Derived)—— 系统输入两粒度;读法:任务级面向一类任务的整体性能,实例级面向单个样本、是更细粒度的设定。

3.3 Agent Systems

被优化的核心对象是 agent 系统 𝒜,可单 agent 也可多 agent。𝒜 可分解为多个组件——底层 LLM、prompting 策略、memory 模块、tool-use 策略,多 agent 系统再加 inter-agent 拓扑;后续 第 4、5 节 的方法分别落在这些组件上。优化范围是 𝒜 的一个设计维度:只动一个组件,还是联合多个(对比表,图源:Derived)。

优化范围 改什么 论文举例 在本笔记
单组件优化 只动 𝒜 的一个组件 微调 LLM;或调 prompt / 选工具(不改 LLM 本身) 第 4 章多数方法
多组件联合优化 同时动多个组件 单 agent:LLM + prompt;多 agent:prompt + 拓扑 第 5.2.3 节 unified

表(图源:Derived)—— 𝒜 的优化范围;读法:多数现有工作只动单组件,联合优化更新、能建模组件间耦合——后者正是 第 5.2.3 节 unified 一脉的动机。

3.4 Environments

环境既提供运行上下文(从 benchmark 数据集到真实动态环境;代码任务里是编译器 / 解释器 / 测试用例,科研里是文献库 / 仿真 / 实验设备),也产生反馈信号;反馈来源分两种,差别在"有无 ground-truth"(对比表,图源:Derived)。

反馈来源 适用条件 形式 例子
任务评测指标 有 ground-truth 或可执行验证 定量(accuracy / F1 / success rate) 代码:编译器 + 测试用例的执行反馈
LLM evaluator 无 ground-truth 代理指标或文本反馈(正确性 / 相关性 / 连贯性 / 对齐) 评输出的 correctness / relevance / coherence

表(图源:Derived)—— 环境反馈两来源;读法:有 ground-truth 时直接用任务指标,没有时退而用 LLM 当裁判给代理信号——这正是 第 7.2 节 LLM-based 评测的由来。评测策略详见 第 7 节。

3.5 Optimisers

优化器据环境反馈在搜索空间 𝒮(粒度从 prompt / 工具策略到连续 LLM 参数 / 架构结构)上,用算法 ℋ 找最优配置;论文把 ℋ 归为七类(启发式 / 梯度 / BO / MCTS / RL / 进化 / 学习策略)。(𝒮,ℋ) 共同决定优化器行为,目标即公式 (1)。后续 第 4、5、6 节 分单 agent / 多 agent / 领域三种设定展开(总览见图 5)。

框架落地后,方法如何分布?论文用一张总层级图把全书方法挂上去。


图 5(Original)—— 自演化方法的完整层级分类(单 agent / 多 agent / 领域专用),配代表工作。读法:三层从上到下,叶子是具体方法。

4 Single-Agent Optimisation

单 agent 优化按"被优化的组件"分成四类(图源:Original,沿用图 4)。


图 4(Original)—— 单 agent 优化按目标组件的分类(prompt / memory / tool;正文另把 LLM 行为列为第四类)。读法:先看三类组件,再看各自方法。

四个目标组件构成一棵两层分类树(分类,图源:Derived):根为单 agent 优化,第一层为 LLM 行为 / prompt / memory / tool 四类,每类下再分方法族。

注:图 4 的标题只列 prompt / memory / tool 三类,而正文明确说"四大类(含 LLM 行为优化)";笔记按正文更完整的四类组织。

4.1 LLM Behaviour Optimisation

LLM 行为优化分训练式(第 4.1.1 节,改参数)与测试式(第 4.1.2 节,不改参数)两路,再各分两族;四族在"优化信号 × 更新方式"上不同(对比表,图源:Derived)。

子路 优化信号 / 反馈来源 更新方式 代表方法
训练式 · SFT(第 4.1.1 节) 标注推理轨迹(自身 rollout / 教师演示) 监督微调(模仿轨迹) STaR、NExT、Deepseek-Prover
训练式 · RL(第 4.1.1 节) 偏好对 / 可验证奖励 / 过程奖励 强化学习(奖励驱动策略更新) DPO、Absolute Zero、DeepSeek-R1(GRPO)、R-Zero
测试式 · 反馈(第 4.1.2 节) 外部 verifier(编译器 / 过程奖励模型) 据分数 refine 当前输出 CodeT、LEVER、Baldur
测试式 · 搜索(第 4.1.2 节) 多候选 + verifier 采样多条再选最优 CoT-SC、Tree-of-Thoughts、Graph-of-Thoughts

表(图源:Derived)—— LLM 行为优化四子路;读法:沿"子路"看训练式改参数、测试式不改,沿"优化信号"看从轨迹到奖励到 verifier 的递进。

4.2 Prompt Optimisation

prompt 优化是四类中方法族最齐整的一类,论文 第 4.2.1–4.2.4 节 给出四族,各自搜索操作与信号不同(第 4.2.1 节 Edit-based / 第 4.2.2 节 Generative / 第 4.2.3 节 Text-gradient / 第 4.2.4 节 Evolutionary)。

方法族 搜索操作 优化信号 探索范围 代表方法
Edit-based 插入 / 删除 / 替换等局部编辑 评测分数 局部(prompt 邻域) GRIPS、TEMPERA
Generative 让 LLM 整体重写 prompt 历史 prompt + 分数 / exemplar / meta-prompt 全局(更广 prompt 空间) ORPO、PromptAgent、MIPRO
Text-gradient 生成"文本梯度"再反向更新 自然语言 critic 沿"梯度"方向 ProTeGi、TextGrad
Evolutionary 变异 / 交叉 / 选择 种群适应度 种群演化 EvoPrompt、Promptbreeder

表(图源:Derived)—— prompt 优化四族;读法:沿"搜索操作"列看四族如何各走一条搜索路径,沿"探索范围"看从局部走向种群。

4.3 Memory Optimisation

记忆优化只覆盖推理时策略(不改参数),分短期(第 4.3.1 节)与长期(第 4.3.2 节),两者优化目标与机制不同(对比表,图源:Derived)。

类别 优化目标 核心机制 代表方法
短期记忆(第 4.3.1 节) 管理有限上下文、保持局部连贯 摘要 / 选择性保留 / 稀疏注意力 Reflexion、MemoryBank、MoT
长期记忆(第 4.3.2 节) 跨会话持久检索、扩展记忆范围 RAG / 向量索引 / 知识图 MemGPT、HippoRAG、A-MEM、Mem0

表(图源:Derived)—— 记忆优化两类;读法:短期管"当下上下文"靠压缩保留,长期管"跨会话知识"靠检索;短期不足以泛化,故需长期补。

4.4 Tool Optimisation

工具优化分三个方向,差别在"优化对象 × 做法"(对比表,图源:Derived)。

方向 优化对象 做法 代表方法
训练式(第 4.4.1 节) LLM 参数 SFT / RL 教模型何时用、怎么用工具 ToolLLM、ReTool、Tool-N1
推理式(第 4.4.2 节) 工具文档 / prompt 重构文档或树搜索选工具 EASYTOOL、ToolChain、Tool-Planner
功能优化(第 4.4.3 节) 工具本身 修改或创造新工具 CREATOR、LATM、CRAFT

表(图源:Derived)—— 工具优化三方向;读法:沿"优化对象"看从模型参数到文档到工具本身——前两向让 agent 更会用既有工具,第三向让 agent 自造工具。

5 Multi-Agent Optimisation

多 agent 优化的总图把"手动设计 → 自演化"这条轴,与自演化下的四条优化维度一起画出。


图 6(Original)—— 多 agent 优化:左侧核心元素(空间 / 方法 / 目标),右侧优化维度(prompt / topology / unified / backbone)。读法:左看优化要素,右看四条优化维度。

5.1 Manually Designed Multi-Agent Systems

手动设计端给出三种现成 workflow 作为基线,它们拓扑固定、靠人工编排,是自演化方法的对照起点;三者在"拓扑 × 取舍"上不同(对比表,图源:Derived)。

Workflow 拓扑 / 协作方式 优点 代价 / 失败模式
Parallel(并行) 并发执行 + 投票聚合 吞吐横向扩展、多层聚合降误差 协调一致性工程成本随规模指数增长
Hierarchical(层级) 多层自上而下 / 顺序流水线 擅长复杂目标驱动任务(深度研究、代码生成) 固定拓扑、适应性差
Debate(辩论) 对抗-协商-仲裁循环 平衡准确性与可解释性;置信度门控可降推理成本 实现与维护成本高

表(图源:Derived)—— 三种手动 workflow;读法:并行换扩展性、层级换可控性、辩论换可解释性,共性是拓扑固定——这正是自演化要松开的。

5.2 Self-Evolving Multi-Agent System

自演化端把工作流优化当成搜索问题,按被优化的维度分四类(分类,图源:Derived):prompt / topology / unified / backbone,对应 第 5.2.1–5.2.4 节;四类各自优化什么、在什么空间上搜,见下表(对比表,图源:Derived)。

优化维度 优化对象 搜索空间 代表方法
prompt(第 5.2.1 节) agent 指令 / 角色 / 团队配置 prompt 文本 / 角色设置 AutoAgents、DSPy
topology(第 5.2.2 节) agent 间连接 / 通信结构 代码图 / 通信图 AFlow、GPTSwarm、AgentPrune
unified(第 5.2.3 节) prompt + topology(+ tool)联合 统一代码 / 配置 ADAS、EvoAgent、MASS、MaAS
backbone(第 5.2.4 节) 底层 LLM 参数 模型权重 Sirius、MALT、OPTIMA

表(图源:Derived)—— 四条优化维度;读法:沿"优化对象"看从指令到连接到联合到模型参数,搜索空间随之从文本到图到代码到权重。

前三类(prompt / topology / unified)在"搜索空间表示 × 优化算法"上分布很广,论文按方法叙述、未列表;下表把它们的代表方法重新归并(图源:Derived)。

方法 优化维度 搜索空间表示 优化算法 特点
AutoAgents prompt(团队配置) 角色与执行计划 结构化对话(meta-agents) 从单 agent 扩到整队配置
AFlow topology 可复用算子组成的代码图 MCTS(LLM 引导扩展) 比 RL over CoRE 更样本高效
GPTSwarm topology 计算图中的连接 RL(松弛为连续边概率) 学习最优 agent 连接
ADAS unified Python 代码(prompt+workflow+tool) 元 agent 搜索 代码即统一表示,prompt 与拓扑共演化
EvoAgent unified 文本 agent 设置(角色 / 技能 / prompt) 进化(变异 / 交叉 / 选择) 显式演化配置级特征
MASS unified prompt + workflow 拓扑 三阶段条件耦合优化 局部 prompt → 拓扑 → 全局 prompt 交替
MaAS unified agent 超网(架构分布) 控制器 + MC + 文本梯度 查询级采样,推理成本大降
AgentPrune topology(剪枝) 时空通信图的边 低秩引导图掩码(一次性剪枝) 以 token 经济为优化目标

表(图源:Derived)—— 八个代表方法在"维度 / 表示 / 算法"上的分布;读法:沿"搜索空间表示"看从代码到图到文本配置,沿"优化算法"看从 RL 到 MCTS 到进化。

5.2.4 LLM Backbone Optimisation

backbone 优化分两条路,差别在"练什么"。Reasoning-oriented(Sirius、MALT、MaPoRL、MARFT)用多 agent 协作轨迹做 SFT / DPO / RL,练推理与角色专精;collaboration-oriented(COPPER、OPTIMA)直接训"会不会协作",OPTIMA 报告 2.8× 性能、token 成本不到 10%。前者把 backbone 当推理器,后者把它当队友——前者依赖高质量轨迹,后者依赖通信效率信号。

6 Domain-Specific Optimisation

通用方法之外,领域系统把优化策略与领域约束紧耦合。论文按三领域组织:第 6.1 节 生物医学、第 6.2 节 编程、第 6.3 节 金融与法律,每领域两个子任务,共六个。

6.1 Domain-Specific Optimisation in Biomedicine

生物医学覆盖 第 6.1.1 节 医疗诊断与 第 6.1.2 节 分子发现,约束在临床流程、循证工具与化学可证性(对比表,图源:Derived)。

子任务 代表方法 优化目标 领域约束 / 特有机制
医疗诊断(第 6.1.1 节) MDAgents、MedAgent-Pro、MedAgentSim 多轮问诊 + 多模态证据推理 临床流程、循证工具、不确定性
分子发现(第 6.1.2 节) CACTUS、ChemAgent、DrugAgent 化学结构的符号推理 化学工具(RDKit)、可证性

表(图源:Derived)—— 生物医学两子任务;诊断绑临床流程与多模态证据,分子绑化学工具与可证性。

6.2 Domain-Specific Optimisation in Programming

编程覆盖 第 6.2.1 节 代码精炼与 第 6.2.2 节 代码调试,约束在软件工程最佳实践与运行时反馈(对比表,图源:Derived)。

子任务 代表方法 优化目标 领域约束 / 特有机制
代码精炼(第 6.2.1 节) Self-Refine、CodeAgent、OpenHands 迭代提升代码质量与结构 软件工程最佳实践、工具增强
代码调试(第 6.2.2 节) Self-Debugging、PyCapsule、FixAgent 故障定位 + 执行感知修复 运行时反馈、模块化角色

表(图源:Derived)—— 编程两子任务;精炼绑自反馈与最佳实践,调试绑运行时反馈与模块化角色。

6.3 Domain-Specific Optimisation in Financial and Legal Research

金融与法律覆盖 第 6.3.1 节 金融决策与 第 6.3.2 节 法律推理,约束在合规与判例锚定(对比表,图源:Derived)。

子任务 代表方法 优化目标 领域约束 / 特有机制
金融决策(第 6.3.1 节) FinCon、PEER、FinRobot 动态市场下的决策与报告 数值 + 新闻 + 专家知识、合规
法律推理(第 6.3.2 节) LawLuo、AgentCourt、LegalGPT 规则锚定的论证与审判模拟 法规与判例、程序一致性

表(图源:Derived)—— 金融与法律两子任务;金融绑合规与多源信息,法律绑判例与程序一致性;跨三领域共性是把领域约束写进优化目标。

7 Evaluation

评测被当作动态反馈机制,而不仅是终点。它沿三条线组织(分类,图源:Derived):benchmark-based / LLM-based / safety

7.1 Benchmark-based Evaluation

benchmark-based 一支按所测 agent 能力分五类(工具 / API、Web 导航、多 agent 协作与通才、GUI 与多模态、领域任务),各类下挂着大量具名基准;下表选出代表,标出所测能力与盲点(对比表,图源:Derived)。

Benchmark 类别 评的能力 环境 / 指标 局限
ToolBench、API-Bank 工具 / API API 调用正确性与效率 模拟 API / 沙箱 易过拟合特定 schema
GTA、AppWorld 工具 / API 多步规划 + 多工具协调 过程导向指标 未说明
WebArena、VisualWebArena Web 导航 导航 + 图文整合 模拟 / 真实网页 可复现性、界面变化
GAIA、AgentBench、MultiAgentBench、SwarmBench 多 agent 协作 / 通才 跨环境适应;协作 / 竞争 / 通信与策略质量 多任务聚合 指标聚合难、易过拟合
OSWorld、AndroidWorld GUI / 多模态 复杂动作序列 + 状态管理 真实 OS / App 标准化难、界面脆弱
SWE-bench 领域(编程) 真实仓库代码编辑 测试通过率 未说明
AgentClinic、MMedAgent 领域(医学) 临床多模态推理 领域一致性 指标定义不一

表(图源:Derived)—— 代表基准;读法:沿"类别"看五类能力,沿"局限"看共同痛点——可复现性、泛化、指标定义不一。

7.2 LLM-based Evaluation

LLM-based 一支用大模型当裁判:LLM-as-Judge(pointwise / pairwise)只评最终输出,Agent-as-Judge 则评整条推理轨迹而非只看输出。

7.3 Safety, Alignment, and Robustness in Lifelong Self-Evolving Agents

safety 一支(AgentHarm、RedCode、MACHIAVELLI、SafeLawBench 等)测恶意顺从、权力寻租与法律对齐。共同短板:多数评测是快照式的,对 MASE 这种持续演化的系统,需要纵向、演化感知的评测。

8 Challenges and Future Directions

8.1 Challenges

挑战按三定律归组(Endure / Excel / Evolve,对应 第 8.1.1–8.1.3 节),共七个;每个挑战都点出成因与所需能力(对比表,图源:Derived)。

挑战 所属定律 成因 所需能力 / 方向
安全 / 监管 / 对齐 Endure 优化优先任务指标、忽视安全;动态 agent 冲击静态法规 演化感知审计、可证安全沙箱
奖励建模与优化不稳定 Endure 中间步骤奖励数据稀缺、监督噪声、反馈不一致 稳定的奖励与更新规则
科学 / 领域场景评测 Excel 缺乏可靠 ground-truth 可信反馈信号的构造
MAS 效率—效果平衡 Excel 大规模 MAS 算力 / 延迟 / 不稳定 显式建模性能—资源权衡
prompt / 拓扑可迁移性 Excel 优化结果对 backbone 脆弱 跨 backbone 可迁移
多模态 / 空间环境优化 Evolve 多数算法仅文本 内部世界模型、感知—时序推理
工具使用与创造 Evolve 多假定固定工具集 工具的自主发现与共创

表(图源:Derived)—— 七个挑战;读法:沿"所属定律"看 Endure 管安全稳定、Excel 管性能、Evolve 管自主优化,沿"成因"看每个挑战的根。

8.2 Future Directions

五个未来方向各自承接范式演进的一个阶段(对比表,图源:Derived)。

未来方向 承接范式阶段 对应挑战(笔记归纳) 关键举措
全自主自演化的仿真环境 MASE 工具共创 / 多模态 开放交互式仿真平台,闭环优化 prompt / memory / tool / workflow
推进工具使用与创造 MAO→MASE 固定工具集假设 自适应选择 / 组合 / 创造工具 + RL + 评测管线
真实世界评测与基准 Cross-stage 评测快照化 反映真实复杂度、交互式 + 纵向评测
MAS 效率—效果权衡 MAO MAS 算力 / 延迟 联合建模性能与资源约束
面向科学的领域感知演化 MASE 领域 ground-truth 缺失 异构知识源、定制评测、合规

表(图源:Derived)—— 五个方向;读法:沿"承接范式阶段"看每个方向推着 MOP→MOA→MAO→MASE 往前走哪一步。

9 Conclusions

洞察(图源:Author)—— 全文的主线是"把静态一路松开":MOP→MOA→MAO→MASE 松开的是参数、协作、最后是配置本身;统一反馈环(System Inputs / Agent System / Environment / Optimiser)给了这条松开过程一个共同骨架,三定律则给"能松到什么程度"加了护栏——安全永远高于性能、性能高于自主。框架是骨架,定律是边界,范式演进是动力,三者合力把 agent 从"训练一次"推向"活、学、持久"。一处需读者留意:结论把反馈环第三组件称为 “Objectives”,而第 3 节称为 “Environment”,论文自身在此命名不一致。

注:Acknowledgements 与 References 按非内容块略去,不单列。


第二篇 · Self-Improvements in Modern Agentic Systems: A Survey(Gao et al., 2026)

一篇把"自改进智能体"从经典 AI 根源到现代 FM 智能体打通的综述。笔记保留论文原章节顺序,在每节升级表征(对比表 / 演进时间线 / 设计矩阵 / 问题卡),并把论文全部 12 张图 + Table 4 图标悉数保留。

Quick Overview

问题 现代 foundation-model (FM) 智能体能否在极少乃至无人介入下,把自己跑出来的经验持续转成能力增益;而既有综述常把"改模型参数"与"改脚手架 (scaffold)"当两个孤立话题,术语(self-correction / meta-prompting / self-play)又彼此重叠,缺一个统一形式化与历史脉络。

动机

  • ① 已有综述多按"改什么 / 何时改 / 怎么改"组织,或只覆盖静态 LLM 的自学习,常把 fine-tuning 与 scaffolding 割裂,也少追溯至经典 AI 的自改进根源;

  • ② foundation model 让自然语言成为统一的语义介质,把过去在汇编码 / 原始权重空间里的低层自修改搜索空间骤然压缩,使自改进首次可规模化;

  • ③ 本综述用一个系统级框架把智能体写成

    𝒜=(θ,Σ),把自改进形式化为自诱导更新算子 𝒰,再按"改什么(θ 还是 Σ)"与"信号从哪来"两条轴统一组织文献。

核心贡献

  • 历史脉络与演化:从经典 AI(最小二乘、控制论、Gödel 机、快速权重编程器)到现代 FM 智能体,梳理自改进机制如何迁入 agentic 时代;
  • 统一形式化与系统分类法:在 𝒜=(θ,Σ) 框架下把机制分成 foundation model improvementscaffold improvement 两条路径(覆盖 prompt / memory / tool / full-scaffold);
  • 经验版图、评估范式与前沿:结合软件工程、网页导航、科学发现等应用与评估协议分析,指出可靠、可持续自改进需考虑的安全因素与挑战。

概览图(图源:Original)— 看两条路径如何分:

Figure 1

Figure 1 把"改什么"切成两条路:左路 Foundation Model Improvement 更新参数 θt→θt+1,信号来自内在生成式示范 𝒟t / 内在评估反馈 et / 外在探索经验 τt;右路 Scaffolding Improvement 非参数地更新脚手架 Σt→Σt+1,由统一信号 St 驱动 prompt p、memory m、tool 𝒯 或全脚手架 Σ。这张图是全文的总纲,后续每节都在这两条路上展开。


1 Introduction

论文先抛出 Good (1966) 的"超智能机器是人类需要做出的最后一项发明",把自改进定位成一个自指 (self-referential) 过程:系统自主审视、评估并刻意修改自身的优化机制与操作逻辑。古典机制(Schmidhuber 1987 自指学习、2003 Gödel Machine)能证明性地改写自身,但受困于在低层汇编码 / 权重空间搜索;现代 FM 用自然语言把搜索空间骤然压缩,让自改进首次可规模化。

要落地,作为认知核的 FM 外面通常裹一层 operational scaffold(指令、记忆、工具、控制逻辑,亦称 agent harness)。论文据此提出二分总纲:

自改进(按"改什么"切两条路)├─ Foundation Model Improvement   改 θ:慢、稳、可跨任务摊销└─ Scaffolding Improvement        改 Σ:快、可逆、任务相关     └─ 再按"信号从哪来"细分

(图源:Derived,依据 Figure 1 / Figure 3 重画的两层切分)

与既有综述的定位差异

论文用 Table 1 把自己和三篇近综述在 8 个组织维度上对比(图源:Original)。读法:=primary、=secondary、=not focus;Ours 一列在 8 维全为 primary,凸显"统一形式化 + 历史根源 + 领域覆盖"三处是别家少做的。

Dimension Ours (2026) Gao et al. (2026a) Fang et al. (2025a) Tao et al. (2024)
Agent formulation
Definition scope
Historical roots
Signal lens
Update substrate
Evaluation lens
Domain coverage
Outlook & issues

论文据此主张:前人常把 fine-tuning 与 scaffolding 当孤立话题、缺乏统一形式视角,也很少把概念根源追到经典 AI;本综述要补的就是"统一形式化 + 历史演化 + 前瞻路线图"三件。

两条路的代表工作分布(2023–2026)

(图源:Original)下面 Figure 2 把代表性工作按发表年份排进左 (θ)、右 (Σ) 两道;读时注意左右两道在 2024 年后都迅速加密,且末端指向 AGI 路标——这是全文"长期向一般化智能演进"的伏笔。

Figure 2

Figure 2 显示:foundation-model 一侧(左道)多靠 RL/微调周期推进,scaffolding 一侧(右道)则在 2024–2026 间涌现大量 prompt/memory/tool/full-scaffold 的迭代工作;两条道都在加速,但节奏与可逆性不同。


2 Historical Context and Theoretical Foundations

论文的核心论点:自改进不是 FM 时代的新发明,而是 AI 的基础目标。区别于"在固定架构里优化参数"的标准机器学习,真正的自改进要求系统显式审视并改写自身的操作逻辑 / 启发式 / 学习算法。

下面的演进时间线(图源:Author)按论文第二章的五个历史范式整理,每跳点标出驱动它的瓶颈——即上一个范式卡在哪里、才逼出下一个:

时代 代表 关键机制 卡点 / 驱动下一跳
① 1790s–1960s 基础概念 最小二乘 (Legendre/Gauss)、Cybernetics (Wiener)、homeostasis (Ashby)、Turing child machine、perceptron、Samuel checkers 误差驱动适配、反馈闭环 架构与学习算法固定,只是"高级学习"而非自指自改进 → 需要 Gödel 1931 的自指蓝图与 Good 1966 的概念
② 1960s–1980s 符号启发式 von Neumann 自复制自动机、AM、EURISKO 把启发式当一等公民对象来改写 EURISKO 的成功重度依赖人类做外部评估信号,缺自主闭环信用分配 → 逼向连接主义元学习
③ 1980s–2000s 连接主义 & 元学习 Schmidhuber 自指学习、fast-weight programmers (=1991 unnormalized linear Transformer)、自指权重矩阵、Gödel Machine (2003)、AIXI、NEAT 学习过程本身当搜索对象;连续程序空间的自修改 仍受限于低层权重 / 代码搜索,难 open-ended → 需要形式化安全与可规模化工程
④ 2000s–2020s 形式化 & 架构级 Orseau & Ring(自欺、reward tampering)、reflective oracles、logical induction、NAS、self-play 理论上界定自改进风险;工程上自动搜架构 理想模型与实际部署有鸿沟 → 等 FM 提供高表达力通用基底
⑤ 2020s–至今 可扩展 FM in-context learning(=fast-weight programmers 的 KV cache 等价)、RLHF、Constitutional AI、ReAct、Reflexion、skill libraries 自然语言作统一语义介质;快(in-context)+ 慢(参数)两层嵌套环 古典控制 / 评估 / 安全问题在新规模上重现

(图源:Original)Figure 4 是论文自己画的理论根源时间线(1790s 至今),与上表一一对应,可对照阅读:

Figure 4

Figure 4 的要点:从"误差驱动适配"到"自指机器"花了约两个世纪,真正的自指要到 1987 年 Schmidhuber 的自指学习框架才有了可操作算法,2003 年 Gödel Machine 给出理论天花板(可证明地改写自身),而 FM 让这些古典原则首次能 open-ended 地规模化。

一条贯穿主线的洞见(图源:Author):五个范式其实在反复解决同一个张力——“自改进需要系统改自身,但改自身又需要可靠的内部评估信号”。EURISKO 卡在外部人工评估,现代 self-judge 方法卡在 evaluator-policy 耦合,根是同一个。


3 Definitions

形式化框架:把智能体写成 𝒜=(θ,Σ)

论文把一个 FM 智能体在时刻 t 的配置定义为

𝒜t = (θt, Σt), Σt := (pt, mt, 𝒯t, gt),

其中 θt 是 FM 的神经参数,Σt 是动态操作脚手架:pt(结构化 prompt / 系统指令)、mt(记忆及其检索更新策略)、𝒯t(外部工具及调用接口)、gt(路由 / 调度 / 安全等控制逻辑)。FM 本身是无状态推理引擎,autonomy 来自把它与这个持久、可交互的 scaffold 耦合。

执行时还维持一个短暂执行态 Xt(KV cache、中间计划、工作记忆),它随交互流演化,但一旦任务边界跨过就被丢弃——因此 Xt不属于智能体的内在架构;内在的只有 (θt,Σt)。诱导策略记为 πθt,Σt(At Xt)。

(图源:Original)Figure 5 是该形式化的示意,读时盯住"哪些是内在 (θ,Σ)、哪些是短暂 Xt"这条分界:

Figure 5

Figure 5 表明:标准智能体只靠动态更新 Xt(如 in-context 例子)适配新情况,能力被初始配置封顶;自改进智能体则会持久地改 (θ,Σ)。

自改进算子 𝒰:执行相 + 更新相

承接 𝒜t=(θt,Σt),论文把 foundation-model 智能体的自改进(SI-FMA,Self-Improvement in Foundation-Model-based Agents)定义为持久的、内源的适配过程:智能体主动利用自身执行诱导出的信号——交互结果、批评、验证结果、编辑建议——去持久地修改自身的计算组件(θ 或 Σ),区别于 Xt 的常规演化;其根源是显式自指元学习(Schmidhuber, 1987/1993/1997)。该过程被进一步概念化为一个自诱导更新算子 𝒰,拆成两相:

𝒜t+1 = 𝒰(𝒜1:t, ℰ(πθt,Σt; Σt, 𝒞t)).

  • ℰ:执行相——跑诱导策略、产出学习信号(轨迹 / 反思 / 批评 / 编辑建议);Σt 作为显式参数传入,允许自检(如批评 prompt 模板);
  • 𝒰:更新相——把自产信号提交成 θ 或 Σ 的持久改动(区别于 Xt 的常规演化)。

两种自指模式:① 间接——策略生成经验 / 辅助产物当监督,再由外部优化过程改 θ(分布层自改进);② 直接——策略通过动作编辑 prompt / 改组记忆 / 重配工具 / 改控制逻辑,直接改 Σ(动作层自改进)。对应两条路径:foundation model improvement(参数空间,eq. 5)与 scaffolding improvement(执行空间,eq. 6)。

Skill:横跨两条路径的可复用更新

(图源:Author 洞见)论文把 skill 建模成算子 𝒰 的一个可复用实例——一个被保留、可复用的对 𝒜t 的命名更新。skill 的身份是"它编码的更新",基底只是"存到哪":

  • 序列化到基底:工具及调用约定 (

    𝒯)、指令 / 工作流 §、记忆条目 (m)、固化权重 (θ)、控制逻辑 (g)——这正是 skill 正交于分类法的基底轴;

  • 两种复用:反复调用(跨任务多次跑某例程),或一次性安装(留下持久改动但仍是可移植产物);

  • 两种作用域:object-level skill 作用于任务 / 世界态(≈ 分层 RL 的 option);

    meta-level skill 作用于智能体自身配置

    𝒜t(写新工具、重构 prompt、固化经验、打补丁自身 scaffold)——后者是自改进的核心。一旦 meta-level skill 自身又被改进,便恢复 Schmidhuber (1987/1993/2003b) 的自指环:改进者随它所改进的系统一同演化。


3.3 Connections to Related Learning Paradigms

SI-FMA(见 §3.2,Self-Improvement in Foundation-Model-based Agents——把自改进形式化为"持久、内源适配"的 FM 智能体范式)深植于既有学习理论。本节论断(claim):把 SI-FMA 映回三类经典框架(RL / online learning / active learning),可一次厘清三件事——它在哪继承了既有假设、在哪重组了熟悉机制、又在哪因 agent 架构而变得操作上本质不同。一条贯穿全节的发现:θ 更新基本落在经典框架内,Σ 更新则重塑决策过程本身(动态改变有效状态-动作空间与观测处理逻辑),是经典 RL / online learning 没有对应物的结构元学习;此外 SI-FMA 在信号来源上也偏离经典——越来越靠自产监督(自当 critic)而非外部标量奖励 / oracle 标签。下表(图源:Derived,依据该节三段整理)按 θ 通道、Σ 通道、信号来源三列对照:

范式 θ 通道(改参数) Σ 通道(改脚手架) 信号来源
Reinforcement Learning 标准策略优化(RLHF、self-play,用 PPO/DPO),FM 当大规模策略网络 经典 RL 无对应物:改 Σ 会动态改变有效状态-动作空间与观测处理逻辑,即重塑 MDP 本身;优化对象是离散结构(prompt / 记忆 / 路由),靠搜索 / 生成 / 符号编辑而非梯度 经典 RL 靠外部标量奖励;SI-FMA 越来越多用自产监督(自当 critic)
Online Learning 继承稳定性挑战:分布漂移、灾难性遗忘;用 replay / 正则 / PEFT / 显式版本化回滚缓解 通过 prompting / 记忆读写 / 工具路由 / 编排逻辑实现快速适配,透明可控但仍有自身失败模式(记忆投毒、工具语义漂移、模板脆性) 交汇处: θ 更新=非平稳流下更新假设;Σ 更新=系统级适配
Active Learning 智能体主动控制数据获取(盯高频失败、找 verifier 分歧最大化、显式要人类反馈);因常靠自产验证而非 oracle 标签,超越经典主动学习,直连人工好奇框架(learning progress / Bayesian surprise / compression progress)

要点(图源:Author):θ/Σ 两通道在经典框架里"内有 / 外无"之分,正是本综述信号透镜 (signal lens) 的立论点——其中 Σ 通道那块经典 RL / online learning 无对应物的结构元学习,是 §6 整条 scaffolding-improvement 路径的概念根基。


4 A Taxonomy of Existing Approaches

论文用统一记号 IMPROVEtarget(·; 𝒮t) 抽象自改进过程,其中 𝒮t 是执行自产的更新信号(operator ℰ)。先按改的目标分两条路径,再在每条路径内按信号形式被改组件细分:

  • Foundation Model Improvement(eq. 7,

    θt+1=IMPROVEθ(θ1:t;𝒮t),Σ 不变)按信号分三种:内在生成式示范 𝒟t、内在评估反馈 et、外在探索经验 τt;

  • Scaffolding Improvement(eq. 8,

    Σt+1=IMPROVEΣ(Σ1:t;𝒮t),θ 不变)按组件分四种:prompt p、memory m、tool 𝒯、full scaffolding Σ。

(图源:Original)Figure 3 是论文的统一分类法总图,读法:顶层先分 FM/scaffold 两支,FM 支下挂三类信号,scaffold 支下挂四类组件,底部再接评估基准——这正是 §5–§8 的目录:

Figure 3

Figure 3 的价值在于把"改什么"与"信号从哪来"两个轴叠在一张图上:同一类方法(如 self-play)既可归到 θ 路径(作 τt),也可在 scaffold 路径出现(作组件更新信号),分类法给出了一致比较的公共语言。


5 Foundation Model Improvement

参数改进把 FM 当"可持续学习的系统",把改进存进参数记忆而非短暂执行态。通用更新环(Algorithm 1,图源:Derived,依据论文伪代码重画并译注)如下:

for t = 0 .. T-1:    S_t ← ∅    if 含 intrinsic generative demonstrations: S_t ← S_t ∪ GenerateDemonstrations(A_t)   # §5.1    if 含 intrinsic evaluative feedback:      S_t ← S_t ∪ GenerateEvaluativeFeedback(A_t) # §5.2    if 含 extrinsic exploratory experience:   S_t ← S_t ∪ CollectExperience(A_t, env)     # §5.3    S_t ← FilterOrWeight(S_t)            # 可选质量门控    θ_{t+1} ← Update(θ_{1:t}, S_t)       # 参数更新(常从当前 checkpoint θ_t 起步)    A_{t+1} ← (θ_{t+1}, Σ)               # scaffold 不变    if Converged(A_{t+1}): breakreturn A_T

要点:三类信号不互斥,实际管线常在一个周期里混用;论文按主导信号源归类。θ1:t 历史用于验证与回滚(更新劣化时可回退 checkpoint)。

(图源:Original)Figure 6 把三类信号画成三条独立的参数更新环:

Figure 6

Figure 6 表明:三类环路共用同一个"生成信号 → 过滤 → 更新 θ"骨架,差别只在信号是示范评估还是交互经验


5.1 Intrinsic Generative Demonstrations

FM 同时当"认知学习者"和"数据合成器",靠权重里已压缩的语义先验,无需新外部观测就自构训练数据:指令-响应对、推理轨迹、执行日志。形式上 St≈𝒟t,从诱导分布 𝒫gen(x,y𝒜t) 采样(eq. 9),可选质量算子 Φt 过滤,参数更新 = 在 𝒟t 上优化经验目标 + 围绕 θ0 的正则(eq. 10–11)。

下表(图源:Derived,依据 §5.1 生成策略段整理)对比主要生成策略及其失败模式:

生成策略 机制 过滤 / 质量信号 失败模式
复杂度演化 (Evol-Instruct) LLM 改写指令逐步加难 子问题构造破坏原任务约束
自一致性过滤 (Huang et al., 2023) 取高置信推理路径 多路径自洽 模型"自信地错"时反复收敛到同一错误结论
验证器过滤 (Singh et al., 2024) 只留能过 unit test 的解 外部验证器(单元测试) 验证器覆盖不全时漏选
课程式分解 (Simonds & Yoshiyama, 2025) 递归把难题拆成子问题 分解方法本身有缺陷
多样性池扩展 (Qin et al., 2025) 显式扩样本池抗多样性衰减 多样性感知选择
测试期自改进 TT-SI (Acikgoz et al., 2025) 推理时按不确定性检弱例、针对性 LoRA 不确定性估计

关键张力:递归自训练会触发 model collapse / pattern collapse / knowledge bubbles——把缺陷样本内化、解空间收窄、反复加固既有偏置。论文列出的 safeguards:保留真实基准数据叠加其上(Gerstgrasser et al., 2024)、用专门验证器 / 定理证明器把关、多样性感知池化、不确定性驱动生成、以及人类审计。


5.2 Intrinsic Evaluative Feedback

把"获取监督"重构成内部评估过程:FM 当输出者、自评者,最终当内化自身判断的学习者,产出标量分、偏好对、一致性信号、自然语言批评,无需新环境交互。形式上 St≈ et:先采样候选 𝒴t(x)(eq. 12),内在评估器 φt 产出 et=φt(x,𝒴t;κt)(eq. 13),再 θt+1=IMPROVEθ(θ1:t;et)(eq. 14)。

下表(图源:Derived,依据 §5.2 三族整理)按信号形式把三族分开:

信号形式 代表系统 更新方式 失败模式
Rubric feedback 按显式准则打分 / 排序 / 偏好 Constitutional AI (Bai et al., 2022)、Meta-Rewarding (Wu et al., 2025b)、Self-Evolved Reward Learning (Huang et al., 2025a) 训偏好模型 → RL 优化策略 准则模糊 / 判官偏置时奖励表面顺从而非真改进
Consistency feedback 多候选间的一致 / 熵 / 自确信 TTRL (Zuo et al., 2025, 多数投票)、SRT (Shafayat et al., 2025)、EMPO (Zhang et al., 2025h, 熵)、INTUITOR (Zhao et al., 2025c, 自确信) 一致性当弱奖励 / 偏好信号做 RL 模型系统偏置或校准差时,重复采样放大同一错误
Corrective feedback 自然语言批评 + 修订 y* “ReST meets ReAct” (Aksitov et al., 2024)、SELF (Lu et al., 2024b)、RISE (Qu et al., 2024)、Reflect, Retry, Reward (Bensal et al., 2025)、AlphaAllM (Tian et al., 2024) (y,y*) 当偏好、c 当解释监督 模型产出似是而非的批评,或学会满足批评的表面形式

主要风险:评估器与被改进策略紧耦合,会强化共同盲点、奖励顺从模型既有偏置的输出、过拟合表层准则。论文给的 safeguards:生成器与评估器用不同 checkpoint / 模型族、保留人类标注或上下文验证作外部锚、把评估器间分歧当不确定性信号、定期复核打分准则。


5.3 Extrinsic Exploratory Experience

学习信号来自 agent 行动之后发生的事:St≈τt,即跑策略 πθt,Σt 收集的轨迹。对 FM 智能体,轨迹不只是 (s,a,r,s’),还含网页、截图、代码日志、编译错误、工具调用、推理痕迹——这些 FM 可读,故同一份经验可灵活复用到 RL / SFT / 偏好构造 / 失败分析。

下表(图源:Derived,依据该节两模式整理)按"环境是真任务还是学出的代理"分两类:

模式 环境 反馈来源 代表系统 失败模式
Grounded task env 代码解释器 / Web API / 移动 UI / 物理环境 环境响应:状态变化、执行迹、单元测试 程序验证器:Agent-RLVR (Da et al., 2025);学得奖励模型:WebRL (Qi et al., 2025)、UI-Genie (Xiao et al., 2025)、MobileGUI-RL (Shi et al., 2025b);自产任务:Absolute Zero (Zhao et al., 2025a)、ETO (Song et al., 2024c);平台:AgentGym (Xi et al., 2024) 奖励稀疏 / 噪声 / 昂贵(flaky test、覆盖不全)
Simulated proxy env 学出的 world model W(sk+1,rk sk,ak) 预测的下一状态 / 回报 / rollout Web:WebEvolver (Fang et al., 2025b)、WebSynthesis (Gao et al., 2025b)、WebDreamer (Gu et al., 2025);SPA (Chen et al., 2025a);像素空间 WMPO (Zhu et al., 2025b);文本记忆 GLoW (Kim & hwang, 2026, 100–800× 更少真实交互) 幻觉动力学:生成器伪造似真但错的转移,策略学会钻空子

论文强调两类不互斥:早期 controller-world-model 架构 (Schmidhuber, 1990) 就用真实交互训世界模型、再用模拟交互规划。FM 世界模型的优势在于:大规模预训练给环境动力学强先验;生成观测与策略输入同表示空间,无需表征对齐。

跨模式挑战(图源:Author 洞见):语言通道的 reward hacking(FM 能钻 LLM judge 的措辞漏洞而不真解题)、capability regression(窄外部奖励的 RL 会侵蚀预训练广能)、幻觉动力学、以及轨迹长度 vs 上下文窗口的张力(长程经验须压缩 / 摘要才能喂回)。


6 Scaffolding Improvement

scaffold 改进在冻结 θ 的前提下更新 Σ=(p,m,𝒯,g),由执行衍生的信号 𝒮t(任务结果、批评、执行错误)驱动,靠版本史 Σ1:t 支持验证与回滚。通用环(Algorithm 2,图源:Derived,依据论文伪代码重画):

for t = 0 .. T-1:    S_t ← InteractAndEvaluate(A_t, env)     # 轨迹 / 批评 / 成败 / 成本    S_t ← FilterOrWeight(S_t)    if 子类 = Full scaffolding:        Σ_{t+1} ← IMPROVE_Σ(Σ_{1:t}; S_t)               # §6.4    else:        p_{t+1}←p_t; m_{t+1}←m_t; T_{t+1}←T_t            # 默认不变        if 含 Prompt:  p_{t+1}  ← IMPROVE_p(p_t; S_t)     # §6.1        if 含 Memory:  m_{t+1}  ← IMPROVE_m(m_t; S_t)     # §6.2        if 含 Tool:    T_{t+1}  ← IMPROVE_T(T_t; S_t)     # §6.3        Σ_{t+1} ← (p_{t+1}, m_{t+1}, T_{t+1})    A_{t+1} ← (θ, Σ_{t+1})                                # θ 始终冻结return A_T

要点(图源:Author):四类干预组合而非互斥——一次更新可同时改多个组件;full-scaffolding 自然吞并组件级编辑,并额外加 archive 式探索与更强验收测试。从 prompt → memory → tool → full,干预深度递增。


6.1 Prompt

prompt 是智能体的核心行为先验,prompt 优化是 scaffold 改进里最易上手的一类。论文按学习信号 𝒮t 的形式与丰富度分四范式(Figure 7),并由 Table 2 给出系统级对比。

(图源:Original)Figure 7 读法:信号从左到右越来越结构化——scalar score → 文本批评 → 群体选择信号 → 文本梯度;越往后越"少启发式、更自动化"。

Figure 7

Figure 7 的核心信息:四范式不是并列,而是信号信息量的演进——从只给"多好"的标量,到给"哪里错、怎么改"的方向性文本梯度。

Table 2(图源:Original)系统级对比(①②③④ 对应上四范式):

ID Signal St Objective Representative Systems Advantages Limitations
Scalar score argmaxp∈𝒫 f§ RLPrompt, BBT, APE, OPRO, Dspy model-agnostic;易部署;无需内部访问 可解释性低;样本低效;对搜索敏感
Text critique Refine(pt,ct) Self-Refine, Reflexion, Critic, ACE 可解释编辑;定向纠错;反馈可复用 批评有噪声;可能漂移;依赖验证器
Selection signal Evolve(Pt,Fit) Promptbreeder, STOP, GPTSwarm, AutoDAN, Evol-Instruct, GEPA 强探索;保多样性;逃局部最优 计算重;fitness 域相关;群体漂移
Textual gradient pt⊕ g(pt) APO, TextGrad, metaTextGrad, SkillOpt 方向性更新;常样本高效;高度自动化 梯度脆;质量随 LLM 变;保证有限

形式化:scalar 求 p*=argmax f§(eq. 17);qualitative 迭代 pt+1=Refine(pt,ct)(eq. 18);population 做 selection/crossover/mutation(EvoPrompt 首倡把 LLM 当语义进化算子;Promptbreeder 更进一步,自指地连"变异 prompt"本身也一并进化);textual gradient 类比梯度下降 pt+1=pt⊕ g(pt)(eq. 19),TextGrad 把 agent workflow 当计算图做"文本反向传播",MetaTextGrad 更进一步优化"优化器 prompt"——让智能体改进自己的改进过程


6.2 Memory

自改进智能体把记忆当主动演化的 scaffold 而非被动存储:持续评估所存信息的价值 / 相关性 / 强度,据经验流自主重构与扩展。论文把 memory 改进拆成三维——Memory Object(存什么)、Memory Structure(怎么组织)、Memory Processing(创建 / 检索 / 更新 / 遗忘机制)。形式上 mt:=(objectt,structuret),由 𝒮t(检索失败、任务反馈、容量上限)驱动 mt+1=IMPROVEm(mt;𝒮t)(eq. 20),由 CRUD 操作族参数化。

(图源:Original)Figure 8 是 memory 全景图,读法:沿"观察显著性 → 建对象 → 组织结构 → 按需检索 → 规划行动 → 评估得 st → 更新 / 删除"的闭环读:

Figure 8

Figure 8 表明:memory 从"被动缓存"升格为"自治引擎",其价值在于把 object / structure / processing 三维统一进一个信号驱动的生命周期。

范围说明:本节聚焦非参数、外置于 scaffold 的记忆,保持 FM 冻结假设;权重内的"参数记忆"不在此节讨论。


6.2.1 Memory Object

memory object 决定存储效率、表征保真与跨上下文迁移。自改进智能体倾向存处理后高密度抽象而非原始全量轨迹。Table 3(图源:Original)给四类 object 的定性记分卡(■ 多寡表 1=low–5=high 的文献综合判断,非单一基准):

Object type Best-for persistence Fidelity Interpretability Compact Write cost Auditability Most common failure modes
Processed trails lessons / routines / summaries ■■■ ■■■ ■■■ ■■■ ■■■ summary bias / stale heuristics / weak credit assignment
Curated raw content evidence / exact artifacts ■■■ ■■■ ■■■ ■■■ ■■■ context bloat / retrieval noise / privacy leakage surface
Integrated external knowledge shared factual state / grounding ■■■ ■■■ ■■■ ■■■ ■■■ grounding failures / staleness / tool brittleness
Latent embeddings associative carryover / fast recall ■■■ ■■■ ■■■ ■■■ ■■■ drift / contamination / hard-to-debug retrieval / silent corruption

显式 object(processed trails / curated raw / integrated external)可解释、可审计,但需严格策展否则压爆上下文预算;隐式 object(latent tokens / hidden states / KV cache 增强)紧凑、快联想访问,但难检视、易表征漂移。processed trails 利泛化、curated artifacts 利精度、integrated knowledge 利可验证性。


6.2.2 Memory Structure

structure 指组织 schema 与关系拓扑,决定如何索引、链接、检索。下表(图源:Derived,依据 §6.2.2 四种结构整理)对比四种结构范式:

Structure 检索依据 优势 失败模式
Flat 严格时序 写入便宜、保因果叙事、利轨迹回放诊断 检索可扩展性差、recency bias、堆冗余低层轨迹
Hierarchical 多抽象层(高层摘要 / 中层计划 / 底层轨迹) 降噪、支持长程一致 结构脆性:taxonomy 错配任务时碎片化证据、碍跨切检索
Graph 节点 + 语义 / 时序 / 因果边 按联想而非时序检索、多跳证据聚合 维护复杂:持续建图 / 更新边 / 冲突消解,结构易漂移
Vector retrieval 稠密嵌入相似度 自然语言查询下大尺度 episodic 召唤的默认引擎 相似 ≠ 有用:最近邻可能题相关但决策无关,召回噪声偏置后续学习

代表系统举例:Flat—SCM、Self-Notes;Hierarchical—MobileGPT、H-MEM、SHIMI、SALM;Graph—Mem0、Zep、CausalRAG、G-Memory;Vector—Generative Agents、MemoryBank、MIRIX、MrSteve。

Table 4(图源:Original,下图为其行首图标)是论文对 25 个 memory 系统的大表,按 Object(显式 / 隐式)× Structure(flat/hier/graph/vector retr.)× Processing(CRUD)× Governance(Select / Maintain)打点(●primary / •secondary / •absent)。读法:横看一个系统四维的侧重,竖看某机制在哪些系统里是 primary。

Table 4 icon

Table 4 的要点:多数系统显式 object + 单一结构;近作(A-MEM、Mem0)开始用 graph + vector 混合,并把 Select/Maintain 治理维度显式化——这正是 memory 从"存储"走向"自治理"的趋势。


6.2.3 Memory Processing

processing 是作用在 mt 上的信号驱动 CRUD 操作族,由 𝒮t(任务结果、效用、内部批评)参数化决定写什么、怎么取、何时忘。下表(图源:Derived,依据 §6.2.3 整理):

操作 信号驱动的模式 过度 / 不足的代价
Create 语义压缩成结构化元数据;上下文相关的离散决策(add/update/delete/no-op,按检索邻居条件化);受控边界插入 过写→召回噪声膨胀;欠写→牺牲长期能力
Read 混合启发式(语义×recency×importance);结构感知检索(粗到细遍历);检索门控(是否查、查多少);检索驱动适配(取历史轨迹当可执行案例) 取到无关噪声或漏关键细节→后续规划执行直接失败
Update 定期复核衰减;局部刷新(新插入时更新拓扑邻居);迭代蒸馏(重复成功合成紧凑抽象);离线聚合(把贵的压缩移出在线环) 无有效更新→记忆衰减:过时事实留存、结构崩塌、不当合并抹掉细节
Delete 多阶段剪枝(写入时 + 按访问频次 / 相关性定期清);共识式驱逐(分布式投票防误删共享关键知识);分层驱逐(OS 式规则跨层限容) 过剪→丢关键知识;欠剪→淹没在过时噪声、拖慢检索

闭环(呼应 Figure 8):观察显著性 → 建对象 → 组织结构 → 按需读 → 规划行动 → 评估得 st → 更新 / 删除,把 memory 抬成自治引擎。


6.3 Tool

自改进要求从"静态、人工策展工具集"转向 Tool Governance Metacognition:智能体自主推理工具的必要性、效用、可靠性。形式 𝒯t+1=IMPROVE𝒯(𝒯t;𝒮t)(eq. 21),由三维构成——Dynamic Tool RoutingIterative Tool RefinementAutonomous Tool Creation

(图源:Original)Figure 9 读法:三维构成一个"治理"闭环,把工具使用从静态查表变成生成式、自改进的循环:

Figure 9

Figure 9 表明:routing 决定"用哪个"、refinement 决定"修好它"、creation 决定"造新的",三者共同把工具集变成可持续扩张的技能库。

三维各自展开如下(图源:Derived,依据 §6.3.1–6.3.3 整理)。


6.3.1 Dynamic Tool Routing

routing 关心异质环境里如何选、序列化、协调工具。工具池一大,routing 即成自改进主瓶颈:覆盖更广但也更易误路由、复合失败、浪费算力——三者在 coverage / reliability / decision cost 间做权衡。论文按"把什么当 retrieval unit、如何随时间引入反馈"分三范式:

路由范式 检索单元 / 反馈机制 代表系统 失败模式
Retrieval / graph-based 优化检索空间或依赖表示(动态裁剪 / 扩展检索单元 / 把工具转移编码为有向图) 检索空间:MemTool(裁剪)、TAR(原子 API ↔ 整 agent);轨迹即学习信号:VOYAGER、MetaAgent;图结构:ToolNet、OrchDAG、MassTool 大池增覆盖但也增误路由、复合失败、算力浪费
Policy-learning 把工具选择内化为序列决策,从训练信号学调用行为 SFT 启动:AUTOACT、MCP-Flow、Tool-Star、DeepEyesV2;稀疏 / 偏好信号塑形:AGENTFLOW、SPORT、AutoTIR、DeepAgent;生成式统一(检索+选择+调用合一):ToolGen 过拟合训练环境;接口 / 分布漂移时脆;ToolGen 把可靠性全压在学得策略上
Proactive / interactive 把 routing 当交互过程:澄清欠指定意图、局部修复执行失败 澄清 / 主动发现:MCP-Zero、ASKTOACT;局部修复:Tool-Planner(聚成可互换 kit)、ToolACE-R(按难度分配修订算力) 多花交互与算力换可靠性

6.3.2 Iterative Tool Refinement

refinement 把脆程序炼成可靠技能,兼调试 + 把关:不可靠工具若被存用,会经反复检索 + 复合错误腐蚀未来行为,故它控制什么能进结构化技能库。标准环是 VOYAGER 的生成-执行-修订——执行生成代码、把错误迹与环境反馈当 𝒮t 回喂,直到验证器通过。论文按三方向强化该环:

强化方向 机制 代表系统 失败模式
Critique specialization 超越通用自反思,部署专门 critic 诊断中间结果 STELLA(专门 critic agent) 单体模型易漏域特定失败模式
API abstraction 不改原始动作迹,蒸馏 / 抽象出可复用子例程 SkillWeaver(蒸馏成 web 工具)、PyVision(稳定多模态工具) 抽象不当反损跨任务迁移
Interface alignment 不改代码,迭代精修工具文档——多数执行失败源于 NL 指令与工具 affordance 错配 DRAFT(改文档而非代码) 文档与实现不一致时失效

6.3.3 Autonomous Tool Creation

creation 在现有工具不足时合成新可执行函数以扩张能力边界;对自改进智能体,其价值在于把一次性解题转成可复用过程知识。它自带风险:新工具须经验证 / 文档化 / 集成而不破坏 routing,否则工具膨胀反增脆性。论文按三方向推进:

推进方向 机制 代表系统 失败模式
Synthesis triggers 按需发明 vs 好奇 / 课程驱动自探索 按需:ATLASS、PyVision;好奇驱动:FRIDAY、STELLA 无约束探索产出冗余 / 低质工具
Lifecycle automation 抽逻辑、装依赖、闭环调试、产出可调用接口(生成可执行才是真瓶颈) TOOLMAKER(端到端生命周期) 仅生代码而不解依赖 / 调试 → 不可部署
Standardized integration 协议驱动架构,确保工具增长不破坏既有 routing Alita、Code2MCP(经 MCP 把代码库转标准服务);AgentOrchestra(意图解析→验证→注册) 无标准化注册则工具膨胀破坏 routing

闭环(呼应 Figure 9):routing 选、refinement 修、creation 造,三维共同把静态工具集抬成可持续扩张的技能库——这正是 §3.2 里 skill 作为"可复用更新算子"在 tool 基底上的落地。


6.4 Full Scaffolding

full scaffolding 是最深的架构干预:把整个操作逻辑与代码库当可变 substrate,做根本性结构重组。形式 Σt+1=IMPROVEΣ(Σt;𝒮t)(eq. 22),关键是改进过程本身就在当前 scaffold 内实现,使更新自指:Σt+1=ℐΣt(Σt;𝒮t)(eq. 23)——改进者随它改进的系统一同演化。scaffold 编码为可序列化程序,候选程序由"当前 agent-as-improver 跑自身代码"产出(eq. 24),常体现为补丁 Δt,由验证器门控(eq. 25):过则采纳、不过则回退。

下设计矩阵(图源:Author,依据 §6.4 各系统整理)把代表系统放进搜索范式 × 改动对象 × 门控 × 自指性四轴:

系统 搜索范式 改动对象 验证器 / 门控 自指性
AlphaEvolve (Novikov et al., 2025) 进化 科学 / 算法代码 多 evaluator 反馈 部分(改进器在 scaffold 内)
ShinkaEvolve (Lange et al., 2026) 进化(探索-利用均衡父代采样 + 新颖性拒绝 + bandit 选 LLM) 跨任务程序 少样本评估 部分
ADAS (Hu et al., 2025) / EvoFlow 搜索 agentic 系统设计空间 / Pareto 工作流集 整个系统结构 给定评估函数
Self-Taught Optimizer (Zelikman et al., 2024) 递归自改进 自身程序(抽象为 improver) 选最高分版本 强(递归环)
Gödel Agent (Yin et al., 2025c) monkey patching 自修改 整个 agent 设计空间 自感知 / 自修改 / 递归 强(Gödel 机启发)
Darwin Gödel Machine (Zhang et al., 2026d) / HGM (Wang et al., 2026b) open-ended 进化(保档案、长出 agent 树)/ clade 级元生产率 编码 agent 本身 基准 + 后代性能估计

(图源:Original)Figure 10 展示 full-scaffolding 跨迭代的更新:

Figure 10

Figure 10 的要点:每一代都把上一代的整个 scaffold 当起点,由执行迹与评估提信号、用验证器门控补丁,逐步长出更复杂的后代——这是"可证明自改进"在工程上的有界、可验证近似。

另一线:Agent Symbolic Learning (Ou et al., 2025) 把语言 agent 当"符号网络"(权重= prompt / tool / 组合),用自然语言 loss/gradient 模拟反传与梯度下降,联合更新 prompt / tool / pipeline。Live-SWE-Agent (Xia et al., 2025) 是首个能在运行时实时自演化的软件 agent(尤其演化自身工具组件)。


7 Applications

各域共性:用沙箱或受控环境提供反馈同时限制失败成本。Table 5(图源:Original)把六个域看成"自改进环",按 sandbox、学习信号、瓶颈、改进目标、迭代模式、范例系统六列对比:

Domain Sandbox & arena Learning signal Main bottleneck Primary improvement target Iteration mode Exemplars
SWE 仓库 + 编译器 / 单测 / CI,失败通常可逆 确定性二元(过 / 不过)、编译错、静态分析 patch 正确性、工具 / 接口效率 主要 scaffold;部分自编辑代码或微调 逐 issue 在线调试 + 跨 issue 离线聚合 DGM、HGM、Live-SWE-agent、AgentDevel
Web 模拟 / 标准化浏览器,UI 部分可观测 稀疏任务完成、长程失败、部分启发式 动态布局的 grounding、跨站点分布漂移 scaffold(感知-动作 grounding、规划、迭代修复)+ 轨迹策展 模仿式 + 轨迹上在线纠错 WebRL、WebEvolver、SkillWeaver、WebRollback
Game 游戏引擎可可靠重置、self-play 胜负 / 标量奖励、清晰终局 长程规划、不完全信息、多智能体非传递性 模型 / 策略参数 + 搜索 / 规划组件 self-play、迭代策略改进 Richelieu、DipLLM、MARSHAL、SPAG
Sci 工具增强研究环、变成本评估 实验指标、工具输出、批评式修订 评估昂贵且噪、知识碎片化、工具 / 接口异质 scaffold(工具编排、规划、验证)+ 领域专精 提议-运行-批评-修订、在线离线混合 The AI Scientist、AI-Scientist-v2、SciAgents、AI co-scientist
Emb 仿真器 + 少量真实 rollout、安全约束 奖励 / 成功信号,真实数据贵 数据采集与安全、sim-to-real、动力学信用分配 策略 / 模型参数(数据飞轮)+ 课程 / 安全 scaffold 采集-重训-重部署 RoboCat、SOAR、SInViG、REMAC、SEEA-R1
PC (general computer control) 虚拟桌面、标准化 OS 任务、脆 UI 任务完成与状态检查、长程目标 应用多样性、状态追踪、未见 app 的鲁棒探索 scaffold(分层规划、检索、课程)+ 动作迹训练 经验复用 + 课程学习、迭代迹采集 OS-Copilot、UI-Genie、GUI-Reflection、SEA

(图源:Original)Figure 11 是六域示意:

Figure 11

Figure 11 的要点:六域各自的环境(其 fidelity / scalability / cost)塑造了该域主导的瓶颈、改进目标与迭代模式(论文 §7 原意,见 Table 5)。至于每域具体走 FM 改进还是 scaffold 改进,论文并未给统一规则——例如 SWE 虽反馈密集,Table 5 却标为 “mainly scaffolding”,可见可验证性高并不直接等于走参数改进。

各域的开放挑战(图源:Author 洞见,逐域一句):SWE—基准搜索 / 验证器过拟合,需基准变异 + 把 scaffold 发现蒸馏进 base model 仅当其能跨验证器迁移;Web—非平稳 + 弱可观测,需漂移感知评估 + sandbox 隔离不可逆动作;Game—self-play 造"脆性胜任"、非传递性使进展非单调,需群体评估;Sci—novelty / 正确性 / 可复现难自验,弱代理易被当真进步,需可复现中心评估 + 证据追踪;Emb—sim-to-real、传感器漂移、不可逆动作,需安全感知改进 + 跨具身评估;PC—安全(删文件 / 输密码 / 金融操作)+ 状态依赖验证 + 跨 app 迁移,需状态验证 + 保守不可逆策略。


8 Evaluation

自改进智能体的评估必须把"改进"当成随时间展开的过程,并把真能力增益与改进管线造的伪迹分开。先把整体能力形式化(eq. 26):在迭代 t、预算 bt≤ Bmax 下,能力 mt=𝔼x∼𝒟eval,τ∼𝒜t(x)[Φ(x,τ)],差别只在评估器 Φ 的实例化——Φmetric(确定性可执行)还是 Φjudge(参数化、条件化于 rubric κ 与辅助判官 θjudge)。

评估分类(图源:Derived)├─ 按 Φ 分:metric-based (§8.1.1)  vs  judge-based (§8.1.2)└─ 按基准分:mechanism benchmarks (隔离更新通道)  vs  domain benchmarks (真实任务反馈)

(图源:Original)Figure 12 是 paper–benchmark 关联矩阵:行=基准(按 FM-level / scaffold-level 分组),列=代表方法(颜色标改进机制),实心格表示该方法用了该基准,* 表基准族。读法:看一行知道某基准被哪些机制的方法检验,看一列知道某方法在哪些基准上验证:

Figure 12

Figure 12 的要点:FM-level 基准偏静态、model-centric,scaffold-level 基准偏交互、agent-centric;多数方法只覆盖少数基准族,跨机制的系统级比较仍稀缺。

该报什么(eval-setup,图源:Derived,依据 §8.1 整理)

报告项 要求
benchmarks 明确用了哪些基准族(mechanism / domain),held-out split 𝒟eval 不与优化数据重叠
metrics mt 轨迹而非单点峰值;附回归率、尾部风险、安全违规
protocol 固定预算 Bmax、checkpoint / 验收 / early-stop 规则;多 seed 报期望与方差;判官预算与执行预算隔离
transfer / cost held-out 或时移任务的迁移能力;成本分解(算力 / token / 时间 / 人工介入量——人工介入须显式量化,因其动摇"自"改进)

metric-based 四要点:固定预算下报整条轨迹(非只报峰值)、测改进信号之外的迁移(hidden / 时移评估)、算清资源效率与监督量长期追踪稳定性 / 回归 / 安全。judge-based 两要点:显式指定判官与判官预算(模型版本、prompt、rubric、暴露给判官的证据)、防过优化判官(最终报告用独立判官配置 θ’judge / 正交 rubric κ’,并用多样本方差、多判官聚合、对可验证子集校准支撑可靠性)。


9 Discussion

自改进智能体是闭环动力学系统;研究焦点不再是静态 agent,而是驱动其演化的机制。本节给出三条系统设计含义,每条都是一张问题卡(图源:Author)。

① 从快探索到慢固化

问题:改 Σ(prompt / memory / tool)是快、可逆的低开销环;改 θ 是慢、稳但模糊信用分配的环——坏 prompt 易回退,吸进参数的回归却极难追溯。 症状:参数固化是有损压缩,把复杂轨迹蒸进权重会偏向 average-case 执行,丢掉探索期发现的稀有但关键的错误恢复策略对策:反馈噪时先困在 scaffold 内、用严格执行测试验证;参数固化(蒸馏 / 微调)推迟到新行为证明稳定后;而一旦改了 θ,先前的安全边界即失效,须重做对抗测试确认边缘韧性保住。

② Critic 作为受管基础设施

问题:闭环里的 critic 是攻击面而非被动基准——agent 会优化它、从而有动机钻捷径,能力天花板常被 critic 的抗钻性卡住。 症状:若 agent 同时"提议更新"与"接受更新",会塌缩成自证环。 对策:把 critic 与生成器解耦;critic 自身可进化(如生成更严测试),但其更新不能由它评估的 agent 无约束控制——应限为单调变更(如纯加性测试生成)并由人工审计链门控。

③ 用分层门控保安全

问题:自改进使对齐对象非平稳;full-scaffolding 改进最危险——一次性 prompt 注入这类瞬时漏洞,可经投毒记忆 / 劫持工具逻辑被提交成持久架构漏洞症状:弱系统如何可靠推理更强的后继系统(Vingean reflection)是递归自改进的核心难题。 对策:把自改进 agent 当在受保护运行时里跑的不可信代码;安全不能只靠 FM 初始对齐,须分层门控——任何结构更新提交到 Σt+1 或 θt+1 前,补丁须过 verifier 门控(功能正确性、工具权限边界、对随机状态扰动的鲁棒性),改进只允许在显式定义并持续审计的安全边界内。


Theme A: Algorithmic Paradigms for Lifelong Adaptation

未来方向部分把前路归为两大瓶颈、六个方向。Theme A 三张问题卡(图源:Author):

方向 1 · Test-Time Continual Adaptation

问题:训练 / 部署的分离常损害真实鲁棒性。 对策与张力:要可扩展的测试期适应机制(动态改检索 / 路由 / 记忆策略);但on-the-fly 打补丁会悄然侵蚀系统长期全局性能——须小心管理局部更新。

方向 2 · Active Exploration and Curiosity

问题:智能体应主动寻高价值经验而非被动接受人工任务。 对策与张力:在稀疏反馈域,给高预测误差或 verifier 分歧的交互赋内在价值;但要避免滑入退化、自欺的循环

方向 3 · Parametric Distillation and Joint Optimization

问题:scaffold 级改进擅发现复杂多步恢复策略(迭代调试、自反思)但上下文 / 延迟成本高昂。 对策与张力:把这些"System 2"算法结构自动化蒸馏进更小模型的"System 1"参数权重;另一方向是联合优化(θ 与 Σ 在同一环里共更新)——这要求解一个棘手的信用分配问题:失败时改进算子要自决"该改 prompt、重写工具封装、还是算梯度更新"。


Theme B: Complexity, Constraints, and Open-World Robustness

Theme B 三张问题卡(图源:Author):

方向 4 · Resource-Constrained Improvement Dynamics

问题:open-ended 场景里现法常导致无产出探索,耗尽预算与 token 而不可靠推进策略。 对策与张力:把评估从静态峰值改为改进效率;把自改进重述为资源优化——动态分配上下文、用轻量不变量检查给贵的神经评估加门、惩罚浪费的迭代。

方向 5 · Multi-Agent Cooperative Co-Evolution

问题:单智能体探索在巨搜索空间里极低效。 对策与张力:让专门化 agent 通过共享可复用产物(生成的回归测试、成功的代码补丁、改进的工具封装)协同进化;需要安全、版本控制的协议(产物仓库),让 agent 继承集体知识而无单点故障或多智能体奖励机制的级联攻击。

方向 6 · Surviving Open-World Distribution Drift

问题:自改进的鲁棒性取决于驱动它的环境,而现平台重度依赖静态仓库 / 不变模拟器。 对策与张力:真实部署要应对不断变的 API、重设计的 UI、对抗性用户输入;未来基建应弃静态 leaderboard、用非平稳模拟器让接口持续漂移;基底层面,neural-computer 构想还提示用学得的运行时状态替换固定外部执行接口,统一计算 / 记忆 / I/O——超越" merely 操作计算机的 agent"、走向自适应神经运行时。


10 Conclusion

自改进机器的愿景是 AI 的恒久主题。本综述用统一系统视角把范式转变收束为两条互补路径:foundation-model improvement(参数化、较慢的环,由内在生成式示范 / 内在评估反馈 / 外在探索经验驱动)与 scaffolding improvement(非参数、较快的环,更新 prompt / memory / tool / full-scaffold)。当 agent 走向自指架构——不仅改自身行为,也改自身推理结构——评估须从静态基准转为持续、集成的过程;本综述希望提供一套公共语言,助研究者构建可度量、可归因、安全有界、能持续扩展机器自治边界的自改进系统。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐