论文名称:AGENT WORKFLOW MEMORY
代码地址:https://arxiv.org/pdf/2409.07429

当你打开旅游网站预订机票时,会下意识地遵循一套“流程”:先输入出发地和目的地,选择日期,筛选航班,填写乘客信息,最后付款——这套重复使用的步骤,本质上是人类从经验中提炼的“工作流”(Workflow)。正是这些可复用的流程,让我们能高效解决复杂问题。

但对于当前基于语言模型(LM)的AI智能体来说,这类“长周期任务”却常常是噩梦。无论是网页导航、APP操作还是复杂决策,智能体往往在多步骤、高动态的环境中迷失方向,因为它们缺乏人类那种“从经验中提炼流程、用流程指导行动”的能力。

为了填补这一 gap,来自卡内基梅隆大学和麻省理工学院的研究者提出了Agent Workflow Memory(AWM)——一种让AI智能体像人类一样学习、存储和复用工作流的方法。在覆盖1000+任务、200+领域的网页导航基准测试中,AWM将任务成功率相对提升了24.6%(Mind2Web)和51.1%(WebArena),同时大幅减少了完成任务的步骤。

今天,我们就来深入拆解这一突破性方法,看看它如何让AI智能体真正学会“积累经验”。

一、AI智能体的“阿喀琉斯之踵”:为什么长周期任务如此棘手?

基于语言模型的智能体正在快速进化,从网页导航到手机APP操作,它们已能处理不少数字任务。但在需要多步骤、复杂轨迹的“长周期任务”中,现有方法却屡屡碰壁。

问题的核心在于智能体缺乏“经验沉淀”机制

  • 现有方法大多依赖固定示例(通过训练或上下文学习注入),只能处理与示例相似的任务,一旦环境或任务稍有变化就会失效。比如,学会了“在亚马逊买猫粮”的智能体,可能无法完成“在京东买狗粮”的任务,因为它没学会抽象出“搜索商品→筛选→下单”的通用流程。
  • 智能体解决每个任务时都是“从零开始”,不会从过去的成功或失败中提炼规律。人类能记住“先登录再付款”,而智能体可能每次都尝试“未登录直接付款”,浪费大量步骤。

正如论文中指出的:“当前智能体无法掌握拆解复杂任务的关键——从相似任务和环境中提取可复用的工作流。”

二、AWM:让智能体拥有“工作流记忆”的核心原理

AWM的灵感源自人类的认知模式:从经验中诱导(Induce)可复用的工作流,再用这些工作流指导未来行动。它的核心是构建一个动态更新的“工作流记忆库”,让智能体在解决任务时不再孤立决策,而是能调用过去沉淀的“经验流程”。

2.1 什么是“工作流”?

在AWM中,工作流被定义为“带有目标描述的可复用步骤序列”,包含两个核心部分:

  • 描述(Description):用自然语言总结工作流的目标,比如“通过名称查找地点”“获取某地的邮政编码”。
  • 轨迹(Trajectory):完成目标的具体步骤,包括环境观察、推理过程和执行的动作。例如,“查找地点”的轨迹可能是:“在搜索框输入名称→点击搜索按钮→从结果中选择目标→确认位置信息”。

这种结构让工作流既能被智能体理解(通过自然语言描述),又能直接指导行动(通过具体步骤)。

2.2 AWM的“诱导-应用”循环

AWM的运行机制可分为三个关键步骤,形成一个持续迭代的闭环:
在这里插入图片描述

步骤1:从经验中诱导工作流

智能体通过“经验”(已完成的任务轨迹)提炼工作流。这些经验可以来自训练数据(离线场景),也可以来自实时解决的测试任务(在线场景)。

诱导过程的核心是抽象与泛化

  • 从具体任务中提取共性子流程。例如,从“买猫粮”“买狗粮”“买猫砂”等任务中,提炼出“在电商平台搜索商品”的通用工作流。
  • 替换示例特定信息为变量。比如,将“搜索‘猫粮’”抽象为“搜索‘{商品名称}’”,让工作流能适配不同场景。

论文中采用了两种诱导方式:

  • LM-based诱导:通过提示语言模型(如GPT-4)从经验中提取子流程,强调“细粒度”和“去示例化”。
  • 规则-based诱导:通过固定规则(如提取重复的动作序列、过滤无效步骤)生成工作流。

实验显示,LM-based诱导更高效,能产生更细粒度的工作流,减少冗余步骤。

步骤2:构建动态工作流记忆库

诱导出的工作流会被存入“工作流记忆库”,与智能体的原始记忆(如内置动作说明)结合,形成增强记忆(Mₐ)。这个记忆库不是静态的:

  • 离线场景中,智能体先从训练数据中诱导所有工作流,再用固定的记忆库解决测试任务。
  • 在线场景中,智能体边解决测试任务边更新记忆库:每完成一个任务,就从中诱导新工作流并加入记忆,让后续任务能直接复用。

这种动态性让工作流记忆库能随经验增长而丰富,形成“滚雪球效应”——简单工作流(如“查找地点”)会成为更复杂工作流(如“获取邮政编码”)的子目标,逐步构建出层级化的流程体系。

步骤3:用工作流指导任务解决

当智能体面对新任务时,会先从记忆库中匹配相关工作流,再结合当前环境生成动作。例如,接到“查询纽约邮政编码”的任务时,智能体会调用“通过名称查找地点”的工作流定位纽约,再调用“获取邮政编码”的工作流提取信息,而不是重新设计每一步动作。

2.3 离线与在线:AWM的两种灵活模式

AWM的一大优势是适配不同场景,无论是有大量训练数据的离线场景,还是只有实时任务的在线场景,都能有效工作:

  • 离线AWM:先从训练数据中诱导工作流,再将整个记忆库注入智能体。适用于有高质量标注数据的场景,例如用历史网页导航数据预先构建“电商购物”“航班预订”等领域的工作流。

  • 在线AWM:无需训练数据,智能体在解决测试任务时“边做边学”。每完成一个任务,就从中诱导新工作流并加入记忆库,让后续任务能直接复用。这种模式特别适合数据稀缺或任务分布多变的场景(如新兴网站、动态更新的平台)。

在这里插入图片描述

三、实验验证:AWM如何碾压基线方法?

研究者在两个权威网页导航基准上测试了AWM的性能:

  • Mind2Web:涵盖200+网站、1000+任务,涉及购物、旅游、社交媒体等领域,强调跨场景泛化能力。
  • WebArena:包含812个任务,覆盖电商、社交论坛、代码仓库、内容管理系统等5类网站,支持严格的功能正确性评估。

实验结果显示,AWM在成功率、效率和泛化能力上均大幅超越现有方法。

3.1 在WebArena上的突破:超越人类设计的工作流

WebArena的任务需要智能体完成复杂操作(如在Reddit发帖、在GitLab查看代码贡献者、在地图上计算路线等)。AWM在在线模式下(无训练数据,边测试边学)的表现如下:
在这里插入图片描述

  • 整体成功率提升51.1%:AWM的总成功率达到35.5%,远超基线方法BrowserGym(15.0%),甚至超过了使用14个人类专家设计工作流的SteP方法(33.0%)。
  • 效率更高:AWM平均用5.9步完成任务,比BrowserGym(7.9步)少2步,比需要反复评估修正的AutoEval(46.7步)效率提升近90%。
  • 全网站覆盖:在5类网站上,AWM的成功率均显著提升,其中地图类任务提升最明显(从25.5%→43.3%),证明其跨领域适用性。

更值得关注的是,AWM的性能会随解决任务数量增加而持续提升。如图1所示,在WebArena的地图任务中,随着示例增多,AWM与基线的差距从0扩大到22.5个百分点,形成“越用越好用”的效果——这正是人类“经验积累”的AI体现。

3.2 在Mind2Web上的泛化:跨任务、跨网站、跨领域的稳健性

Mind2Web更强调智能体在未知场景的表现。AWM在离线和在线模式下均展现出强大的泛化能力:

  • 离线模式:从训练数据中诱导工作流后,AWM在跨任务测试中,步骤成功率达到45.1%,比基线方法Synapse(30.6%)提升47.4%,元素选择准确率(50.6%)比MindAct(41.6%)高9个百分点。
    在这里插入图片描述
  • 在线模式:在无训练数据的情况下,AWM在跨网站(如从亚马逊到百思买)和跨领域(如从购物网站到社交论坛)测试中,成功率比基线高8.9-14.0个百分点,且任务分布差距越大,AWM的优势越明显
    在这里插入图片描述

为什么AWM泛化能力更强?关键在于工作流的“抽象性”:它存储的是“搜索商品”而非“搜索猫粮”,是“点击确认按钮”而非“点击亚马逊的确认按钮”,这种去具体化的表示让工作流能适配新环境。

3.3 工作流的“层级进化”:从简单到复杂的能力积累

AWM的核心优势之一是能基于已有工作流构建更复杂的流程,形成类似人类“技能树”的层级结构。

论文中给出了一个典型案例:

  1. 智能体先从几个任务中诱导出“通过名称查找地点”的基础工作流(步骤:输入名称→搜索→选择结果)。
  2. 当遇到“获取某地邮政编码”的新任务时,智能体调用“查找地点”作为子流程,再新增“从地点信息中提取邮政编码”的步骤,形成更复杂的工作流。
  3. 后续若遇到“计算两地距离”的任务,又能以“查找地点”为基础,添加“输入起点和终点→选择交通方式→计算距离”的步骤。

这种“积木式”构建让智能体的能力随经验增长而指数级提升,而基线方法由于缺乏这种层级积累,性能很快陷入停滞。

四、深入探究:工作流的“最佳形态”是什么?

为了让工作流更有效,研究者还探索了工作流的表示形式、环境交互方式等细节,得出了一些有趣结论:

4.1 文本vs代码:哪种格式更适合工作流?

工作流可以用自然语言描述(如“点击搜索框,输入名称”),也可以用代码式动作(如“click(‘search-box’); type(‘{name}’)”)。实验显示:

  • 两种格式性能接近:文本格式在元素选择准确率上略高(51.2% vs 50.6%),代码格式在任务成功率上更优(4.8% vs 3.6%)。
  • 核心是“可理解性”:只要能被智能体解析并调用,无论是文本还是代码,都能有效增强记忆。

4.2 环境信息:自然语言描述比HTML更有用

工作流中需要包含环境状态(如网页信息),但如何表示这些状态更有效?实验对比了三种方式:

  • 自然语言描述(如“当前页面显示搜索结果列表”)。
  • 网页HTML代码(过滤后的相关元素)。
  • 两者结合。

结果显示,自然语言描述效果最好:步骤成功率为34.6%,而纯HTML格式为33.8%,两者结合反而下降到32.9%。原因可能是HTML包含过多冗余信息,反而干扰智能体对关键状态的判断。

4.3 工作流的“质量指标”:少而精、高覆盖、低重叠

研究者提出了评估工作流质量的四大指标,为设计更有效的记忆库提供了参考:

  • 数量:每个场景平均7-8个工作流即可,过多会增加记忆负担。
  • 覆盖率:工作流应覆盖任务中40%以上的步骤(Mind2Web数据),证明其通用性。
  • 功能重叠:不同工作流的重叠步骤应尽可能少(WebArena中仅0.08),避免冗余。
  • 利用率:90%以上的测试任务会调用工作流(WebArena为94%),说明工作流与任务的相关性高。

五、AWM的局限与未来:让智能体更“灵活”

尽管AWM表现出色,但它仍面临一些挑战,这些挑战也指明了未来的研究方向:

5.1 动态环境的“适应性难题”

工作流是预设的步骤序列,但真实环境往往是动态变化的。例如,在预订航班时,输入“纽约”后,网站可能弹出“JFK机场”“纽瓦克机场”等选项,而预设工作流可能无法灵活选择——它只能按固定步骤执行,忽略了中间状态的变化。

解决方案可能包括:

  • 让工作流具备“条件判断”能力(如“若出现机场选项,则选择最近的一个”)。
  • 允许智能体在执行中实时调整工作流,结合当前环境修改步骤。

5.2 工作流的“冲突消解”

当多个工作流都与当前任务相关时,智能体需要判断调用哪一个。例如,“查找商品”和“筛选商品”都可能适用于购物任务,如何选择最优工作流?

未来可引入“工作流优先级”机制,基于历史成功率、任务相似度等指标动态排序,让智能体更高效地调用记忆库。

5.3 从“网页导航”到更广泛的场景

AWM目前主要用于网页导航,但它的核心思想——“积累可复用工作流”——可扩展到更多领域:

  • 移动应用操作:如“在微信中转账”“在抖音上发布视频”的工作流。
  • 实体机器人控制:如“开门→进入房间→拿起物品”的物理世界工作流。
  • 办公自动化:如“生成报表→发送邮件→同步到云盘”的跨软件工作流。

六、总结:让AI智能体真正“学会学习”

AWM的突破不仅在于性能提升,更在于它为AI智能体提供了一种“学习如何学习”的机制——这是从“工具”到“智能”的关键一步。

人类的智慧不仅在于解决单个问题,更在于从问题中提炼规律,让经验成为未来的“垫脚石”。AWM正是模仿了这一过程:它让智能体不再局限于孤立的任务,而是能通过工作流记忆库,不断沉淀知识、复用经验、进化能力。

随着技术的发展,我们有理由相信,未来的AI智能体将像人类一样,在解决任务的过程中持续“成长”——它们会记得过去的成功与失败,会优化自己的“经验库”,最终在复杂世界中变得越来越灵活、越来越可靠。

(本文基于论文《Agent Workflow Memory》撰写,论文作者为Zora Zhiruo Wang等,代码已开源:https://github.com/zorazrw/agent-workflow-memory)

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐