AI Agent 框架分类与代表对比

Agent 框架很少「全能」——多数只在某一层做强。选型先定类别,再比同层框架。

总览:九大类各自解决什么

大类 核心问题 代表框架 / 产品 典型产出
1. 流程编排 谁下一步、怎么分支/恢复 LangGraph、CrewAI、LlamaIndex Workflows、OpenAI Agents SDK、Semantic Kernel 可控工作流
2. 多 Agent 协作 怎么分工、交接、互评 AutoGen(AG2)、CrewAI、LangGraph(图协作) 团队式任务完成
3. 检索 / RAG / 搜索 搜什么、怎么搜得准 LlamaIndex、QAgent、SmartSearch、composer-agentic_rag、SIARE、FORT* 更高质量召回与答问
4. 工具与协议 怎么接外部系统 MCP、各家 Function Calling / Tools SDK 可扩展工具面
5. 记忆与状态 记住什么、状态怎么持久 LangGraph Checkpoint、Mem0、Zep、自建 Redis/Postgres 跨轮/跨会话连续性
6. 训练与数据合成 怎么把 Agent「练强」 FORT、各类 RL Search Agent 训练链路 更强搜索/规划能力
7. 观测与评测 跑得怎样、为何失败 LangSmith、Langfuse、Phoenix、RAGAS Trace、成本、质量回归
8. 耐久执行基建 长任务如何可重试可恢复 Temporal(+ 上述编排) 小时~天级可靠执行
9. 垂直场景 Agent 特定业态开箱能力 Cursor/代码 Agent、浏览器 Agent、客服 Agent 场景化交付

*FORT 偏「为搜索 Agent 造训练数据」,归入第 6 类更贴切;若强调深度搜索数据质量,可同时挂在第 3 类供给侧。


1. 流程编排类:怎么「走完这件事」

框架 控流抽象 状态/恢复 上手成本 突出特点 更适合
LangGraph 图(节点+条件边) Checkpoint、HITL、回放强 中~高 显式状态、生产控流最强之一 复杂分支、审批、可审计
CrewAI 角色+任务流水线 基础;长跑常需自补 业务同学易懂的「组班」模型 顺序/层级业务协作
LlamaIndex Workflows 事件驱动 Step 有工作流状态 与 RAG/数据管线天然贴合 数据密、步骤清晰的流水线
OpenAI Agents SDK ReAct 环 + Handoff 轻量 概念少、贴近 OpenAI 中等复杂度、厂商清晰
Semantic Kernel Planner / Process / Plugin 偏平台能力 C#/Python/Java 一致体验 Azure/.NET 企业栈

同层怎么选一句话
要硬控流与可恢复 → LangGraph;要角色叙事快跑通 → CrewAI;要 RAG 步骤链 → LlamaIndex Workflows;要轻量交接 → OpenAI Agents SDK;要微软多语言中台 → Semantic Kernel。


2. 多 Agent 协作类:怎么「多人一起干」

框架 协作模式 沟通方式 可控性 突出特点 更适合
AutoGen (AG2) 对话式协作 多轮发言+选人 中(偏「软」路由) 批评–改进循环强 研究、写代码、材料互审
CrewAI 顺序 / 层级委派 任务交接 中高 Role–Goal–Task 清晰 像项目组一样的业务流
LangGraph 图上多节点 Agent 共享状态+边路由 协作也能做到确定路由 要协作又要合规/分支

协作类常 叠在编排类之上:CrewAI/AutoGen 是「协作体验」;LangGraph 是「可把协作画成确定图」。


3. 检索 / RAG / 搜索类:怎么「搜得准」

框架 定位 优化手段 是否训练 突出特点 更适合
LlamaIndex RAG 基建 连接器/索引/检索/评估 数据与索引基础设施 先建库、再建 Agent
QAgent 模块化搜索 Agent 多步规划–搜索–反思 两阶段 RL 专攻「怎么搜」 已有检索底座,要加强搜索智能体
SmartSearch 查询优化 过程奖励+课程学习 三阶段课程 盯紧中间 query 质量 败因在查询改写
composer-agentic_rag 组件化 Agentic RAG 可插拔策略+反思 ReAct 否(编排) 配置拼装 HyDE/重排/Self-RAG 等 工程上快速对比策略组合
SIARE 自我进化 RAG 质量–多样性进化 进化算法 自动变异提示/策略/拓扑 愿付评估算力换自动搜参
adaptive-intelligence 检索策略路由 RL 选策略 RL 按 query 类型选搜法 查询形态很杂(待核实成熟度)
FORT(供给侧) 深度搜索数据合成 抗捷径数据生成 供 SFT 逼模型真多步搜 训练数据太「水」、模型偷懒

同层怎么选一句话
缺地基 → LlamaIndex;缺会搜的 Agent → QAgent;query 差 → SmartSearch;想拼装策略 → composer;想自动进化配置 → SIARE;要好训练集 → FORT。


4. 工具与协议类:怎么「接到真实世界」

方案 抽象层级 跨产品复用 突出特点 更适合
MCP 工具/资源协议 高(多客户端可复用同一 Server) 工具标准化、生态快 多 Agent/多 IDE 共用工具面
OpenAI / 各厂 Function Calling 模型原生工具调用 绑定厂商 schema 路径最短 单厂商、快速闭环
各框架 Tools 封装(LangChain/SK/…) 框架内 Tool 对象 与编排深度集成 已选某编排框架时

这类通常 不是替代编排,而是编排节点里的能力插头。


5. 记忆与状态类:怎么「记住并续上」

方案 记忆形态 突出特点 更适合
LangGraph Checkpoint 工作流状态快照 与控流一体,可 Resume/回放 任务状态、审批断点
Mem0 / Zep 等 长期用户/实体记忆 跨会话画像与事实沉淀 个性化助手、CRM 式记忆
Redis + Postgres/pgvector 会话缓存 + 长期向量/结构化 可控、易合规、易审计 企业自建、要数据主权

选型要点:工作流状态(跑到第几步)和 认知记忆(用户偏好/事实)别混成一个桶。


6. 训练与数据合成类:怎么「变强」而不是「多写 if」

框架/方向 输入→输出 方法 突出特点 更适合
FORT 合成难例数据 → SFT 抗捷径理论约束 专治虚假多步 训练深度搜索 Agent
QAgent / SmartSearch 训练链路 交互轨迹 → RL/课程学习 RL、过程监督 直接优化搜索行为 有算力与评测集的团队
通用 SFT/RLHF/RLAIF 管线 轨迹与偏好数据 → 策略模型 经典对齐训练 可服务任意 Agent 技能 平台型模型团队

这类偏 研究/训练平台;线上推理仍要落到编排 + 检索 + 工具。


7. 观测与评测类:怎么「看得见、收得住」

工具 重心 突出特点 更适合
LangSmith Trace + 数据集评测 与 LangChain/LangGraph 最顺 已在 Lang 生态
Langfuse 开源可自托管 Trace/评分 数据留在自己侧 要私有化、可控成本
Phoenix 追踪 + 检索/Embedding 分析 偏排查质量与向量问题 RAG 质量深挖
RAGAS 等 离线 RAG 指标 忠实度/相关性等套件 回归与发布门槛

生产经验:编排和检索定了之后,观测几乎是必选项,否则无法迭代。


8. 耐久执行类:怎么「跑很久还不翻车」

方案 角色 突出特点 更适合
Temporal (+ Agent 编排) 工作流引擎 长事务、重试、可恢复;Activity 需幂等 跨分钟~天、副作用敏感
仅用 LangGraph Checkpoint Agent 运行时持久化 够用中长任务与 HITL 多数交互式业务流
队列自研(Celery/MQ) 异步投递 灵活但要自补编排语义 已有成熟任务中间件团队

9. 垂直场景类(简表)

方向 代表形态 特点 注意
代码 Agent Cursor、开源 coding agent 仓库感知、工具链强 通用编排替代不了深层 IDE 集成
浏览器 / 桌面 RPA Agent 浏览器操作类框架 视觉/DOM 操作 稳定性与权限风险高
客服 / 工单 Agent 业务套件或自研 流程+知识库绑定紧 常=编排+RAG+HITL 组合拳

跨类对照:一张表看「你该先买哪一层」

你的主痛点 优先大类 首选倾向 可叠加
分支乱、无法审批/恢复 1 编排 LangGraph 7 观测、8 Temporal
多人协作像项目组 2 协作 CrewAI / AutoGen 1 编排加固
答不准、召回差 3 检索 LlamaIndex → 再选 QAgent/SmartSearch/composer 7 评测
接不到内部系统 4 工具 MCP + 编排 Tools
下一会话就忘 5 记忆 Checkpoint + 长期记忆方案
模型不会真多步搜 6 训练 FORT / RL 搜索训练 3 检索
线上不知贵在哪、错在哪 7 观测 Langfuse / LangSmith 全类
任务要跑很久 8 耐久 Temporal + 编排 幂等治理
只要某一业态开箱 9 垂直 对应产品/套件 仍建议保留观测

推荐落地组合(三条样板)

A. 企业知识助手(Java 中台常见)
Spring Gateway + LangGraph/编排服务 + LlamaIndex/RAG + MCP 工具 + Langfuse +(必要时)HITL

B. 内容/研究型多 Agent
CrewAI 或 AutoGen(协作)+ LlamaIndex(材料检索)+ 观测;流程变硬后再迁部分到 LangGraph

C. 深度搜索能力建设(偏研究)
FORT 造数 → QAgent/SmartSearch 训练 → 线上推理挂进 LangGraph 节点


和「九大类」的对应关系(速记)

9 垂直应用
 ↑
1 编排  ↔  2 多 Agent 协作
 ↑
3 检索/RAG   4 工具/MCP   5 记忆
 ↑
6 训练/数据(让 3/1 变强)
 ↑
7 观测/评测(横切)
8 耐久执行(横切,托住长任务)

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐