AI Agent 框架分类与代表对比
AI Agent 框架分类与代表对比
Agent 框架很少「全能」——多数只在某一层做强。选型先定类别,再比同层框架。
总览:九大类各自解决什么
| 大类 | 核心问题 | 代表框架 / 产品 | 典型产出 |
|---|---|---|---|
| 1. 流程编排 | 谁下一步、怎么分支/恢复 | LangGraph、CrewAI、LlamaIndex Workflows、OpenAI Agents SDK、Semantic Kernel | 可控工作流 |
| 2. 多 Agent 协作 | 怎么分工、交接、互评 | AutoGen(AG2)、CrewAI、LangGraph(图协作) | 团队式任务完成 |
| 3. 检索 / RAG / 搜索 | 搜什么、怎么搜得准 | LlamaIndex、QAgent、SmartSearch、composer-agentic_rag、SIARE、FORT* | 更高质量召回与答问 |
| 4. 工具与协议 | 怎么接外部系统 | MCP、各家 Function Calling / Tools SDK | 可扩展工具面 |
| 5. 记忆与状态 | 记住什么、状态怎么持久 | LangGraph Checkpoint、Mem0、Zep、自建 Redis/Postgres | 跨轮/跨会话连续性 |
| 6. 训练与数据合成 | 怎么把 Agent「练强」 | FORT、各类 RL Search Agent 训练链路 | 更强搜索/规划能力 |
| 7. 观测与评测 | 跑得怎样、为何失败 | LangSmith、Langfuse、Phoenix、RAGAS | Trace、成本、质量回归 |
| 8. 耐久执行基建 | 长任务如何可重试可恢复 | Temporal(+ 上述编排) | 小时~天级可靠执行 |
| 9. 垂直场景 Agent | 特定业态开箱能力 | Cursor/代码 Agent、浏览器 Agent、客服 Agent | 场景化交付 |
*FORT 偏「为搜索 Agent 造训练数据」,归入第 6 类更贴切;若强调深度搜索数据质量,可同时挂在第 3 类供给侧。
1. 流程编排类:怎么「走完这件事」
| 框架 | 控流抽象 | 状态/恢复 | 上手成本 | 突出特点 | 更适合 |
|---|---|---|---|---|---|
| LangGraph | 图(节点+条件边) | Checkpoint、HITL、回放强 | 中~高 | 显式状态、生产控流最强之一 | 复杂分支、审批、可审计 |
| CrewAI | 角色+任务流水线 | 基础;长跑常需自补 | 低 | 业务同学易懂的「组班」模型 | 顺序/层级业务协作 |
| LlamaIndex Workflows | 事件驱动 Step | 有工作流状态 | 中 | 与 RAG/数据管线天然贴合 | 数据密、步骤清晰的流水线 |
| OpenAI Agents SDK | ReAct 环 + Handoff | 轻量 | 低 | 概念少、贴近 OpenAI | 中等复杂度、厂商清晰 |
| Semantic Kernel | Planner / Process / Plugin | 偏平台能力 | 中 | C#/Python/Java 一致体验 | Azure/.NET 企业栈 |
同层怎么选一句话
要硬控流与可恢复 → LangGraph;要角色叙事快跑通 → CrewAI;要 RAG 步骤链 → LlamaIndex Workflows;要轻量交接 → OpenAI Agents SDK;要微软多语言中台 → Semantic Kernel。
2. 多 Agent 协作类:怎么「多人一起干」
| 框架 | 协作模式 | 沟通方式 | 可控性 | 突出特点 | 更适合 |
|---|---|---|---|---|---|
| AutoGen (AG2) | 对话式协作 | 多轮发言+选人 | 中(偏「软」路由) | 批评–改进循环强 | 研究、写代码、材料互审 |
| CrewAI | 顺序 / 层级委派 | 任务交接 | 中高 | Role–Goal–Task 清晰 | 像项目组一样的业务流 |
| LangGraph | 图上多节点 Agent | 共享状态+边路由 | 高 | 协作也能做到确定路由 | 要协作又要合规/分支 |
协作类常 叠在编排类之上:CrewAI/AutoGen 是「协作体验」;LangGraph 是「可把协作画成确定图」。
3. 检索 / RAG / 搜索类:怎么「搜得准」
| 框架 | 定位 | 优化手段 | 是否训练 | 突出特点 | 更适合 |
|---|---|---|---|---|---|
| LlamaIndex | RAG 基建 | 连接器/索引/检索/评估 | 否 | 数据与索引基础设施 | 先建库、再建 Agent |
| QAgent | 模块化搜索 Agent | 多步规划–搜索–反思 | 两阶段 RL | 专攻「怎么搜」 | 已有检索底座,要加强搜索智能体 |
| SmartSearch | 查询优化 | 过程奖励+课程学习 | 三阶段课程 | 盯紧中间 query 质量 | 败因在查询改写 |
| composer-agentic_rag | 组件化 Agentic RAG | 可插拔策略+反思 ReAct | 否(编排) | 配置拼装 HyDE/重排/Self-RAG 等 | 工程上快速对比策略组合 |
| SIARE | 自我进化 RAG | 质量–多样性进化 | 进化算法 | 自动变异提示/策略/拓扑 | 愿付评估算力换自动搜参 |
| adaptive-intelligence | 检索策略路由 | RL 选策略 | RL | 按 query 类型选搜法 | 查询形态很杂(待核实成熟度) |
| FORT(供给侧) | 深度搜索数据合成 | 抗捷径数据生成 | 供 SFT | 逼模型真多步搜 | 训练数据太「水」、模型偷懒 |
同层怎么选一句话
缺地基 → LlamaIndex;缺会搜的 Agent → QAgent;query 差 → SmartSearch;想拼装策略 → composer;想自动进化配置 → SIARE;要好训练集 → FORT。
4. 工具与协议类:怎么「接到真实世界」
| 方案 | 抽象层级 | 跨产品复用 | 突出特点 | 更适合 |
|---|---|---|---|---|
| MCP | 工具/资源协议 | 高(多客户端可复用同一 Server) | 工具标准化、生态快 | 多 Agent/多 IDE 共用工具面 |
| OpenAI / 各厂 Function Calling | 模型原生工具调用 | 绑定厂商 schema | 路径最短 | 单厂商、快速闭环 |
| 各框架 Tools 封装(LangChain/SK/…) | 框架内 Tool 对象 | 中 | 与编排深度集成 | 已选某编排框架时 |
这类通常 不是替代编排,而是编排节点里的能力插头。
5. 记忆与状态类:怎么「记住并续上」
| 方案 | 记忆形态 | 突出特点 | 更适合 |
|---|---|---|---|
| LangGraph Checkpoint | 工作流状态快照 | 与控流一体,可 Resume/回放 | 任务状态、审批断点 |
| Mem0 / Zep 等 | 长期用户/实体记忆 | 跨会话画像与事实沉淀 | 个性化助手、CRM 式记忆 |
| Redis + Postgres/pgvector | 会话缓存 + 长期向量/结构化 | 可控、易合规、易审计 | 企业自建、要数据主权 |
选型要点:工作流状态(跑到第几步)和 认知记忆(用户偏好/事实)别混成一个桶。
6. 训练与数据合成类:怎么「变强」而不是「多写 if」
| 框架/方向 | 输入→输出 | 方法 | 突出特点 | 更适合 |
|---|---|---|---|---|
| FORT | 合成难例数据 → SFT | 抗捷径理论约束 | 专治虚假多步 | 训练深度搜索 Agent |
| QAgent / SmartSearch 训练链路 | 交互轨迹 → RL/课程学习 | RL、过程监督 | 直接优化搜索行为 | 有算力与评测集的团队 |
| 通用 SFT/RLHF/RLAIF 管线 | 轨迹与偏好数据 → 策略模型 | 经典对齐训练 | 可服务任意 Agent 技能 | 平台型模型团队 |
这类偏 研究/训练平台;线上推理仍要落到编排 + 检索 + 工具。
7. 观测与评测类:怎么「看得见、收得住」
| 工具 | 重心 | 突出特点 | 更适合 |
|---|---|---|---|
| LangSmith | Trace + 数据集评测 | 与 LangChain/LangGraph 最顺 | 已在 Lang 生态 |
| Langfuse | 开源可自托管 Trace/评分 | 数据留在自己侧 | 要私有化、可控成本 |
| Phoenix | 追踪 + 检索/Embedding 分析 | 偏排查质量与向量问题 | RAG 质量深挖 |
| RAGAS 等 | 离线 RAG 指标 | 忠实度/相关性等套件 | 回归与发布门槛 |
生产经验:编排和检索定了之后,观测几乎是必选项,否则无法迭代。
8. 耐久执行类:怎么「跑很久还不翻车」
| 方案 | 角色 | 突出特点 | 更适合 |
|---|---|---|---|
| Temporal (+ Agent 编排) | 工作流引擎 | 长事务、重试、可恢复;Activity 需幂等 | 跨分钟~天、副作用敏感 |
| 仅用 LangGraph Checkpoint | Agent 运行时持久化 | 够用中长任务与 HITL | 多数交互式业务流 |
| 队列自研(Celery/MQ) | 异步投递 | 灵活但要自补编排语义 | 已有成熟任务中间件团队 |
9. 垂直场景类(简表)
| 方向 | 代表形态 | 特点 | 注意 |
|---|---|---|---|
| 代码 Agent | Cursor、开源 coding agent | 仓库感知、工具链强 | 通用编排替代不了深层 IDE 集成 |
| 浏览器 / 桌面 RPA Agent | 浏览器操作类框架 | 视觉/DOM 操作 | 稳定性与权限风险高 |
| 客服 / 工单 Agent | 业务套件或自研 | 流程+知识库绑定紧 | 常=编排+RAG+HITL 组合拳 |
跨类对照:一张表看「你该先买哪一层」
| 你的主痛点 | 优先大类 | 首选倾向 | 可叠加 |
|---|---|---|---|
| 分支乱、无法审批/恢复 | 1 编排 | LangGraph | 7 观测、8 Temporal |
| 多人协作像项目组 | 2 协作 | CrewAI / AutoGen | 1 编排加固 |
| 答不准、召回差 | 3 检索 | LlamaIndex → 再选 QAgent/SmartSearch/composer | 7 评测 |
| 接不到内部系统 | 4 工具 | MCP + 编排 Tools | — |
| 下一会话就忘 | 5 记忆 | Checkpoint + 长期记忆方案 | — |
| 模型不会真多步搜 | 6 训练 | FORT / RL 搜索训练 | 3 检索 |
| 线上不知贵在哪、错在哪 | 7 观测 | Langfuse / LangSmith | 全类 |
| 任务要跑很久 | 8 耐久 | Temporal + 编排 | 幂等治理 |
| 只要某一业态开箱 | 9 垂直 | 对应产品/套件 | 仍建议保留观测 |
推荐落地组合(三条样板)
A. 企业知识助手(Java 中台常见)Spring Gateway + LangGraph/编排服务 + LlamaIndex/RAG + MCP 工具 + Langfuse +(必要时)HITL
B. 内容/研究型多 Agent
CrewAI 或 AutoGen(协作)+ LlamaIndex(材料检索)+ 观测;流程变硬后再迁部分到 LangGraph
C. 深度搜索能力建设(偏研究)
FORT 造数 → QAgent/SmartSearch 训练 → 线上推理挂进 LangGraph 节点
和「九大类」的对应关系(速记)
9 垂直应用
↑
1 编排 ↔ 2 多 Agent 协作
↑
3 检索/RAG 4 工具/MCP 5 记忆
↑
6 训练/数据(让 3/1 变强)
↑
7 观测/评测(横切)
8 耐久执行(横切,托住长任务)
更多推荐


所有评论(0)