现代 Agent = LLM + 上下文 + 工具
现代 Agent = LLM + 上下文 + 工具
这个定义比传统的"四大组件"说法更简洁,也更贴近实际工程中的核心关注点。下面展开聊聊这三者的关系:
🧠 LLM(大语言模型)—— Agent 的"大脑"
LLM 负责推理、决策和生成。它不再只是回答问题,而是充当整个 Agent 系统的"中央处理器":
接收用户意图
决定下一步该做什么
判断是否需要调用工具
整合工具返回结果,生成最终响应
💡 模型的选择直接影响 Agent 的能力上限:更强的推理能力 → 更复杂的任务规划能力。
📝 上下文(Context)—— Agent 的"记忆与状态"
"上下文"其实涵盖了我之前提到的记忆 + 任务规划 + 对话状态,是 Agent 保持"连贯性"的关键:
短期上下文:当前会话的对话历史、已执行的步骤、中间结果。
长期上下文:用户偏好、历史任务记录、个性化配置(通常借助向量数据库实现)。
任务状态:当前进行到哪一步、下一步该做什么、哪些分支已完成。
上下文管理的好坏,直接决定了 Agent 能否处理多轮、多步骤的复杂任务。上下文窗口越大、管理越高效,Agent 能处理的任务就越复杂。
🛠️ 工具(Tools)—— Agent 的"手脚"
工具是 Agent 与外部世界交互的接口,让它不再局限于模型内部的"知识":
搜索工具:获取实时信息(如联网搜索、新闻抓取)
API 工具:调用第三方服务(如天气、地图、支付)
代码解释器:执行代码、处理数据
数据库工具:查询或写入结构化数据
自定义工具:对接企业内部系统
工具的本质是扩展 LLM 的能力边界——模型负责"想",工具负责"做"。
三者的协作流程
一个典型的 Agent 执行循环如下:
用户输入
↓
[LLM] 理解意图 + 结合[上下文]判断状态
↓
决定是否需要调用[工具]
├── 不需要 → LLM 直接生成回复
└── 需要 → 调用工具 → 获取结果
↓
结果写入[上下文]
↓
LLM 基于新上下文继续推理
↓
循环直到任务完成
这就是所谓的 ReAct 模式(Reasoning + Acting):交替进行"思考"和"行动",直到达成目标。
📌 小结
公式 侧重点
LLM + 工具调用 + 记忆 + 规划 学术/教学视角,拆解更细
LLM + 上下文 + 工具 工程/产品视角,更本质、更简洁
你的公式把"记忆"和"规划"统一归入"上下文",确实更符合现代 Agent 框架(如 LangGraph、OpenAI Agents SDK)的设计理念——一切状态都沉淀在上下文中,由 LLM 驱动,通过工具落地。
更多推荐




所有评论(0)