Claude大模型 是代码领域无可争议的领导者,其推出的Claude Code以更激进的方式——不提供IDE界面,仅仅提供命令行,也对Cursor代表的范式形成直接挑战。其发布的Agent SDK,用于支持Agent构建。让我们一起学习一下其核心思路。

Claude Agent给出一个基础的模式, 这个模式的核心只有三步:收集信息、执行动作、验证结果

图片

Claude Agent SDK 工作流示意图


01 信息获取:四种方式教会AI“主动找资料”

一个优秀的Agent不能只做“传声筒”,它必须学会主动获取和更新自己所需的上下文信息。以下是四种核心的信息获取策略:

1. 文件系统:最基础可靠的信息源

我们构建的Agent本质上是“数字智能体”,其核心能力在于处理数字信息,而电脑中的文件系统是其最自然、最可靠的信息来源。当Agent需要处理日志、用户上传的大型文件时,它应该像熟练的工程师一样,使用 greptail 等Bash命令,智能地将所需内容加载到上下文中。可以说,

Agent的文件夹与文件结构本身就是一种精心的上下文工程

2. 语义搜索(RAG):快速但需谨慎使用

随着AI应用的普及,基于检索增强生成(RAG)的语义搜索已成为许多应用的标准配置。它通过将文本“分块”并转换为向量,从而实现基于概念的搜索,速度通常较快。然而,其准确性相对较低,维护更复杂,且过程不够透明。

建议优先从可靠的文件搜索入手,仅在需要极速响应或处理高度多样化查询时,才考虑引入语义搜索。

3. 子代理机制:实现并行与上下文管理

Claude Agent SDK 默认支持子代理。这一机制有两大妙用:

一是实现任务并行化,可同时启动多个子代理处理不同的子任务;

二是高效管理上下文,每个子代理拥有独立的上下文窗口,仅向主协调器返回关键信息摘要,而非全部原始数据。这对于需要从海量信息中筛选有效内容的任务而言,是理想的设计。

4. 上下文压缩:解决“记忆”瓶颈

当Agent长时间运行,对话历史接近其上下文长度限制时,“上下文压缩”功能会自动启动,对过往信息进行智能总结,从而腾出空间容纳新的交互。这确保了Agent不会因为“记不住”而影响长期任务的执行。

02 动作执行:为AI配备一套趁手的“数字工具箱”

获取信息后,Agent需要多种“工具”来执行具体任务。Claude Agent SDK 提供了不同层次的工具,以应对不同复杂度的场景。

1. 自定义工具:面向高频核心操作

自定义工具是Agent执行任务的主要模块。因此,有意识地将最高频、最核心的操作设计为专用工具,能极大提升Agent的决策效率和准确性。例如,对于一个邮件代理,“获取收件箱”和“搜索邮件”就应被定义为这样的核心工具。

2. Bash脚本:灵活通用的“瑞士军刀”

Bash作为通用脚本工具,赋予Agent在操作系统层面进行灵活操作的能力。例如,当邮件附件中包含重要PDF时,Agent可以编写并执行一段脚本,自动完成下载、转换为文本、并进行关键信息提取的全流程。

3. 代码生成:处理复杂任务的利器
代码具有精确、可组合、可无限重用的特性,使其成为完成复杂、精确操作的理想载体。在设计Agent时,思考“哪些任务用代码表达更好?”往往能解锁强大能力。例如,编写Python脚本来自动生成格式复杂的Excel报表或PPT,这用其他方式很难高效实现。

4. MCP集成:无缝连接外部服务的“桥梁”

模型上下文协议(MCP)为外部服务提供了标准化集成方案,自动处理身份验证和API调用。这意味着开发者可以轻松将Agent连接到Slack、GitHub、Google Drive等海量工具,而无需深陷于编写集成代码和管理OAuth流程的繁琐工作中。日益壮大的MCP生态系统,让Agent的能力扩展变得前所未有地便捷。

03 结果验证:三重防线构筑AI“自查自纠”能力

一个不仅能执行任务,还能自我检查与优化的Agent,才是真正可靠的。可以为Agent构建三层验证体系。

1. 基于规则的明确检查(最推荐)

这是最直接有效的方法:为输出定义清晰的规则,并让Agent自行核查。例如,在代码生成场景中,要求Agent生成TypeScript而非纯JavaScript,就能利用其静态类型系统获得更丰富的自动反馈。对于邮件代理,可以设定规则来校验收件人地址格式、避免重复发送等。

2. 视觉反馈:适用于“所见即所得”的任务

对于UI设计、HTML邮件排版等视觉性任务,让Agent“亲眼看到”自己的输出效果至关重要。通过集成Playwright等工具,可以自动对生成结果进行截图,并反馈给Agent进行视觉评估,检查布局、样式、内容层级等是否符合要求,从而实现迭代优化。

3. 大模型作为裁判(谨慎使用)

在某些对细微差别(如语气、风格一致性)要求极高的场景下,可以引入另一个大语言模型作为“裁判”来评估输出。这种方法响应较慢,可靠性也不如规则检查,属于用性能换质量的权衡策略,需根据实际需求谨慎选用。

04 持续优化:从“能运行”到“运行好”的四个关键提问

Agent初步构建完成后,真正的精进始于测试与优化。最佳方法是深入分析其失败案例,并站在Agent的角度思考:它到底缺了什么?

通过回答以下四个关键问题,可以系统性地提升Agent的可靠性:

  • 信息缺口? 

    如果Agent常误解任务,可能是关键信息难以获取。能否优化搜索API的结构,让信息更易被找到?

  • 重复失败? 

    如果某项任务反复失败,能否在工具调用中增加正式的错误检测与修复规则

  • 无法自纠? 

    如果Agent犯错后无法自行修正,是否因为它缺少更灵活或更具创造性的工具来尝试不同解决方案?

  • 性能波动? 

    随着功能增加,Agent表现是否不稳定?此时,需要基于真实用户场景构建代表性测试集,进行系统化评估,而非凭感觉判断。


整个流程体现了Claude团队最核心的工程哲学——务实

从基础的文件搜索开始,而非好高骛远地追逐复杂的语义搜索;

首选明确的规则验证,而非过度依赖另一个大模型的模糊评判。

这种从简单到复杂、从确定到模糊的渐进式思路,正是构建可靠系统的精髓。

当我们开始设计自己的AI工作流时,不妨先回归三个朴素的问题:它需要知道什么?它能做什么?它如何知道自己做得对不对?

| 核心洞见 |

  1. 文件即上下文:直接、透明的文件系统操作仍是Agent获取和工程化上下文信息最核心、可靠的方式。

  2. 代码即能力:生成并执行代码与Bash脚本,是将AI的认知能力转化为实际数字行动的最有效扩展途径。

  3. 验证是关键:建立系统化的验证机制(规则、视觉、裁判模型),是确保Agent输出可靠、迈向自治的关键一步。

| 反思 |当前备受关注的知识图谱,作为严格语义的知识源是否面临挑战?当我们已将语义要求最严苛的代码领域戏称为“屎山”,却又期待去构建和维护一个难以验证其正确性的全系统“知识图谱”,这是否是一条可行的道路?这值得所有AI建设者深思。

Claude Agent 详情文档:Building Agents with the Claude Agent SDK

我是AI时代原住民,欢迎关注我,一起在不确定的AI时代寻找确定性:

1:AI重构研发范式:

AI时代,你最大的能力变迁:从“我不行”到“我能行”!

AI重构软件研发全流程走向落地!亚马逊发布「AI驱动开发」全新方法论,完整解读十大核心原则

AI开发新范式——规范驱动开发(SDD)【第三篇】:通过OpenSpec实现增量开发

一图介绍清楚基于Spec Kit 框架的SDD(规范驱动开发)的详细过程【SDD第二讲]

五分钟带你理解AI时代的软件研发新范式——SDD(规格驱动开发) 【SDD第一讲】

重温氛围编程:是AI开发的明日新星还是皇帝的新装

华为《智能世界2035》揭示软件未来:人机协同编程重塑软件开发格局

2:AI重构软件组织:

AI组织-未来已来:10年以后的组织是什么样子?

AI组织是什么样子?来自微软的最新分析 – The Year of the Frontier Firm:

3:软件工程本质思考:

AI时代,重新温习软件工程经典巨作,思考软件工程的本质

研发提效的本质:不是让程序员拼命踩油门,而是为价值修一条高速公路

AI时代重温经典:《管理大型软件系统的开发》

4: 模型本质的认识:

OpenAI深度揭秘大语言模型的幻觉本质

5: 软件智能测试:

AI在软件测试中的理想与现实:一场尚未到来的革命

6: AI实战

SDD开发实战:3小时从零构建可私有部署的AI助手

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐