一、一张冰山图戳破的幻觉

你有没有发现,今天聊 AI Agent 的人,开口闭口都是 Claude、GPT、DeepSeek。

仿佛只要模型够强,Agent 就能自己跑起来。

但最近一张在行业里传得很广的图,把这个幻觉戳破了:

AI Agent 不是 90% 的 AI + 10% 的工程。

而是 90% 的工程 + 10% 的 AI。

图的上方,水面之上,是我们熟悉的明星产品:Perplexity、Glean、Sierra、Lovable、Harvey、Cursor。

水面之下,是一整片你平时看不见的工程大陆:前端、记忆、认证、工具、可观测、编排、协议、路由、模型、ETL、数据库、基础设施、CPU/GPU……

每一层都不是点缀,而是决定这个 Agent 能不能从 Demo 走进生产环境的关键。

这让我想起一句话:模型是大脑,但身体在哪里?

没有身体、神经系统和生命支持系统,大脑再聪明,也只能泡在培养皿里。


二、水面之上:我们看到的,只是那 10%

先说说水面之上。

那些让你惊叹的 Agent 产品,无一不是把 10% 的 AI 能力,包裹进了 90% 的系统工程里。

Perplexity 不只是调用一个搜索 API + LLM。它的核心竞争壁垒,是索引质量、引用可信度排序、实时信息融合、答案生成后的可验证性设计。

Cursor 也不只是接了一个 GPT-4o。它的成功来自对代码上下文的精准理解、多文件编辑的工程化、Git 集成、终端交互、以及开发者工作流的深度嵌入。

再看几个企业级案例。

Sierra,由前 Salesforce 联席 CEO Bret Taylor 创立,专注企业客服 Agent。2024 年初成立,到 2025 年估值已冲到 100 亿美元,ARR 突破 1 亿美元。它的客户包括 Brex、Ramp、WeightWatchers、Sonos 这样的大型企业。

它靠什么支撑这么高的估值?

不是模型本身,而是 Agent OS——一个能把复杂客服流程、企业后端系统、品牌语气、合规约束全部编排起来的工程平台。Sierra 采用按结果付费,AI 只有真正解决问题才收钱。这意味着它对准确率、回滚机制、工具调用、状态管理的要求,远高于一个聊天机器人。

Glean,企业知识搜索和工作助手。2025 年宣布 ARR 突破 1 亿美元。它真正的护城河不是 LLM,而是 100 多个企业连接器、权限感知检索、企业知识图谱、以及跨系统的上下文理解。

没有这些工程,Glean 就只是一个接在企业数据上的聊天框。

Lovable,这款来自瑞典的 AI 编程工具,8 个月 ARR 从 0 冲到 1 亿美元,估值超过 20 亿美元。它的卖点不是模型,而是让非技术人员用自然语言生成完整应用的全栈工程闭环:前端、后端、数据库集成、部署链路。

水面上的这些公司,大家看到的是“AI 很厉害”。

水面下,它们真正的战斗力来自:把模型能力产品化、工程化、系统化的能力。


三、水面之下:14 层工程栈,一层都不能少

现在我们把冰山翻过来,看看水面之下到底有什么。

这张图把水下的部分分成了 14 层。从下往上看,你会发现:越是基础层,离用户越远,但离“能不能跑起来”越近。

第一层:CPU/GPU 提供商

包括 NVIDIA、AWS、Azure、GCP、Groq、RunPod。

这是整个 Agent 的物理底座。没有算力,模型再强也是静态文件。Agent 的运行特性决定了它对算力的需求不同于传统大模型:多轮推理、持续会话、低延迟、弹性伸缩,每一步都烧钱。

第二层:基础设施/基础层

Docker、Kubernetes、Auto Scale VMs。

Agent 一旦进入生产,就涉及部署、扩缩容、服务发现、负载均衡。没有容器化和编排能力,一个流量高峰就能让系统崩掉。

第三层:数据库

Chroma、Qdrant、Supabase、Pinecone。

Agent 需要记忆,而记忆不只是“上下文窗口”。长期记忆要存进向量数据库、关系型数据库、图数据库。知识要可检索、可更新、可权限隔离。

第四层:ETL(提取、加载、转换)

Datavolo、Needle、Verodat。

企业里的数据是脏的、分散的、格式各异的。ETL 层负责把原始数据清洗、结构化,变成 Agent 能用的信息。

第五层:基础模型

OpenAI、DeepSeek、Gemini、Grok、Claude。

这就是大家常说的 10%。它负责推理、语言理解、生成。但它只是冰山一角。

第六层:模型路由

Martian、OpenRouter、Not Diamond。

不同任务该用哪个模型?简单问候用便宜的小模型,复杂推理用 GPT-4o 或 Claude 3.5。模型路由根据成本、延迟、质量做智能选择。

第七层:Agent 协议

MCP、A2A Protocol、Cisco agntcy SLIM、IBM ACP。

这是 Agent 之间的“语言”。MCP 被称为 AI 的 USB-C,一个协议让任何模型连接任何工具。A2A 则是 Agent 与 Agent 之间的通信协议。

没有协议,多 Agent 系统就是一团意大利面。

第八层:Agent 编排

LangGraph、AutoGen、CrewAI、Haystack、LlamaIndex、ADK、AWS Agent Squad。

编排层决定 Agent 怎么思考、怎么规划、怎么调用工具、怎么在多 Agent 之间分配任务。它是把模型从“聊天机器人”变成“能干活系统”的关键。

第九层:Agent 认证

AWS AgentCore Identity、Azure Entra Agent ID。

每个 Agent 都是一个非人类身份,有凭证、有权限、有爆炸半径。企业级部署必须回答:这个 Agent 能访问什么?能被谁调用?操作如何审计?

第十层:Agent 可观测性

Arize、LangSmith、Langfuse、Helicone、Opik。

Agent 不是确定性程序,它会犯错、会循环、会幻觉。可观测性让你看到它每一步在干什么、调用了什么工具、产生了什么中间结果、哪里出了问题。

第十一层:工具层

Google Search、DuckDuckGo、Serper、Exa。

这是 Agent 的手脚。没有工具,Agent 只能说话;有了工具,它能查资料、写代码、发邮件、改数据库。

第十二层:认证层

Auth0、Okta、OpenFGA、ANON。

用户认证、权限控制、单点登录。Agent 要进入企业系统,必须先通过这扇门。

第十三层:记忆层

Zep、Mem0、Cognee、Letta。

Agent 需要记住用户偏好、对话历史、任务状态。记忆层决定它是“一个会聊天的工具”,还是“一个越来越懂你的助手”。

第十四层:前端层

Streamlit、Flask、Gradio、React。

用户最终看到的界面。再强的后端,如果没有好用的交互层,也推不到用户手里。


四、为什么 90% 的工程,才是决定生死的地方

这张图最想告诉我们的是:模型的差距正在缩小,系统的差距正在放大。

过去一年,OpenAI、Google、Anthropic、DeepSeek 的新模型此起彼伏。Benchmark 榜单上,大家的差距越来越小。

但同样是 Claude 3.5,有人拿它做出一个能处理复杂客服流程、能回滚、能审计的生产级 Agent;有人只能做出一个回答不稳定、经常跑偏的对话 Demo。

差别不在模型,而在这 14 层工程栈。

举个例子:可观测性。

传统软件出错了,日志能告诉你哪一行代码错了。Agent 出错了,可能是提示词不对、上下文不够、工具返回了脏数据、模型产生了幻觉、路由选错了模型。没有 LangSmith、Langfuse 这类工具,你连问题出在哪一层都不知道。

再比如:Agent 协议。

Anthropic 2024 年底开源了 MCP(Model Context Protocol),让模型能通过统一接口调用外部工具。短短几个月,社区已经出现上千个 MCP server。OpenAI、Google 也纷纷跟进。

为什么一个协议这么重要?

因为它解决的不是模型能力问题,而是工程集成问题。没有 MCP,每接一个新工具,你都要写一遍适配代码;有了 MCP,工具即插即用。

还有模型路由

当 Agent 开始处理真实业务,成本就不再是“一个月几百刀 API 费用”的事。一个复杂客服会话可能消耗 3 万到 5 万 token,每次调用 GPT-4o 级别的模型,成本就是几毛钱。如果一天处理百万级会话,路由省下来的钱就是真金白银。

所以你看,水面上那 10% 决定的是“能不能听懂”;水面下那 90% 决定的是“能不能干成、能不能持续干、能不能安全地干”。


五、从“找好模型”到“建好系统”

这张图对两类人最有价值。

第一类,是 AI 创业者。

如果你还在比拼“我用的是哪个模型”,大概率已经慢了半拍。今天创业的真正机会,在于:

  • 找到一两个具体场景;
  • 把模型能力封装成可交付、可复用的产品;
  • 在水面之下的 14 层里,至少有一两层做到比别人深。

Sierra 赢在客服场景的系统工程。Glean 赢在企业知识的连接和权限。Lovable 赢在全栈应用生成的工程闭环。

它们都没说自己“模型最先进”。它们说的是:我们在一个具体场景里,把 AI 真正落地了。

第二类,是企业技术决策者。

当你评估一个 Agent 方案时,不要只问:

“接的是哪个大模型?”

更要问:

  • 数据怎么接入?权限怎么管?
  • 出错时能不能回滚?能不能审计?
  • 工具调用失败怎么办?
  • 多轮任务状态怎么保持?
  • 成本怎么控制?延迟能不能接受?

这些才是决定一个 Agent 能不能上生产环境的问题。


结语:冰山之下,藏着真正的护城河

AI Agent 的发展,正在经历一个从“模型崇拜”到“系统工程觉醒”的转折。

两年前,谁拿到 GPT-4 的 API,谁就能做出惊艳 Demo。

今天,模型能力已经泛化。真正稀缺的是:把模型能力变成可靠、可扩展、可信任产品的工程能力。

那张冰山图最刻薄、也最诚实的地方在于:

它把 AI 放得很小,却把工程放得很大。

不是贬低 AI 的重要性,而是提醒我们:

模型是大脑。

但大脑不能自己走路、自己吃饭、自己对抗风险。

一个真正有用的 Agent,需要一整个身体。

而这个身体,90% 都是工程。


参考资料与数据来源:

  • AI Agent 冰山图原始来源:行业公开分享资料,图中列示产品/技术栈据此整理
  • Sierra:公开融资信息及客户案例,sierra.ai;2025 年估值约 100 亿美元,ARR 突破 1 亿美元
  • Glean:Glean 官方新闻稿,2025 年宣布 ARR 突破 1 亿美元
  • Lovable:公开融资及媒体报道,2025 年估值超 20 亿美元,8 个月 ARR 破 1 亿美元
  • MCP / A2A Protocol:Anthropic 2024 年底开源 MCP,Google 2025 年发布 A2A Protocol

免责声明:文中涉及的市场数据、融资信息及产品动态均来自公开资料,仅供分析参考,不构成任何投资建议。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐