本文整理自 QCon 北京 2026圆桌对话《Agent落地的真实代价:从Demo到生产,哪些系统设计必须被重写》,通过AI音视频转录总结工具 Ai好记 转录整理,以下为精炼整理后的会议笔记内容。


在这里插入图片描述

Agent 落地到底难在哪:不确定性是绕不开的坎

Demo 阶段的 AI Agent 跑得行云流水,一到生产环境就频繁翻车。这个现象几乎所有做 Agent 的团队都遇到过。

几位嘉宾聊下来,核心症结就一个词:不确定性

LLM 的概率生成本质决定了 Agent 的行为不可能完全可控。同样的 prompt,这次给正确答案,下次可能跑偏。

这就带来一个很现实的问题,你没法用传统软件的确定性思维去构建 Agent 系统。

《测试通过了不等于上线没问题》,这个说法在 Agent 场景下尤其刺耳。传统软件测试覆盖了所有分支就算完事,但 Agent 的决策路径在运行时才确定,测试环境覆盖不了生产环境里的意外情况。

更头疼的是幻觉问题。

Agent 在思考过程中捏造了一个不存在的 API 或者错误的数据,然后自信地继续往下执行。Demo 里你看不到这些,因为演示环境的数据和流程都是精心挑过的。上了生产,数据五花八门,幻觉就藏不住了。

沙箱和控制机制:限制爆炸半径是生产环境的底线

既然 Agent 的行为不可预知,那系统设计的第一原则就不是《让 Agent 永远不出错》,而是《万一出错了,损失能控制在有限范围内》。

圆桌上几位嘉宾不约而同提到了沙箱策略。核心思路很直白:给 Agent 一个安全容器,在里面跑所有可能带来副作用的行为。

具体怎么做呢?几个方向:

1、安全容器隔离。

Agent 执行的代码跑在隔离环境里,无法直接访问宿主机。这个跟 Docker 容器有点像,但要求更严格。文件系统只读、网络访问白名单、系统调用过滤,每一层都在缩小 Agent 的行动半径。

2、网络权限分级。

不是所有 Agent 都有权调所有 API。根据任务的敏感度,给 Agent 划分不同的网络访问等级。查天气的 Agent 不需要访问内网数据库,写邮件的 Agent 不需要调文件服务器。

3、人工审核关键节点。

某些高风险操作,比如写数据库、发通知、调用第三方支付,中间插一个人工审批环节。Agent 生成方案,人确认后执行。这个设计说起来简单,往回退了一个时代,但在生产场景下是最有效的安全网。

坦率地讲,这些机制在 Demo 阶段没人会去搭。但上生产没这几层保护,半夜接到告警电话是迟早的事。

信任与人工干预:什么时候信 Agent,什么时候打断它

控制机制聊完之后,话题自然转向了信任度的问题,给 Agent 多大自主权,又该在什么节点把人叫回来。

几位嘉宾的共识是:信任度不是固定的,应该根据任务复杂度动态调整。

简单任务比如查询信息、整理数据,直接让 Agent 全权处理,人只看结果。复杂任务比如生成合同、操作敏感数据,每一步都要人确认。中间地带的任务,可以让人在关键决策点介入。

这个思路落地下来,就得在系统设计层面预留《打断点》。

Agent 的执行流程里插几个 checkpoint,每到一个 checkpoint 就停下来判断:这个操作风险高不高?需要人看一眼吗?不需要就继续,需要就等人反馈。

有意思的是,几位嘉宾提到一个反直觉的结论:人工介入点越多,不见得越安全。

如果每步都让人确认,人很快会产生《确认疲劳》,变成机械式点同意,反而失去了审核的意义。所以打断点要精不要多,只在真正高风险的地方设。

还有一个容易被忽略的点:Agent 应该能《感知》自己出问题了。比如连续几次 API 调用失败,或者同一个步骤循环执行了 N 次还在转,这时候 Agent 主动停下来问人,而不是闷头重试。

记忆系统设计:本地端侧和云端怎么分工

Agent 的记忆系统是一个经常被低估的设计问题。Demo 里 Agent 做完一次任务就完事,不需要记住什么。生产环境里,Agent 需要跨会话的信息,用户偏好、历史操作、上下文状态。

几位嘉宾提到的分层方案很有参考价值:

端侧记忆处理高频、低延迟、隐私敏感的数据。

比如用户当前会话的上下文、刚说过的几句话、正在操作的文件状态。这些信息存在本地,读写快,不会造成网络延迟。隐私也有保障,敏感数据不出设备。

云端记忆负责持久化和跨设备共享。

用户长期积累的知识库、历史偏好、配置信息,存在云端。这样换个设备登录,Agent 还能认出你是谁、知道你之前做过什么。

两套记忆系统之间还需要一个同步策略。哪些数据必须实时上云,哪些可以闲时同步,哪些永远留在本地。同步粒度太细,网络开销大。同步粒度太粗,跨设备切换时体验断档。

这个分层设计跟 Ai好记 处理音视频笔记的逻辑有些共通之处。音视频内容在本地转录,实时出结果,保证速度;笔记、标签和关联知识库的数据持久化在云端,多设备随时访问。本地处理保证效率和隐私,云端服务保证持久化和共享能力。

头部企业怎么看:Agent 不是要不要的问题,是用多深的问题

圆桌后半段的讨论更偏向工程实践层面的观察。

几位来自互联网大厂的嘉宾透露,他们所在的公司已经在非涉密场景全面放开了 AI 编程工具。

开发者的工作流里,Agent 已经成了标配,写单元测试、代码审查、生成文档、重构代码,这些活儿 Agent 干得比人快。

但有意思的点来了:软件工程的核心要求一点没变。

需求分析还是要做,架构设计还是要画,测试覆盖率还是要卡,CI/CD 流水线还是要跑。Agent 把很多重复劳动接管了,但工程流程的质量标准没有降低。

反而因为 Agent 产出速度快,人工 review 的工作量在增长,只是 review 的内容从自己写的代码变成了 Agent 生成的代码。

几位嘉宾提到一个比喻挺贴切:Agent就像一个写代码速度极快,但经常自作聪明的初级工程师。该验的验收条件一个不能少,该走的上线流程一条不能省。

对于还在观望的团队,嘉宾的建议是:先从低风险场景开始试。比如内部工具、辅助脚本、文档生成这类场景,Agent 出错了也能承受损失。跑通了,再逐步往核心业务场景推进。


常见问题 FAQ

问:Agent 落地到生产环境,最大的坑是什么?
答:把 Demo 环境的性能直接当生产环境的预期。Demo 是精心挑选的,生产数据千差万别,测试环境看不出幻觉问题和边界异常。

问:沙箱隔离和 Docker 容器是一回事吗?
答:思路类似但要求更严格。Agent 沙箱需要文件系统只读、网络白名单控制、系统调用过滤,权限隔离的粒度比普通容器更细。

问:Agent 的信任度怎么控制比较好?
答:根据任务复杂度动态调整。简单任务全权交给 Agent,高风险任务每个关键节点设人工审批,中间地带在关键决策点介入即可。

问:记忆系统必须同时做端侧和云端吗?
答:看场景。只在一个设备上用的场景,只做端侧也可以。需要跨设备切换、多设备共享知识库的,就得端侧加云端分层设计。

问:QCon 圆桌里提到的头部企业,AI Agent 用得最深的是什么场景?
答:非涉密场景的 AI 编程工具已经全面放开了。代码审查、单元测试、文档生成这些重复劳动类工作,Agent 替代率很高。


以上内容由 Ai好记 转录整理。
Ai好记是一款音视频转图文笔记的 AI音视频转录总结工具,支持解析B站、抖音、小宇宙等平台链接及本地/网盘的音视频文件,转文字后自动生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

在这里插入图片描述

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐