58同城AI Agent测试实践,用业务流程管理替代传统UI自动化
本文整理自 QCon 北京 2026 仲思宇分享《基于业务流程管理的客户端AI Agent智能化测试实践》,通过AI音视频总结工具 Ai好记 进行转录整理,以下为视频转文字整理后的内容。

传统UI自动化的困局
58同城本地生活业务线的测试团队在实践过程中踩了不少坑。仲思宇在 QCon 的分享里把问题摆得很直白:传统 UI 自动化测试的维护成本高,且覆盖有限。
核心问题有几个:
- 维护成本高。XPath 复杂且容易坏,页面稍微改一下就得重写
- 覆盖不足。核心链路只能覆盖全流程的 40% 到 60%
- 长链路不稳定。百级步骤的链路,走到三五十步的时候上下文就开始压缩,后面的步骤执行失败率很高
更关键的是,完全靠 AI 推理去执行每一步(纯 ReAct 模式)也不靠谱。虽然灵活,但 Token 消耗高,对长链路场景的稳定性不够。10 个场景里 8 个是长链路,最后可能有 6 个都失败。
双模式并行:Plan + ReAct
58 团队的解法不是二选一,而是把 Plan 模式和 ReAct 模式结合起来动态调用。
Plan 模式的优势是站在全局业务视角,通过知识图谱和业务知识库拿到完整的执行链路,记录之后再去执行。但问题是页面上可能有弹窗或者变化,导致规划好的链路走不通。
ReAct 模式灵活,能通过知识库动态调整,但步骤异常后上下文有压缩风险,而且有幻觉——靠大模型推理出来的步骤不一定每次都贴合固定场景。
把两者结合起来的效果:Plan 先给出业务地图的正确路径,ReAct 保证当前步骤可以正常执行。
如果失败,走自愈流程。最终稳定性达到 85%,传统 UI 自动化只剩 20% 还在用。
三层架构:意图识别 + Agent决策 + Skills执行
这套体系的核心架构分为三层:
- 业务流程管理层:负责业务的意图识别,拿到需求后判断要走哪个业务链路
- Agent 决策层:做规划和执行,根据业务地图生成步骤
- 多端 Skills 执行层:控制 Android、iOS、鸿蒙三端的设备操作
亮点在于 Skills 层的设计。58 把安卓、iOS、鸿蒙三端封装成三个不同的 LLS 层,每个 Skills 处理点击、滑动等操作。
技能是开放给所有业务线的,他们可以定制自己的能力——比如某些区域性的手势滑动——只需要添加后有人 review 一下,就能动态注册到 Agent 框架里,不需要重新部署。
自愈机制和断言优化
自愈这块做得比较务实。检测到弹窗或者页面找不到特征元素时,会跟最后一次成功步骤的图片做对比。
每个操作图片都在操作区域做标记,能看到点击的是不是目标位置。失败的话重试三次,最终还失败就跳过。
比较惊艳的一个发现是多模态大模型在断言上的能力。有一次迭代,开发用 AI 生成代码把「销冠问答」写成了「销管」,错别字的版本上线了才被发现。仲思宇说多模态对这类的捕捉基本上是百分之百——错别字检测可能是本地化测试的未来方向。
业务地图模板链路的实践
这是最核心的部分。58 没有把核心交易链路放到知识图谱里,而是单独放在向量库。原因是知识图谱太灵活——10 个入口能匹配出 10 条路径,虽然都能走到下单,但场景匹配错了。
通过固化业务模板链路,配合参数化配置,能做到:
- 零幻觉和随机性(强约束)
- 针对特定场景做交易履约测试
- 在模板链路里直接调用数据构造接口,动态生成测试数据后再跑消费逻辑
生成模板链路的方式有两种:
一种是上传图片和视频,自动拆分出操作链路(但需要人工审核);另一种是开发人员手动配置场景,比如线上某个场景出了问题,通过简单配置直接跑那个链路,不用写脚本。
单步执行时间优化到 8 秒以内,关键在于把观察和思考合并为一步,降低大模型请求次数。
反思步骤一般不会触发,只在页面出现弹窗或找不到特征时才走。总结步骤做了上下文切片,只保留最核心的部分,减少每次观察的输入输出量。
以上内容由 Ai好记 转录整理。
Ai好记 是一款音视频转图文笔记的 AI 学习助手,支持B站、抖音、小宇宙等平台链接及本地音视频文件解析,自动语音转文字生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。
更多推荐


所有评论(0)