WISH智能体平台:面向大模型时代的AI应用开发与运行基础设施
本文整理自 AICon 上海分享「面向超大规模教育场景的 Agent 系统架构演进与工程实践」(演讲者:王搂),通过AI音视频转录总结工具Ai好记 转录整理,以下为视频转文字精炼整理后的内容。

教育场景的特殊挑战
一句话概括教育AI应用的特点:任务复杂、流程长、高并发、多模态。
一道智能批改题的背后涉及多个环节:OCR识别→搜题匹配→批改打分→错因分析→讲解生成。每一步都可能调用不同引擎,这些引擎需要按顺序配合完成。
| 维度 | 教育AI特征 | 对系统的要求 |
|---|---|---|
| 任务链路 | 长流程,分钟级 | 工作流编排必须灵活 |
| 输入形式 | 文本+语音+图像+视频 | 多模态处理能力 |
| 流量特征 | 潮汐波动,峰值极高 | 弹性伸缩必须敏捷 |
| 引擎数量 | 数百个异构引擎 | 统一服务化治理 |
单一大模型根本无法胜任这种复杂度,必须依赖由多个异构引擎编排的复杂工作流。
WISH开发平台的架构定位
讯飞构建的「WISH」智能体开发平台,定位覆盖三个层面:
| 层面 | 能力 | 关键词 |
|---|---|---|
| 开发态 | AI时代的IDE | 流程编排、调试、模拟 |
| 运行态 | 稳定底座 | 服务治理、弹性、容错 |
| 数据中枢 | 数据闭环 | 链路上报、质量分析 |
核心目标是让开发者能快速构建复杂的AI应用,而不用关心底层的异构引擎和调度问题。
引擎层的挑战与创新
统一服务化框架
面对数百个异构引擎——从几十M的小模型到上T的大模型,从REST API到gRPC再到WebSocket——需要一个统一的框架来接入和管理。
WISH的做法是将所有引擎抽象为标准的服务单元,统一协议、统一监控、统一治理。新引擎接入时只要实现标准接口,就能融入整个平台体系。
基于CRDT的无冲突负载均衡
这是WISH引擎层一个很有意思的创新。传统负载均衡的前提是请求大小相似、后端能力相近,但AI引擎完全不是这样:
- 请求大小差异巨大:从几KB到几MB
- 后端能力差异巨大:从轻量小模型到千亿参数大模型
- 工作流层到引擎层存在百倍的请求放大效应
WISH的解决方案基于CRDT(无冲突复制数据类型) 的「PN-Counter」负载均衡算法。
基本思路:
可用授权容量 = 总容量 - (请求接入计数 - 处理完成计数)
两个计数器只增不减,基于CRDT保证分布式环境下的一致性和无冲突同步。这样就精确控制了每个引擎当前正在处理的请求数,避免了传统的轮询或哈希算法在AI场景下的失效。
引擎崩溃处理四步法
引擎崩溃是线上最棘手的问题之一。
WISH的处理流程:
- 轻量化现场:使用minidump文件替代传统核心转储,便于传输
- 实时保存:通过专用组件实时接收崩溃现场(堆栈、请求、系统状态),防止服务重启后丢失
- 告警打通:与告警系统联动,即时通知责任人
- 有毒请求过滤:对导致连续崩溃的相同或类似请求进行拦截,保护系统整体可用性
第4步尤其关键——如果某个特殊的输入会导致引擎崩溃,在问题修复前,系统会自动拦截所有相同模式的请求,防止整个集群被反复击倒。
基础设施的弹性能力
大模型的GPU算力非常稀缺,加上教育场景本身有潮汐流量(白天高峰、晚上低谷),弹性能力是平台的核心竞争力。
跨云跨地域模型分发
WISH实现了分层与预分发策略:
| 层级 | 内容 | 分发方式 |
|---|---|---|
| 模型权重 | 数百GB的大模型 | 提前分发到各地域仓库 |
| 引擎镜像 | 推理引擎包 | 地域级缓存 |
| 服务镜像 | 业务服务包 | 按需拉取 |
在集群内部,使用P2P高速分发和分布式缓存预热,将模型加载速度提升10倍以上,以支持突发扩容需求。
哨兵系统
平台构建了一个智能化的运维「哨兵系统」,职责包括:
- 自动监控所有服务的健康状态
- 识别异常模式(性能下降、错误率升高)
- 触发自动修复或通知人工介入
- 沉淀运维知识,形成闭环
稳定性压倒一切
在教育AI场景中,平台的最高优先级是可控性和7x24小时稳定运行。在效果优化之前,先保证系统不崩溃。
几个关键设计原则:
- 灰度发布:任何变更都走灰度验证,逐步放量
- 降级策略:核心引擎不可用时,走降级方案而非直接报错
- 限流熔断:超出承载容量时优雅拒绝,而非整体雪崩
KV-Cache亲和调度
大模型推理中KV-Cache是影响效率的关键因素。WISH平台实现了KV-Cache亲和调度策略——将相同或相似上下文的请求调度到同一引擎实例,提高缓存命中率和吞吐量。
这个策略对教育场景尤其有价值:学生在同一天做同一套题目时,题目上下文是一致的,调度到同一实例可以复用KV-Cache,大幅降低延迟和计算成本。
未来方向:全动态工作流与闭环运维
WISH平台正在向两个方向演进:
全动态工作流:Agent根据输入需求和数据,自主设计、执行并评估工作流,不再需要人工预先编排复杂的静态流程。Agent自动判断需要调用哪些引擎、按什么顺序调用。
智能运维闭环:哨兵系统不仅能监控和告警,还能自动诊断、修复问题,形成知识沉淀。目标是从「人盯着机器」变成「机器自治」。
FAQ
Q:WISH平台开源吗?
A:文中未提及开源计划。该平台主要服务于讯飞内部和合作伙伴的教育AI业务。
Q:CRDT负载均衡算法能用到自己的系统里吗?
A:可以借鉴思路。核心是「两个计数器只增不减+CRDT同步」的模式,适用于任何需要精确控制并发请求数、且后端处理能力差异大的分布式系统。
Q:教育场景之外的行业能用这套架构吗?
A:WISH的设计思路是通用的——异构引擎治理、弹性调度、KV-Cache亲和——任何需要多引擎协作的AI应用都可以参考。
以上内容由 Ai好记 转录整理。
Ai好记是一款音视频转图文笔记的AI音视频总结工具,支持解析B站、抖音、小红书、小宇宙等平台链接及本地音视频文件,转录后自动视频转文字,截取PPT,生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

更多推荐



所有评论(0)