一个智能体里不是只能用一个模型。我做的客服分析流程拆了五个节点,五个节点我挂了三种不同的模型,每月 Token 花费比"全程用最强模型"省了大概六成,效果几乎没掉。怎么分的,记一下。

先看每个节点到底难不难

我把流程里的活儿分了三档难度:

  • 纯搬运/格式化:把用户输入清洗成结构化字段、套模板生成固定话术。这种活儿不需要聪明,便宜的小模型完全够。

  • 理解/分类:判断用户意图、打情绪标签、决定走哪个分支。中等模型,要准但不烧脑。

  • 生成/推理:写最终回复、做多轮归因分析。这一步才值得上最强的大模型。

道理很简单:不是每一步都需要最贵那个。我之前全程一个旗舰模型,光"把日期格式从中文转成 YYYY-MM-DD"这种破事,都在烧旗舰模型的钱,肉疼。

实际怎么配

在一个支持多源大模型的智能体平台上,每个节点能单独选模型,我就按上面三档挂:

节点

干的活

挂的档位

输入清洗

抽字段

小模型

意图分类

判分支

中模型

情绪打标

给标签

小模型

生成回复

写话术

大模型

归因总结

多轮推理

大模型

踩的坑:小模型在分类上翻车

我一开始贪便宜,把"意图分类"也塞给最小的模型,结果它把"我要退款"和"我退款到账了吗"分成了同一类,下游走错分支,用户火大。换成中等模型后才稳。教训是:分类看着简单,但错一次代价大(走错整条链路),不该省这里的钱。反倒是格式化这种错了也不致命的,放心用便宜的。

怎么决定一个节点该上哪档

我的笨办法:每个节点先全用大模型跑出"标准答案",再换便宜模型跑同样的输入,逐条对。如果便宜模型有 95% 跟大模型答得一样,就降级;差太多就保留。花了一下午对了五个节点,省下来的钱一个月就赚回这点时间了。

别过度优化

把每个节点都抠到极致便宜,维护成本也上来了——五个节点三种模型,哪天某个模型涨价或下线,你得逐个排。我现在只在 Token 量大的节点上较真,调用量小的节点就懒得抠,全用顺手的那个。

(这些模型我都通过讯飞 MaaS 调现成 API,按节点切不同模型,不用自己部署任何一个,省了算力的事,只管按难度分配。)

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐