前沿重器

栏目主要给大家分享各种大厂、顶会的论文和分享,从中抽取关键精华的部分和大家分享,和大家一起把握前沿技术。具体介绍:仓颉专项:飞机大炮我都会,利器心法我还有。(算起来,专项启动已经是20年的事了!)

2024年文章合集最新发布!在这里:再添近20万字-CS的陋室2024年文章合集更新

往期回顾

最近美团LongCat团队出了一篇很全面的技术报告,系统阐述了如何通过大语言模型与多智能体架构重塑智能交互系统,实现用户满意度提升与成本降低的双重目标,总体看下来里面有很多细节和思路,看着很有收获,这里面的分析和解决方案都很落地,真的非常有逐句精读的价值,所以也想跟大家分享一下。

  • 原论文:https://arxiv.org/pdf/2510.13291

  • Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan’s Intelligent Interaction Systems

文章想带着大家精读,所以我分3篇文章来写。

  • 摘要和模型选择部分。对应论文第一章和第二章。(本文)

  • 智能体部分。对应论文第三章。

  • 评估体系和结论。对应论文第四章和第五章。

目录:

  • 核心内容

  • Introduction

  • 模型选择

    • 模型思路

    • 持续预训练

    • SFT

    • 自我检测回流迭代机制

    • 偏好学习

    • 推理增强

  • 小结

核心内容

文章是技术报告,特别长(36页),所以还是先和大家总结一下论文的背景和核心亮点。

论文的核心目标是构建一个工业级、可扩展、低成本、高满意度的智能交互系统(WOWService),解决传统客服系统在高并发、多轮对话、复杂业务规则下的瓶颈,这里,作者把整个系统的难题拆解为了5个挑战。

  • 冷启动数据难构建:高质量训练数据依赖人工标注,成本高、难扩展。

  • 多轮对话理解差:意图识别、规则遵循、解决方案提取能力不足。

  • 业务规则频繁变化:系统难以快速适应新规则,迁移性差。

  • 单模型能力有限:复杂场景下单一LLM难以胜任,缺乏协同机制。

  • 开放域对话无标准答案:难以量化评估,优化方向不清晰。

为此文章在数据构造、多阶段训练、多智能体架构、自动评估体系这4个方面进行优化,在用户满意度、问题解决率、模型准确率、重复率、幻觉率等关键指标中得到了显著提升。

Introduction

我的视角看挺多人会忽略这一章的,但其实这一章总能给到我们很多思路和灵感,以及一些拓展论文的信息。这篇论文的Intro给我们最大的启示便是他们在实际场景所要面临的核心问题。

As enterprises continue to expand, interaction service demands have become more diversified, round-the-clock, and large-scale.

在商业环境下,多样化、全天候和大规模化是业务发展的必然趋势,也是目前各个大模型场景真实地所必须面临的核心问题。我理解其实很多论文所聊的关键问题或者痛点和实际应用差距很远,挺多都是先射箭后画靶,但这篇所提的问题确实是非常痛。

除此以外,文章还提到了自己对应场景所面临的核心问题。美团的核心业务就是本地生活服务,具有如下特点。

  • 对话交互呈现周期性波动和高并发。

  • 交互角色复杂,用户、商家、骑手等,而且涉及多方参与,场景复杂。

  • 用户对即时、准确的高预期。

这些分析都能看出,整个作者团队对实际场景应用的洞察还是非常清晰的,我们除了要吸收论文的方案,问题发掘和梳理的思路也非常值得品味。

当然了,最终还是要回归到论文核心想要解决的5个难题,这才是论文的落脚点,即数据构建、多轮对话能力、业务变更频繁、单模型能力局限性、开放域标准答案缺乏的问题,这5个问题,确实也是我们日常非常容易遇到的,这里确实是我们的痛点了。

模型选择

即使是模型选择这一章,总体读下来,思路很流畅,给你把整个方案的前因后果都讲明白了,即使没什么公式吧,也能体会到作者整个思路历程。

下面的篇幅还挺长,很可能大家看着看着会觉得懵,像是鬼打墙似的,所以我先把整体思路按照我的理解讲一遍。

模型思路

整章涉及4个训练的步骤,各自有各自的倾向性,从关注基础能力向交互和内容生成逐渐过渡,逐渐形成了可靠的对话模型。

  • 持续预训练。此步的目标是写入专业知识,同时要平衡通用能力和领域能力。

  • SFT阶段。将基座模型和领域知识、智能交互风格对齐。

  • 偏好学习。更关注智能交互,确保大模型生成的内容符合实际的业务标准。

  • 推理增强。强调模型对复杂业务规则的推理适应,使之能更好的学会并使用规则。

持续预训练

对特定领域而言,大模型只有具备专业知识,效果才能足够好,简单的后训练并不能很好地解决这个问题,只能靠持续的预训练来提升,而目前持续预训练会面临两大挑战。

  • 通用能力和领域能力直接的平衡。

  • 构建高质量、逻辑完整且精细化的领域数据。

在通用能力和领域能力的平衡上,作者考虑到灾难性遗忘(原有知识被覆盖)和数据分布迁移(缺少原始预训练语料的细粒度信息,数据质量不足,导致原始通用能力下滑),提出了精选高质量通用数据、自适应数据配比两个方案来解决,尤其是后者,作者通过小比例模型的效果实验推理出最优比例,最终在大模型的训练使用该比例,结果发现是有收益的。(论文内有提及80%的通用数据,这个配比会比较合适,但这个比例的适用性有多大有待验证)

而领域数据,通常来源多样、知识密度低、质量参差不齐且冗余严重,因此需要构造严格的精选pipeline。

  • 除常规过滤外,引入强模型质量打分。

  • 采用对话思维链重写(CoT Rewriting)增强推理。

  • 考虑部分子集可能会对整体模型有影响,因此会用小模型先尝试性进行训练并观测专属数据集上的PPL变化。

SFT

sft阶段的任务是将基座模型和领域知识、智能交互风格对齐,此处有如下贡献点。

  • 质量优于数量的轻量级sft范式。在预训练好的大模型下,不足1万的高质量数据,即可达到和百万级数据接近的效果,迭代速度从每周一版变成每周3-4版。

  • 对话与动作的统一建模。通过sft,一次生成语言回复和工具命令,降低推理消耗,确保言行一致。

  • 融合数据驱动模式(我理解是通过数据训练模型)的高业务表现和知识驱动(我理解是通过数据库、规则等模式调整)的高灵活性,构造数据-知识双驱动方法。

这个数据-知识双驱动方法,是一套非常完整的技术方案,有如下流程。

  • 数据集层面,既包括知识驱动生成器产出的知识操作数据,也包括大量不含显式知识或推理痕迹的人工对话。这里,为保证数据质量,会有3层数据质量保障机制:对生成推理链进行自我一致性检查、与约束规则及相关知识进行冲突检测、验证智能体回复与可执行计划是否对齐。而针对这两种异构数据(知识数据和人工对话数据),会进行对齐。而且,还有个细节,只有在检索到知识才会触发CoT。

  • 操作数据+人工对话和通用数据按6:4的方式进行sft,随后进行强化学习。

  • 推理阶段包含知识检索与响应生成两个模块(我理解就是RAG了),有知识召回时会先评估后再利用,无知识召回则依赖模型内化能力补充。

为此,还搭配了提示工程、知识生产、知识注入、数据质量控制这4个关键组件来确保整体的稳定性。我调重点的讲。

  • 知识生产部分会将领域拆解为原子化单元,提升检索精度的同时,有效降低后续热插拔的影响,每条知识都包含背景上下文、高频用户问题、解决方案脚本。

  • 按认知复杂度与内容,知识被分为四类:问答咨询、监管文档、流程工单、碎片化知识。

  • 为了应对知识召回不足的问题,可通过基于话题标签一次性拉取的方式,或者对话式内化的方式(收集高质量自采数据并继续训练模型,使知识内化为参数;我理解前文提到的加入人工对话也有这个作用,鼓励模型主动内化和主动推理使用)来解决。

  • 构造完整的数据筛选流程,先用规则+人工的方式选择合适的对话,再用基于LLM的判别器过滤检索知识的相关性,并检查原始智能体回复是否遵从所选知识,对于无知识覆盖的轮次,可参考人工坐席回复来改写,形成“知识选择-知识利用-回复构建”的CoT模式。

自我检测回流迭代机制

自我检测回流迭代机制属于SFT阶段,只是因为内容比较多所以单开一节。

对在线服务中出现的问题,会进行必要的质量监测与数据回流,然后进行迭代优化,这套流程下来,整个自动化更新的流程就完成了。

首先是检测,一方面,确保在线回复的合规性与安全性;另一方面,准确捕捉生产环境中的高质量错误案例,以支撑系统的持续优化(PS,监控与回流这个事,先别说做不做,就是要做这个事的意识,就已经很有价值了)。其实后续的流程非常简单。

  • 策略识别。识别对应的场景与服务策略。

  • 检查执行。针对每条策略,系统从分层多级规则库中检索一组待检查的规则项,并按优先级排序,检查回复是否满足规则。

    • 基于规则的在线检查,如字符串匹配。

    • 精细的离线收集,离线就可以用大模型之类的模式来深度检测了。

另外,把注意力聚焦在交互的升级上,毕竟随着业务场景与用户需求的持续变化,智能交互模型须具备动态感知与适应能力。

  • 训练数据主要来源于标注记录,覆盖率不足(而且都是以前的规则),线上线下存在差距。

  • 模型缺少自我迭代机制。

  • 交互模型的拟人度不足,回复生硬。

迭代优化,会分两个方面,好案例和坏案例。人工评估员或模拟用户模型对“解决方案正确性”“对话质量”“满意度”进行打分,好案例的要求会更高,方案正确、对话质量高、用户满意度高,坏案例基本就是一票否决了。

  • 好案例来自自动检索,预处理完后,会用预定义的结构规范化,并用分层采样确保类型覆盖率,然后开始质量评估,即上面提到的“解决方案正确性”“对话质量”“满意度”,保留高质量数据。

  • 坏案例则是会分析识别对话问题的根源(重复、生硬表达等),并用经SFT训练的开源重写模型去重与优化,然后把对错结果送给RL模型训练。

偏好学习

DPO是能实现人类偏好的重要方案,他能通过比较人类标注数据去微调模型,省去了中间奖励模型的训练,提升训练效率。DPO的原理此处就不赘述了,我们更多关注整个pipeline是怎么做的吧。

首先先给出一些模型日常比较容易遇到的问题。这些问题真的挺常见的,真的就是我们日常容易看到的问题。

  • 用户需求未澄清:模型未能主动澄清用户需求。

  • 冗余询问:模型反复索要用户已提供或模型已从外部获取的信息。

  • 幻觉:模型向用户输出虚假或无依据的信息。

  • 脚本重复:模型持续重复先前脚本内容,无法有效解决问题或安抚情绪。

  • 错误解决方案:模型针对用户需求给出错误方法。

  • 应付补偿未提出:在适用主动补偿的场景中,模型未建议补偿,导致体验不佳。

  • 补偿信号未遵从:当补偿信号明确时,模型仍未按信号执行,体验较差。

  • 流程推进失败:模型无法有效推进处理流程。

为此,整个优化流程如下图所示。

  • 识别bad case。

  • 对bad case进行规则总结。

  • 测试验证规则合规性并避免异常。边界条件需要充分考虑正则信息的抽取(此处就用的是regex extraction),同时还要保证持续更新prompt以确保整个检测流程的正确性。

  • 由标注员、模型与基于规则的系统共同完成数据标注。

  • 数据筛选处理,完成训练数据准备流程。

  • 开始DPO训练,让模型学会新的规则。

  • 回归测试,一方面确保新的规则能学到,另一方面要求对老的规则要有足够的表现,避免灾难性遗忘。

  • 新模型部署,完成新的循环。

整套流程挺自然而且简单的,但是有了这个框架,思路会更清晰,不容易遗漏。

推理增强

这一节主要讲的是提升模型对话和知识遵循能力的方法。这里实际上是两步,一个是多约束条件下的知识遵循能力,另一个是前文有提到的“数据-知识”混合驱动的强化推理方案。

在本文,结合美团自己场景特色,将复杂指令归结为多约束、多任务、复杂知识融合三类,并进一步细化为十二个子类,以实现更有针对性的数据挖掘与合成,满足应用的多样化需求。

(下面这段为避免丢失关键信息,我是基于AI工具直接翻译的,有做过简单的修正)

首先,先进行数据挖掘和合成,利用复杂指令类别与定义,我们采用LRM( Large Rule-based Model)对大规模业务指令数据集进行自动标注与挖掘。对缺失类型,通过自主创建、复杂度演化与集成进行数据合成,并以persona、分支数、约束及任务类型为指导,解决模板难题。种子数据按正确性、完整性、简洁性打分,剔除低质量或不合逻辑指令。

此处还需要一个难度评估工具。通过采样回复并在不同能力模型间投票,评估指令难度,剔除过于简单且分布相似的数据以保留整体难度。使用DeepSeek-R1等开源基准模型生成回复与思维链,对已验证数据,将R1预测与标准对比,选择一致的思维链,对未验证数据,多次采样R1回复并由模型择优。该过程产出高质量复杂指令数据,提升模型理解与知识遵循能力。

大多数复杂指令缺乏标准答案,刚性验证不可行。对可验证数据,采用规则匹配计算奖励;对不可验证数据,使用DeepSeek的Self-Principled Critique Tuning (SPCT) 进行基于原则的强化。SPCT生成评估原则并自动产出奖励分数;与GRM不同,原则生成与判断解耦,借助DeepSeek-R1预训练提升原则质量并显著降低 RL 训练成本。强化过程中使用 Qwen2.5-32B 作为 GRM 进行基于原则的打分。

我理解这个部分是给出了一个非常直观,很可以抄作业的数据合成模式。挖掘生成、难度评估、内容验证等,都已经覆盖,我们可以吸收这里的经验来提升自己的方案。

继续,智能交互系统需要认知智能与情感智能并重,前文仅提及在复杂规则下的处理模式,但仍有两个关键问题。因此作者提出了数据驱动与知识驱动技术的混合方法。

  • 基座模型难以在复杂业务理解与自然交互之间取得平衡。

  • 业务流程的复杂性限制了短期优化措施,使模型适配困难。(这句话我读了好几次,我理解其实就是业务规则很复杂,适配困难)

  • CoT数据生成。此处要满足:推理路径清晰且按实际业务逻辑,推理内容必须准确,CoT 中所有信息需在输入数据中可验证,以避免捏造。这里显然人工标注成本高且易同质化,所以此处先用模型生成CoT,然后对引用知识执行正向与反向验证,最后进行人工审核,确保可靠性。

  • 先通过SFT对模型进行冷启动。用上述带有CoT的数据进行微调训练,使模型从通用模型向业务模型过渡,然后引入带CoT推理路径的“知识驱动”数据,并融入强化学习。

  • 此处强化学习的奖励函数,包括答案正确性(0.1/1)、知识引用正确性(0.1/1)、对话恰当性(0.1-1,包括答案相似度和相似惩罚)、CoT长度惩罚。

更进一步,在对话的人性化和情感方面,采用了两个方面的优化。

  • 利用GRM对对话质量进行多维评估,从而引导策略模型朝着更高人性化方向优化。

    • 基于规则的微调生成奖励模型(GRM),将对话拆分阶段并对每个阶段设计不同的评分方案,输出0/1二元分数后,结合实际场景进行再归一化。(此处别忘了评估一下和实际效果的一致性)

    • 训练后的GRM与RL微调策略模型。

  • 采用对话重写模型进一步提升智能交互回复的质量与情感表达力。

    • 设计合适的评估规则来评估重写结果和原结果,从而训练合适的重写模型,主要包括胜率、方案一致率及Good/Bad/Same占比(经典的GSB评价出现了)。

    • 该过程还涉及降级重写与风格转换,前者是指将优质回复转为机械、单一安抚或方案模糊的降级版本,作为对比样本,后者是指引入专用回复风格转换模块,确保重写回复在维持原方案的同时,风格与情感表达与高质量标准紧密对齐。

此后,终于到了最终的训练。

采用 SFT + RL 两阶段训练。核心要点如下。

  • 使用 BGE 嵌入模型计算生成回复与真值的语义相似度。

  • 在当前对话内使用 Jaccard 计算,若相似度超阈值则对该轮次惩罚减半。

  • 强化学习期间构建历史回复嵌入,与训练集当前回复对比,保持相似度超阈值的前5项。

小结

按照编辑器的字数统计,到这里已经接近6000字了,也只写了本文的三分之一多一点,内容真的非常充实而且丰满。读到这里讲一下我在模型思路上的这篇文章的一些比较重要的收获和思考吧。

  • 论文并没有很多的对模型内部的或者基座的修改,更多是从训练策略、数据、模块设计的思路来进行讨论的。值得注意的是,作者在一些部分其实有尝试对文章的方法,用不同模型进行实验,可以发现具有一定的鲁棒性,所以大家可以放心尝试。

  • 文章内出现大量的平衡,通用和领域的权衡,新知识和旧知识的平衡等。

  • 自动化更新循环。后三个阶段,即sft、偏好学习、推理增强中,都有提到自动化更新循环的过程,虽说每一步略有不同,但基本都可以抽象成一个pipeline,探测(探测错误内容)、更新修复(生成正确内容)、生成内容质检(检测生成内容正误)、训练(把知识学到模型内部)这4步,这个范式的建立是我们能让模型持续稳定学习的动力。

  • 有关更新循环这个事的方案细节,说实话文章讲的还不够细,我们只能吸收一些经验了。

    • 问题数据检测挖掘。在设计标准上(如合规性与安全性)、问题类型划分上(需求未澄清、冗余询问、幻觉等)、检测方式上(在线规则和离线大模型等),都只提及了部分。

    • 正确答案的收集与编写。提及了知识的拆解和类型划分,隐式规则数据(例如常规对话),大模型生成或重写等。

    • 生成内容质检。检测原有问题是否成功修改、是否有引入新问题等。

    • 训练。训练层面讲的其实真不算多,更多就是RL内的奖励函数设计,这点在实践中确实还挺关键的,另外在实用大模型之类的模型打分时记得要关注他和实际业务或者人工的一致率。

这里的很多内容,都挺具有实践意义和价值的,但单独拿出来,除了整个框架本身之外的细节,都不足以发论文,工作量和创新性都不够,而现在这篇论文以框架和整体设计思路的方式组装放出来,就很合适。


Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐