引言

当今的大型语言模型(LLMs)作为会话式交互界面(如ChatGPT、Gemini、Claude),允许用户通过多轮对话与模型互动。这种交互方式不仅能在用户明确需求时(即能通过指令完整说明要求)提供帮助,更能在用户需求不明确时发挥作用——后者往往从模糊指令出发,通过轮次交互逐步澄清需求。尽管LLM对话日志研究已证实用户指令的模糊性普遍存在,现有评估体系通常仍基于单轮完整指令场景。

虽然越来越多研究开始采用多轮方式评估LLMs,但本文(第2章)发现:既往工作大多将会话视为片段式任务——对话轮次间虽存在关联,但可解构为若干能独立评估的子任务集合。认为这种片段化评估偏离了人类对话的核心特征:模糊指令的渐进澄清

本文针对这一效应研究了多种解释,发现大语言模型倾向于:

  • 生成过度冗长的回复

  • 在对话中过早提出最终解决方案

  • 对未明确细节做出错误假设

  • 过度依赖先前(错误)的作答尝试

研究结果揭示了模型实际应用场景与评估方式之间的脱节——多轮交互中普遍存在的性能退化可能是AI系统采用率低的原因,尤其对新用户而言,他们更难以在对话初始阶段提供完整详尽的指令。

模拟未明确指定的多轮对话

分片过程:从完整指令到分片指令

图2列出了GSM8K中一条完整规范的原始指令及其对应的分片指令范例。原始指令采用单一句式一次性呈现所有内容:包含高层级问题(如"[...]需要多长时间?")、背景信息和条件约束。分片指令则由若干分片组成,每个分片仅呈现原始指令中的一个独立元素。

具体而言,分片指令的首个分片(分片1)始终阐明指令的高层目标,后续分片则逐项提供细化说明。这些分片组合起来所传递的信息与完整规范指令完全等同,只是信息被显式地划分到不同分片中。

分片对话模拟

图3展示了基于分片指令模拟多轮未充分说明对话的过程。

模拟类型

  • FULL:模拟单轮次、充分指定的对话场景,其中初始指令在第一轮即提供给大语言模型。

  • SHARDED:模拟上述所描述的多轮次、未充分明确的对话。

  • CONCAT:模拟基于分片指令的单轮、全指定对话。分片内容以 bullet-point 形式(每行一个分片)拼接为单一指令,并在其前附加要求:完成任务时须综合考虑所有 bullet-point。

  • RECAP:RECAP模拟了一种分片式对话(SHARDED),并在最后添加一个概括轮次,将所有指令片段整合到单轮对话中,为语言模型提供最终响应机会。

  • SNOWBALL:在每一轮对话中,用户模拟器不仅会引入一个新的信息片段,还会重述当前对话中已披露的所有片段,从而产生滚雪球效应。

任务与指标选择

任务选择

本文为六项任务构建了分片指令,并将其应用于大规模模拟实验。精心挑选了编程与非编程领域中具有代表性和多样性的生成任务。图5展示了每项任务原始指令与分片指令的对照示例。

 

指标

  • 平均性能:模型在给定模拟类型中对某指令得分的无偏估计值。

  • 胜任度:模型在某指令上90分位数得分的估计值,作为最佳情况指标反映前10%模拟中的表现。

  • 不可靠性:90分位数与10分位数之间的跨百分位范围估计值,通过衡量最佳与最差情况模拟的差距,量化大语言模型随机性导致响应质量的波动程度。

结果

平均表现结果

表1汇总了模拟实验的结果。总体而言,在对比FULL(完整模式)与SHARDED(分片模式)性能时,所有模型在每个任务上的表现均出现下降,平均降幅达-39%。本文将此现象命名为"对话迷失":在实验室环境下(指令完整、单轮对话)能达到优异表现(90%+)的模型,在更贴近现实的非完整指令、多轮对话场景中执行相同任务时表现显著下滑。

相比之下,模型在CONCAT(拼接模式)下的表现基本持平,其平均性能达到FULL模式的95.1%。这表明SHARDED模式的性能损失不能归因于分片指令可能造成的信息缺失,否则CONCAT模式也应出现性能下降。

我们注意到较小模型(Llama3.1-8B-Instruct、OLMo-2-13B、Claude 3 Haiku)的CONCAT降幅更为明显(86%-92%),这暗示小模型的泛化能力不及大模型:对指令表述的轻微调整会对其性能造成更大影响。这种对复述的敏感性在表1中直观可见:红色背景标注的CONCAT性能降幅在上方(较弱模型)比下方(较强模型)更为显著。

能力与可靠性分析、渐进式分片实验

  • 在单轮对话场景中,能力越强的模型通常可靠性越高

  • 在多轮次、欠规范设置中,所有测试模型均表现出极高的不可靠性,针对固定指令的最佳与最差模拟运行之间,性能平均下降50个百分点。

  • 任何涉及未充分说明且在两个或更多话轮中进行的对话都会导致模型在对话中迷失方向。

消融实验

智能体场景

为了模拟智能体对话场景,本文在RECAP(回溯式)与SNOWBALL(滚雪球式)上进行了评估。

表2汇总了两款测试模型(GPT-4o与GPT-4o-mini)在四个任务(代码、数据库、数学、操作指令)上的全部结果。RECAP和SNOWBALL均展现出一定成效,相对SHARDED模拟有所提升,但性能仍落后于FULL或CONCAT。

温度影响

LLM本质是概率系统,其参数(如温度值)可调节文本生成时的随机程度。由此产生一个可能的论点:将温度设置为最低值(T=0)是否有效解决可靠性问题?因该设置会使生成过程更趋(但非完全)确定性?

为验证该论点,本文进行了补充实验:将助手的响应生成温度(AT)调整为1.0、0.5和0.0三个数值。

结果表明:降低大语言模型生成响应时的温度参数,并不能有效提升系统可靠性。

翻译任务

为验证新任务分片的可行性并理解分片兼容性要求,本文针对第七项任务(翻译)准备了分片式指令。

若任务具有片段化特征(即可分解为回合级子任务),模型通过独立完成各子任务即可避免在多轮对话中迷失,而无需处理跨回合上下文。简言之,SHARDED翻译任务模拟的是具有明确规范的多轮对话。

实用建议

若时间允许,建议重新尝试

当与LLM的对话未达预期时,开启新会话并重复相同信息可能比延续当前对话获得更优结果。这是因为现有LLM存在对话迷失现象,且实验证明持续纠缠于同一对话收效甚微。此外,由于LLM文本生成具有随机性,新对话可能产生质量更高的输出。

在重试前进行信息整合

由于大语言模型难以有效处理分散在多轮对话中的信息,将指令要求整合为单一指令是提升模型表现和可靠性的有效策略(如CONCAT实验所示)。

当用户发现模型在对话中迷失方向时,可要求大语言模型"请汇总我目前告知你的所有内容",随后将回复内容导入新对话,从而避免人工整合的繁琐。

实践中有迹象表明,基于大语言模型应用的早期使用者已意识到模型存在对话迷失现象。例如Cursor代码编辑器的用户反馈显示,尽管该工具支持无限延续对话,但"尽可能频繁地创建新对话"仍是确保高质量响应的推荐策略。

论文:https://arxiv.org/abs/2505.06120v1 (2025.05 arXiv)


内容来源:IF 实验室

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐