Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate
原文代码:https://github.com/Skytliang/Multi-Agents-Debate

标题翻译:通过多代理辩论促进大语言模型中的发散性思维

1. 内容介绍

1.1. 背景

LLM在复杂推理任务上仍然有问题,解决方法的一个代表性的策略是自我反思,但它高度依赖于LLM的自我评估能,没有保证

这种自我反思存在"思维退化" ( Degenation-of-Throught,DoT )问题:一旦LLM对其解决方案建立了信心,即使其最初的立场不正确,也无法通过反思产生新的想法

为了解决DoT问题,提出了一个多代理辩论( Multi-Agent Debate,MAD )框架:多个代理以“针锋相对”的状态表达他们的论点,一名裁判管理辩论过程以获得最终解决方案。MAD框架鼓励LLM的发散思维,这对需要深层思考的任务非常有帮助


造成DoT问题的原因

  1. 偏见和扭曲的观念:在预训练期间从大量数据中学到了偏见或扭曲思维,自我反思过程可能会本能地得出不准确的结论

  2. 僵化和对变化的抵制:自我反思通常涉及挑战自己的信念的行为。如果一个LLM抵制变化,可能会难以进行有意义的自我反思

  3. 有限的外部反馈:自我反思主要是一个内部过程,但外部反馈可以提供有价值的观点和见解。如果不考虑外部反馈,LLM可能会忽略重要的盲点


MAD框架核心思想

  1. 一个代理人的扭曲思维可以被其他人纠正;

  2. 一个代理人对变化的抵抗会被其他人补充;

  3. 每个代理人可以从其他人那里获得外部反馈

因此,MAD缓解了DoT,可以探索不同的思维链,以达到准确的答案


与之前Du的LLM多代理辩论(文献笔记)的区别:

  1. 引入了一个具有自适应中断机制的额外裁判,来决定辩论的最佳结束时机

  2. 工作旨在解决LLM的DoT问题

  3. 凭经验证明,MAD框架可以使用增强具有相同LLM的代理的性能


反直觉算术推理的例子:

两圆外切,不存在相对滑动。圆A的半径为圆B的半径的1 / 3,圆A绕圆B滚动一周回到起点。圆A总共旋转多少圈

在这里插入图片描述


2. 研究方法

MAD框架三个组件:

  • 元提示词(Meta Prompts):介绍要解决的主题、辩手数量、迭代限制以及其他要求,控制了辩论的激烈程度
    在这里插入图片描述

  • 辩手(Debater):在框架中涉及N个辩论者Di。在每次辩论迭代中,辩论者Di按固定顺序依次发言,并根据先前的辩论历史H表达自己的论点

    在这里插入图片描述

  • 裁判(Judge):一个裁判J来管理和监控整个辩论过程。包含两种不同的模式:(a)辨别模式,在这种模式下,裁判J决定在当前迭代中所有辩论者完成他们的论点后是否可以得到正确的解决方案;(b)提取模式,裁判J需要根据整个辩论历史H提取最终解决方案,因为在辩论的迭代限制内未找到正确解决方案。
    在这里插入图片描述


3. 实验

3.1. 实验设置:

  • 5基线

    • 自我反思(Self-Reflect):这种方法要求LLM在将其翻译完善之前不断反思,直到认为输出令人满意

    • 重新排名(Rerank):对LLM的翻译进行四次抽样,然后根据质量估计(QE)选择最佳候选

    • 地图(MAPS):这种方法使LLM能够模仿人类翻译过程,在翻译之前先进行分析

    • 思维链(CoT):这种方法用一个触发性提示词“让我们一步一步地思考”连接到测试问题上

    • 自我一致(Self-Consistency):该方法对多个回答进行采样,并通过多数投票确定最终答案

  • 任务:通过两项具有挑战性的任务对自然语言生成和理解进行了实验,即常识机器翻译(Common MT)和反直觉算术推理(Counter-Intuitive AR)。这两项任务的共同特点是,仅基于问题的表面表达直觉大多是错误的,需要更深层次的思考才能得到更好的答案。

    1. 常识机器翻译Commonsense Machine Translation:Common MT数据集由很多中译英组成,用于检查翻译模型解决三种模糊性的能力,包括词汇模糊和无上下文/有上下文的句法模糊。每个源句的真实翻译都需要对常识知识有适当的理解。虽然这些含糊不清的句子可能看似有一个直接的翻译,但这种字面解释是错误的。未能识别和解决这种歧义可能导致不准确的翻译。
      评估指标:采用自动指标如COMET6和BLEURT7等LLM翻译文献广泛采用的评估指标,还聘请专业人类翻译人员直接评估翻译结果,用1到5的范围评估翻译质量(3个专业评估人取平均分)
    2. 反直觉算术推理Counter-Intuitive Arithmetic Reasoning:造了一个数据集CIAR,主要是两个作用:
      1. 反直觉:问题中隐藏的陷阱,直觉上的答案通常是不正确的,用来评估LLM抵抗肤浅陷阱的能力。
      2. 多步推理:数据集中的每个正确答案都需要严格的多步推理过程,从而评估LLM参与复杂决策和问题解决的能力
        评估指标:用准确率(ACC)评估

3.2. 结果

实验结果表明,MAD框架优于基准方法

在这里插入图片描述

3.3. 常识机器翻译:

更注重特定单词的翻译准确性以及它们是否符合常识,引入了人类评估指标

在这里插入图片描述


由于DoT问题,自我反思无法纠正字面翻译。

在这里插入图片描述

而提出的MAD框架,可以探索不同的思维链,生成正确的翻译


3.4. 反直觉算术推理

通过生成的token数量来衡量成本,CoT方式为基准1,成本很大

在这里插入图片描述

但考虑到MAD在增强LLMs的发散性思维能力方面所提供的显著优势而不需要外部信号(与人类互动),这种成本增加被认为是可以接受的


在这里插入图片描述

MAD准确性最好,但不如GPT-4


3.5. 定性分析:主要在常识翻译上测试

3.5.1. DoT的缓解分析
  • Bias:观察到LLMs经常依赖直觉,这可能导致不正确或不恰当的反应。所以利用人类评估来确定LLMs的模糊错误率,检查LLM的输出是否存在bias

  • 多样性:LLMs对改变答案持抗拒态度且缺乏多样性反思。翻译的多样性是使用Self-BLEU分数进行评估的。更高的Self-BLEU分数意味着更低的多样性。通过以下方式计算文本多样性:Diversity = 100 − Self_BLEU (Cand1, Cand2)

在这里插入图片描述

MAD框架能减少偏差,增加多样性,缓解DoT问题


3.5.2. 对裁判的定性研究

在这里插入图片描述

  • 具有一个弱裁判和强大辩手比反之效果好。主要还是辩手回答的质量显著影响了MAD的性能上限,裁判的LLM规模不是那么重要

  • 在使用不同LLM模型作为辩手时,裁判可能不公正

    在这里插入图片描述

    • 通过计算裁判在不同情况下选择哪个辩手答案作为最终解决方案的次数来研究代理的行为
    • 当裁判和辩手全部使用同一个LLM时:裁判更偏袒反方,因为在面对复杂任务时,正方往往会犯错,反方会来纠正
    • 在使用不同llm时:发现裁判更偏袒于选择和自己一样的LLM

3.5.3. 对辩手的定性分析:主要讨论了辩手数量,辩论等级,辩论迭代次数对MAD框架的影响
  • 辩手数量的研究:理论上增加辩手数量会提高思维多样性,从而提高表现,但实际上不是
    在这里插入图片描述

因为随着辩手数量的增加,文本的长度和复杂性也增加。导致辩手在辩论过程中往往会忘记其他辩手的观点。对于裁判来说,从辩论中提取信息进行总结也变得更具挑战性。

在这里插入图片描述

MAD中能不能有更多辩手的关键挑战在于LLM处理长文本的局限性


  • 辩论等级的影响:辩手之间“针锋相对”(更高的分歧)的程度,主要是靠元提示词来控制

在这里插入图片描述

适当的针锋相对有利于有效的辩论。但不是“必须在每个观点上争论不休”,推测是因为持续的分歧太久没找到共同点导致了极化,这种辩论会更多地关注赢得论点而不是寻求真相或理解。可能会强化先入为主的偏见,使达成有意义的共识变得困难


  • 辩论轮数的影响:复杂的问题需要更多轮的辩论

在这里插入图片描述

默认最大轮数是3,当然裁判觉得已经有结论了可以直接停下(这个策略叫自适应中断

在大多数情况下,最佳答案可以通过一轮辩论实现,显示出MAD的效率

然而,在翻译更复杂的句子时,裁判需要额外的迭代,从辩论者那里收集足够的信息,然后做出最终决定

通过人工评价发现,MAD框架能带来性能改进,证明了其有效性。


3.6. 消融实验

详细研究一下这个自适应中断到底有没有用:

在这里插入图片描述

直觉上,较长的辩论会鼓励更多种类的思考。这引出了一个问题:如果被限制在特定的辩论轮结束,模型的性能会不会受到影响?

做了一个强制结束辩论的实验:对于每次迭代,强制裁判提取最终答案,而不像MAD那样自适应地中断辩论。

但最高的COMET分数出现在第一次迭代,也低于自适应中断的结果(82.0)。这说明,对于大多数示例,MAD可以在第一次迭代时生成良好的翻译,从而辩论应该停止。强制继续辩论将损害翻译结果,证明了自适应中断策略的合理性。


4. 结论

4.1. 主要贡献

  1. 提出并定义了自我反思中的思维退化(DoT)问题,并通过提出多智能体辩论(MAD)框架来解决它,以探索不同思维链。
  2. 也发现如果为代理使用不同的LLM,LLM可能不是一个公平的裁判

4.2. 局限

  1. 时间长,因为代理需要参与多轮辩论来提出和驳斥论点
  2. 在长情景中难以保持连贯性和相关性,LLM对长文本的上下文处理能力仍然是一个挑战
  3. 裁判不公正问题,为了减轻MAD框架中的这种偏见,建议所有角色,包括裁判和辩手,都使用相同的LLM,或者全使用不同的LLM
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐