1 论文介绍

随着大语言模型(LLMs)的快速发展,与辩论相关的任务——例如论点质量评估和辩论过程模拟——已经取得了显著进展。

然而,现有辩论评估方法主要集中在对单个论点进行评估(Deshpande 等,2024),并且严重依赖主观性评价,缺乏对整个辩论过程进行全面评估的能力

为了解决这些相互关联的挑战,我们提出了一个由两个核心组成部分构成的框架:
(1)InspireScore:一种新的评估体系,构建了一个多维度的评估架构,包括四个主观指标(情感吸引力、论证清晰度、论证结构安排、主题相关性)以及两个客观指标(事实真实性和逻辑有效性);


(2)InspireDebate:一个优化的辩论框架,通过增强 CoT 推理、多维度 DPO(Direct Preference Optimization)以及基于 Web 的实时知识检索增强(Web-RAG)来实现分阶段优化。

2 评估框架

2.1 主观评价

引入四个维度:情感感染力(emotional appeal)、论点清晰度(argument clarity)、论证结构安排(argument arrangement)以及主题相关性(topic relevance)

InspireScore 设计了特定的提示词,对辩论双方在上述四个维度上进行评估。每个维度的最终得分按如下公式计算:

其中 

  • 每个主观维度(如 Emotional Appeal)不是一次性打分。
  • 而是对 辩论每一轮打一次分,然后求平均。

2.2 客观评价

包含两个指标:事实真实性 Fact Authenticity (SFA),逻辑有效性 Logical Validity (SLV)

事实真实性

  • 将辩论回答拆成多个独立事实
  • 用 LLM + Web 搜索做事实核验

真实事实数量/所有独立事实数量

具体操作:1. 事实提取:使用LLM将辩论文本分别为原子事实

2. 查询生成:利用 LLM 分析提取的事实,生成精确的搜索查询以检索佐证证据

3. 事实核查:将提取出的事实与网络搜索结果进行交叉引用,根据检索到的证据确定其真实性为真、假或未知

逻辑有效性

Step 1:自然语言 → 一阶逻辑(FOL)符号化

Step 2:逻辑推理检查,对这些符号表达式应用逻辑推理规则,系统地验证每一步推理是否能够逻辑地导向最终论证

  • N_i:第 i 轮的 argument expressions 数量
  • FOL_j^i:第 i 轮第 j 个论证的 FOL 表达式
  • v(\cdot):布尔函数,若可正确推导则返回 1,否则返回 0

3 辩论框架

  • SFT(监督微调) + CoT(链式思考):让模型学会条理化地进行推理并给出结构化论证。

  • DPO(直接偏好优化):让模型根据评审反馈学习更好的辩论策略。

3.1 SFT + CoT

近年来关于 System-2 思维(慢速、深度分析式推理)的研究推动了CoT和 Rephrase & Respond等逐步推理范式的发展,这些方法可以显著提升模型的逻辑推理能力。

作者设计了一个结构化的“辩论模板”,强制模型的输出包括:

  • 推理过程(CoT)
  • 最终论点(Argument Output)

结构化模板的作用:

  • 避免模型“直接拒答”
  • 强化模型输出的逻辑链条
  • 指导模型如何表达辩论观点

使用gpt-4o构建一个监督微调数据集 ,xi 为输入的辩论提示,yi 为对应的结构化响应。数据格式如下

通过训练这个数据集,模型能够学习如何输出包含推理过程与论证内容的结构化回答。

微调的目标是最大化在输入 x 条件下生成结构化输出 y 的概率。其损失函数为交叉熵:

通过微调,模型学会:

  • 更有逻辑地进行辩论
  • 输出结构化推理链
  • 提供结论并解释其推理依据

3.2 DPO

辩论由两个 LLM 协同执行,一个担任正方,一个担任反方,共同针对某一辩题展开论证

在正式给出论点之前,每一方都会先进行结构化的分析性推理,以全面思考自己的论证立场。

每场辩论包含多个回合,其数量可根据实验需求手动设定。

为了使模型的行为符合现实辩论中的评价标准,我们采用 DPO 进行优化。
不同于 RLHF 基于隐式的人类偏好信号,我们直接使用 InspireScore 提供的明确的、可量化的多维评价来进行微调。

不是“人类说哪个好 → 模型学”,而是:

  • 模型 A 和 B 的输出经 InspireScore(客观 + 主观指标)评分
  • 得分高的是 winner,得分低的是 loser

这样构成一个 DPO 数据对:

  • winner:更符合逻辑、更真实、情感更好、结构更清晰
  • loser:较差的辩词

DPO 就在训练模型模仿 winner。

3.3 Web-RAG

整个流程有两步:

(1)关键词提取

模型根据当前辩题,对方论点,自动提取关键词

调用搜索引擎查询网络资源

(2)利用检索结果构建论证

模型根据检索到的外部证据,分析、整理、引用、接入 CoT reasoning,最终生成辩论回答。

Web-RAG → 增强 factuality
InspireScore → 评估 factuality
InspireDebate(DPO) → 根据 factuality 进一步优化模型

4 实验

4.1 实验设置

四个开源大模型:

  • LLaMA-3.1-8B-Instruct
  • DeepSeek-R1-Distill-LLaMA-8B(简称 DeepSeek-R8B)
  • Phi-3.5-mini (3.6B)
  • Qwen-2.5-1.5B-Instruct

经过 InspireDebate 的 SFT + DPO 两阶段训练
最终得到 “Inspire-LLaMA-8B” / “Inspire-Qwen-1.5B” 等增强辩论版本

两个商业模型:

  • GPT-4o-mini
  • o1-mini

作为评测用的baseline

数据集

710个辩论主题:

SFT 阶段的 instruction 数据生成

100个,用 GPT-4o 生成带推理链 & 结构化辩论输出

DPO 阶段用来生成 preference pairs 的辩论模拟数据

510个,Modelle 互辩,InspireScore 打分形成偏好对

最终测试 InspireScore + InspireDebate 的效果

100 个,用于evaluation

4.2 InspireScore Analysis

构建人工标注的评估数据集

用经过 SFT 优化后的 LLaMA-8B,在 100 个测试辩题上进行辩论。

每个辩题有正反双方,共100 × 2 = 200 条辩论回答

请 3 个具有硕士学历且有辩论经验的人类评审,对每条回答,从6 个维度进行评分。

与人类评分进行相关性对齐

通过三种统计相关性:

  • Pearson(线性关系)
  • Spearman(排序关系)
  • Kendall(更鲁棒的排序一致性)

与多个基线比较,将Debatrix(之前的最强 debate-evaluator)作为主要对比基线

InspireScore 比 Debatrix 的平均相关性高 44% → 对人类的判断最接近

泛化测试:真实人类辩论数据(DebateArt)

使用 Debatrix 提出的 DebateArt 真实人类辩论数据集(100 场真实比赛)

任务是:预测胜者是谁

评估指标是 RMSE(预测得分 vs 真实结果差距)

意味着 InspireScore 不仅仅在模型辩论上有效,也能评估真实世界的人类辩论

4.3 InspireDebate Analysis

让 10 个模型两两互相 PK(多轮辩论),每个模型参与 1800 场辩论,用 InspireScore 和人工评分衡量它们“辩论能力”的高低。包括:

  • 4 个开源基础模型(baseline)
    • LLaMA-8B
    • Phi-3.6B
    • Qwen1.5B
    • Deepseek-R1-8B
  • 4 个优化后的模型(基于 InspireDebate 微调后)
    • Inspire-LLaMA-8B
    • Inspire-Phi-3.6B
    • Inspire-Qwen1.5B
    • Inspire-Deepseek-R8B
  • 2 个商用闭源模型(GPT-4o-mini、o1-mini)
    • GPT-4o-mini
    • o1-mini

自动评价:InspireScore

对于每场辩论,计算双方的 argument score,包括主观维度(情感吸引力,表达清晰度,结构组织,主题相关性),客观维度(事实准确性,逻辑有效性)

人工评测

让人类评委在部分话题上对优化前后的模型进行对比,投票选择更好的辩手,衡量“人类更倾向于哪个版本”

实验结果显示,基于 InspireDebate 优化后的开源模型在主观与客观维度均显著提升,部分能力接近或超过闭源商业模型,证明该框架能够有效增强模型的论证、结构化推理与事实一致性能力。

4.4 消融实验

评估InspireDebate框架中三个关键组件的贡献

  • SFT ——学习结构化辩论方式,是主观维度提升的关键
  • DPO —— 利用多维专家反馈进行偏好对齐
  • Web-RAG —— 通过实时检索提升事实性,明显提升客观维度

InspireScore维度分析

InspireScore 的 6 个维度是否真的“有效”“互相独立”“反映人类判断”?

图中可以看出,前四项主观维度相关性较高,说明在人类辩论评分中,评价往往受到表达质量、流畅性、结构、吸引力等主观因素影响较大。InspireScore 的这四个主观维度与人类的判断方向一致,因此相关性较高。

客观维度相关性较低,因为人类评分不能完全代表逻辑/事实质量,所以InspireScore 引入客观维度非常必要

六个维度与人类判断的相关性均未超过0.5,而InspireScore多维Pearson达到0.64,最终整体相关性最高,说明多维加权比单维更接近人类的最终判断方式,有效建模了人类整体评价逻辑

5 结论

InspireScore(评估体系):这是一个结合主观维度(情感诉求、清晰度、安排、相关性)与客观维度(逻辑有效性、事实真实性)的 统一评分体系。InspireScore 通过整合 6 个维度,使评分更接近人类辩手的判断。

InspireDebate(优化框架):提升模型辩论能力,包括三大机制

局限

(1)维度之间存在 trade-off:6 个维度各自独立优化,会出现互相影响问题,多目标优化中各目标之间缺乏统一的 global optimization 机制。

(2)规模化和计算成本高:多维 DPO(6 个 reward model)Web-RAG 实时检索(对每句话都要查证),可以尝试使用更高效的奖励学习范式,例如 DeepSeek-R1 的 reward-style 自监督改进路径。

(3)缺少处理“矛盾奖励信号”的机制:模型在训练时可能收到:逻辑奖励 → 惩罚 A 句子,情感奖励 → 奖励 A 句子(因为更生动),它不知道“谁更重要”,造成全局 suboptimal

(4)不同 debate 类型需要不同评分体系,固定 6 个维度缺乏弹性。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐