InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-GuidedReasoning and Optimization f
1 论文介绍
随着大语言模型(LLMs)的快速发展,与辩论相关的任务——例如论点质量评估和辩论过程模拟——已经取得了显著进展。
然而,现有辩论评估方法主要集中在对单个论点进行评估(Deshpande 等,2024),并且严重依赖主观性评价,缺乏对整个辩论过程进行全面评估的能力
为了解决这些相互关联的挑战,我们提出了一个由两个核心组成部分构成的框架:
(1)InspireScore:一种新的评估体系,构建了一个多维度的评估架构,包括四个主观指标(情感吸引力、论证清晰度、论证结构安排、主题相关性)以及两个客观指标(事实真实性和逻辑有效性);

(2)InspireDebate:一个优化的辩论框架,通过增强 CoT 推理、多维度 DPO(Direct Preference Optimization)以及基于 Web 的实时知识检索增强(Web-RAG)来实现分阶段优化。

2 评估框架

2.1 主观评价
引入四个维度:情感感染力(emotional appeal)、论点清晰度(argument clarity)、论证结构安排(argument arrangement)以及主题相关性(topic relevance)
InspireScore 设计了特定的提示词,对辩论双方在上述四个维度上进行评估。每个维度的最终得分按如下公式计算:

其中 ![]()
- 每个主观维度(如 Emotional Appeal)不是一次性打分。
- 而是对 辩论每一轮打一次分,然后求平均。
2.2 客观评价
包含两个指标:事实真实性 Fact Authenticity (SFA),逻辑有效性 Logical Validity (SLV)
事实真实性
- 将辩论回答拆成多个独立事实
- 用 LLM + Web 搜索做事实核验

真实事实数量/所有独立事实数量
具体操作:1. 事实提取:使用LLM将辩论文本分别为原子事实
2. 查询生成:利用 LLM 分析提取的事实,生成精确的搜索查询以检索佐证证据
3. 事实核查:将提取出的事实与网络搜索结果进行交叉引用,根据检索到的证据确定其真实性为真、假或未知
逻辑有效性
Step 1:自然语言 → 一阶逻辑(FOL)符号化
Step 2:逻辑推理检查,对这些符号表达式应用逻辑推理规则,系统地验证每一步推理是否能够逻辑地导向最终论证

:第 i 轮的 argument expressions 数量
:第 i 轮第 j 个论证的 FOL 表达式
:布尔函数,若可正确推导则返回 1,否则返回 0
3 辩论框架
-
SFT(监督微调) + CoT(链式思考):让模型学会条理化地进行推理并给出结构化论证。
-
DPO(直接偏好优化):让模型根据评审反馈学习更好的辩论策略。
3.1 SFT + CoT
近年来关于 System-2 思维(慢速、深度分析式推理)的研究推动了CoT和 Rephrase & Respond等逐步推理范式的发展,这些方法可以显著提升模型的逻辑推理能力。
作者设计了一个结构化的“辩论模板”,强制模型的输出包括:
- 推理过程(CoT)
- 最终论点(Argument Output)
结构化模板的作用:
- 避免模型“直接拒答”
- 强化模型输出的逻辑链条
- 指导模型如何表达辩论观点
使用gpt-4o构建一个监督微调数据集
,xi 为输入的辩论提示,yi 为对应的结构化响应。数据格式如下

通过训练这个数据集,模型能够学习如何输出包含推理过程与论证内容的结构化回答。
微调的目标是最大化在输入 x 条件下生成结构化输出 y 的概率。其损失函数为交叉熵:
![]()
通过微调,模型学会:
- 更有逻辑地进行辩论
- 输出结构化推理链
- 提供结论并解释其推理依据
3.2 DPO
辩论由两个 LLM 协同执行,一个担任正方,一个担任反方,共同针对某一辩题展开论证
在正式给出论点之前,每一方都会先进行结构化的分析性推理,以全面思考自己的论证立场。
每场辩论包含多个回合,其数量可根据实验需求手动设定。
为了使模型的行为符合现实辩论中的评价标准,我们采用 DPO 进行优化。
不同于 RLHF 基于隐式的人类偏好信号,我们直接使用 InspireScore 提供的明确的、可量化的多维评价来进行微调。
不是“人类说哪个好 → 模型学”,而是:
- 模型 A 和 B 的输出经 InspireScore(客观 + 主观指标)评分
- 得分高的是 winner,得分低的是 loser
这样构成一个 DPO 数据对:
- winner:更符合逻辑、更真实、情感更好、结构更清晰
- loser:较差的辩词
DPO 就在训练模型模仿 winner。
![]()
3.3 Web-RAG
整个流程有两步:
(1)关键词提取
模型根据当前辩题,对方论点,自动提取关键词
调用搜索引擎查询网络资源
(2)利用检索结果构建论证
模型根据检索到的外部证据,分析、整理、引用、接入 CoT reasoning,最终生成辩论回答。
Web-RAG → 增强 factuality
InspireScore → 评估 factuality
InspireDebate(DPO) → 根据 factuality 进一步优化模型
4 实验
4.1 实验设置
四个开源大模型:
- LLaMA-3.1-8B-Instruct
- DeepSeek-R1-Distill-LLaMA-8B(简称 DeepSeek-R8B)
- Phi-3.5-mini (3.6B)
- Qwen-2.5-1.5B-Instruct
经过 InspireDebate 的 SFT + DPO 两阶段训练
最终得到 “Inspire-LLaMA-8B” / “Inspire-Qwen-1.5B” 等增强辩论版本
两个商业模型:
- GPT-4o-mini
- o1-mini
作为评测用的baseline
数据集
710个辩论主题:
SFT 阶段的 instruction 数据生成
100个,用 GPT-4o 生成带推理链 & 结构化辩论输出
DPO 阶段用来生成 preference pairs 的辩论模拟数据
510个,Modelle 互辩,InspireScore 打分形成偏好对
最终测试 InspireScore + InspireDebate 的效果
100 个,用于evaluation
4.2 InspireScore Analysis
构建人工标注的评估数据集
用经过 SFT 优化后的 LLaMA-8B,在 100 个测试辩题上进行辩论。
每个辩题有正反双方,共100 × 2 = 200 条辩论回答
请 3 个具有硕士学历且有辩论经验的人类评审,对每条回答,从6 个维度进行评分。
与人类评分进行相关性对齐
通过三种统计相关性:
- Pearson(线性关系)
- Spearman(排序关系)
- Kendall(更鲁棒的排序一致性)
与多个基线比较,将Debatrix(之前的最强 debate-evaluator)作为主要对比基线

InspireScore 比 Debatrix 的平均相关性高 44% → 对人类的判断最接近
泛化测试:真实人类辩论数据(DebateArt)
使用 Debatrix 提出的 DebateArt 真实人类辩论数据集(100 场真实比赛)
任务是:预测胜者是谁
评估指标是 RMSE(预测得分 vs 真实结果差距)

意味着 InspireScore 不仅仅在模型辩论上有效,也能评估真实世界的人类辩论
4.3 InspireDebate Analysis
让 10 个模型两两互相 PK(多轮辩论),每个模型参与 1800 场辩论,用 InspireScore 和人工评分衡量它们“辩论能力”的高低。包括:
- 4 个开源基础模型(baseline)
- LLaMA-8B
- Phi-3.6B
- Qwen1.5B
- Deepseek-R1-8B
- 4 个优化后的模型(基于 InspireDebate 微调后)
- Inspire-LLaMA-8B
- Inspire-Phi-3.6B
- Inspire-Qwen1.5B
- Inspire-Deepseek-R8B
- 2 个商用闭源模型(GPT-4o-mini、o1-mini)
- GPT-4o-mini
- o1-mini
自动评价:InspireScore
对于每场辩论,计算双方的 argument score,包括主观维度(情感吸引力,表达清晰度,结构组织,主题相关性),客观维度(事实准确性,逻辑有效性)

人工评测
让人类评委在部分话题上对优化前后的模型进行对比,投票选择更好的辩手,衡量“人类更倾向于哪个版本”

实验结果显示,基于 InspireDebate 优化后的开源模型在主观与客观维度均显著提升,部分能力接近或超过闭源商业模型,证明该框架能够有效增强模型的论证、结构化推理与事实一致性能力。
4.4 消融实验
评估InspireDebate框架中三个关键组件的贡献

- SFT ——学习结构化辩论方式,是主观维度提升的关键
- DPO —— 利用多维专家反馈进行偏好对齐
- Web-RAG —— 通过实时检索提升事实性,明显提升客观维度
InspireScore维度分析
InspireScore 的 6 个维度是否真的“有效”“互相独立”“反映人类判断”?

图中可以看出,前四项主观维度相关性较高,说明在人类辩论评分中,评价往往受到表达质量、流畅性、结构、吸引力等主观因素影响较大。InspireScore 的这四个主观维度与人类的判断方向一致,因此相关性较高。
客观维度相关性较低,因为人类评分不能完全代表逻辑/事实质量,所以InspireScore 引入客观维度非常必要
六个维度与人类判断的相关性均未超过0.5,而InspireScore多维Pearson达到0.64,最终整体相关性最高,说明多维加权比单维更接近人类的最终判断方式,有效建模了人类整体评价逻辑
5 结论
InspireScore(评估体系):这是一个结合主观维度(情感诉求、清晰度、安排、相关性)与客观维度(逻辑有效性、事实真实性)的 统一评分体系。InspireScore 通过整合 6 个维度,使评分更接近人类辩手的判断。
InspireDebate(优化框架):提升模型辩论能力,包括三大机制
局限
(1)维度之间存在 trade-off:6 个维度各自独立优化,会出现互相影响问题,多目标优化中各目标之间缺乏统一的 global optimization 机制。
(2)规模化和计算成本高:多维 DPO(6 个 reward model)Web-RAG 实时检索(对每句话都要查证),可以尝试使用更高效的奖励学习范式,例如 DeepSeek-R1 的 reward-style 自监督改进路径。
(3)缺少处理“矛盾奖励信号”的机制:模型在训练时可能收到:逻辑奖励 → 惩罚 A 句子,情感奖励 → 奖励 A 句子(因为更生动),它不知道“谁更重要”,造成全局 suboptimal
(4)不同 debate 类型需要不同评分体系,固定 6 个维度缺乏弹性。
更多推荐


所有评论(0)