论文:THoRR: Complex Table Retrieval and Refinement for RAG、无项目代码
时间:2024.07.18

THoRR:面向RAG的复杂表格检索与优化方法解读

本文聚焦于大型表格和复杂表格处理的问题,在表格检索方面,将标题行列拼接,找到与问题最相似的TOP-K表格;在表格优化方面,从检索到的表格里通过计算相关性得分优化模型。

一、论文动机

当前针对包含大型复杂表格的文档(如统计报告、行业报告),RAG系统面临两大核心挑战:

  1. 大型表格处理难题:之前的方法DTR、DPR - table 常把数据表分成固定长度的片段,这种分块法不仅增加了检索目标数量,还让跨分段表格的比较更困难,而且忽略单元格数值有丢失信息的风险;
  2. 复杂表格理解难题:复杂表格通常有层级标题和大量数值,给生成器带来挑战,对表格理解不足会导致生成错误答案

THoRR有更优的检索性能、减少输入生成器所需的信息(单元格数量),有效减少生成器中表格输入所需的令牌数量。

二、论文方法

THoRR(Table Header For Retrieval and Refinement)是专为RAG系统设计的表格处理方法,分为检索(Retrieval)优化(Refinement) 两个独立训练、功能互补的阶段,整体架构如图所示。

即当给定一个问题 Q 时,从给定的 M 个目标表格 T 中获取与问题相关的前 K 个优化表格 T r Tr Tr

在这里插入图片描述

2.1 表格检索阶段

核心目标

给定M个目标表格和用户问题Q,检索出与Q最相关的Top-K候选表格。

关键设计
  1. 双编码器结构

    • 表格标题编码器( E n c T Enc_T EncT):将表格的“标题(Title)+列标题( h e a d e r c o l header_{col} headercol)+行标题( h e a d e r r o w header_{row} headerrow)”拼接为统一输入,生成表格向量表示 t t t并构建索引,无需考虑所有单元格,突破编码器输入长度限制;
    • 问题编码器( E n c Q Enc_Q EncQ):将问题Q转换为向量表示 q q q
    • 相似度计算:通过向量点积计算 q q q t t t的相似度,筛选Top-K候选表格。
  2. 训练目标

    • 最小化问题 q q q与正样本表格 t i + t_i^+ ti+的距离,最大化 q q q与n个负样本表格 t i − t_i^- ti的距离;
    • 采用负对数似然(NLL)损失函数优化模型。

2.2 表格优化阶段

核心目标

对检索出的Top-K候选表格进行“瘦身”,筛选与问题Q相关的行/列标题,剔除冗余信息,生成仅含必要内容的优化表格 T r T_r Tr,降低LLM生成负担并减少“幻觉”。

关键设计
  1. 优化编码器( E n c R Enc_R EncR
    • 输入构建: 材料包 X r Xr Xr放进优化编码器 E n c R EncR EncR里,得到隐藏状态,在线性层根据隐藏状态,算出每个标题和问题的相关分数,记为 h h h
    • 相关标题筛选:通过 h h h选择Top-C个相关列标题( I c o l I_{col} Icol)和Top-R个相关行标题( I r o w I_{row} Irow);
    • 表格裁剪:基于筛选出的行/列索引,生成优化表格 T r T_r Tr
  2. 训练目标
    • 判断哪个标题和问题最匹配,让相关标题的得分 h y hy hyy 是正确标题的索引)尽可能高
    • 提升与问题相关标题的得分,采用交叉熵损失函数优化模型。

三、实验设计

3.1 实验设置

数据集
数据集 类型 核心特点 用途
HiTab 通用表格QA数据集 含10,672个问答对、3,597个表格,表格具有层级结构,需数值计算 模型微调
AIT-QA 航空行业表格QA数据集 含515个问答对、116个表格,来自SEC文件,含领域专用词汇 零样本性能评估
基线模型
  • DTR:表格专用结构编码器,需依赖表格完整结构;
  • DPR-table:将表格线性化为文本片段处理,忽略表格结构化特性。
评估指标
  • 检索精度:采用HIT@K(K=1,5,10,20,50),衡量Top-K检索结果中包含正确答案的比例;
  • 优化效果:统计优化后表格的单元格数量减少比例,结合人工评估LLM生成答案的“幻觉”降低比例。

3.2 核心实验结果

3.2.1 检索性能

THoRR在微调(HiTab)和零样本(AIT-QA)场景下均显著优于基线模型:

  • 微调场景:当 T o p C = 7 Top_C=7 TopC=7 T o p K ≤ 10 Top_K≤10 TopK10时,THoRR的HIT@1达45.77%,较DPR-table(40.40%)提升超5%,体现对“有限参考信息”的高效利用;
  • 零样本场景:THoRR的HIT@50达94.76%,较DPR-table(89.51%)提升5.25%,证明其在未见过的领域(航空业)仍能有效处理复杂表格。
3.2.2 检索方法对比
  • 传统“分块”方法:随着分块最大Token长度减小(如256),检索精度显著下降(HIT@10从77.15%降至约50%);
  • THoRR的标题表示法:无需分块,直接利用表格标题检索,精度始终高于分块方法,验证“表格标题是检索核心信息”的假设。
3.2.3 优化效果
  • 信息压缩:当 T o p C = 7 Top_C=7 TopC=7 T o p R = 10 Top_R=10 TopR=10时,表格单元格数量从153.88降至58.03,减少62.2%;
  • “幻觉”降低:人工评估显示,LLM使用优化表格生成答案时,“幻觉”比例降低9.33%,验证优化阶段对提升生成可靠性的作用。

四、相关工作

4.1 相关工作

表格编码器
  • 代表方法:TAPAS(表格单元格掩码预训练)、TaBERT(文本-表格联合预训练)、Tableformer(注意力偏置优化表格理解);
  • 局限性:多依赖完整表格数据,无法处理超大型表格,且未针对“检索-优化”全流程设计。
表格检索
  • 代表方法:Table2vec(融合标题、单元格、实体的嵌入)、GTR(表格图结构表示);
  • 局限性:需处理大量单元格数据,计算成本高,且未考虑检索后的表格冗余信息优化。

4.2 研究意义

  1. 技术创新:首次提出“表格优化”任务,实现“检索-优化”全流程适配RAG,解决大型表格分块难题和复杂表格冗余问题;
  2. 实用价值:减少LLM输入Token数量(降低成本),同时降低“幻觉”比例(提升可靠性),适用于统计报告、行业文档等复杂表格场景;
  3. 未来方向:进一步优化相关标题检测算法,避免因筛选过少标题导致的信息丢失。
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐