摘要

        高分辨率(HR)图像感知一直是多模态大语言模型(MLLMs)中的一大挑战。为了解决现有方法的局限,本文摒弃了以往专门的启发式方案,而是回归 HR 感知的最基本思路——通过增强 MLLMs 的长上下文能力来提升 HR 感知,这一思路受到通用大语言模型在长上下文技术(如检索增强生成 RAG)的最新进展的启发。为此,本文首次探索了将 RAG 应用于 HR 感知难题。具体而言,我们提出了检索增强感知(Retrieval-Augmented PerceptionRAP——一个无需额外训练的框架,它在保留空间上下文的同时,检索并融合相关的图像裁剪块,并采用所提的空间感知布局(Spatial-Awareness Layout)。为了适应不同任务,我们还提出了检索-探索搜索(Retrieved-Exploration SearchRE-Search),根据模型置信度与检索得分动态选择最优裁剪块数量。实验结果表明,RAP HR 基准上效果显著,LLaVA-v1.5-13B V* Bench 上提升了 43%,在 HR-Bench 上提升了 19%。代码将开源于:https://github.com/DreamMr/RAP

引言

        多模态大语言模型(MLLMs)在视觉语言理解、推理和交互方面取得了显著进展,通过利用视觉信号处理和解释视觉信息(Yin等人,2023)。当前的MLLMs(Liu等人,2024a;Bai等人,2023;Liu等人,2024b;Wang等人,2023a;Abdin等人,2024)通常以固定分辨率(例如448×448)处理图像。虽然这种设计简化了计算流程,但也带来了显著挑战,例如在处理高分辨率(HR)图像时会出现形状扭曲和模糊。这些扭曲显著影响了MLLMs的性能,尤其是在涉及分析真实世界中不同分辨率图像的任务中,例如需要细粒度视觉细节的视觉定位和光学字符识别(Zhang等人;Wang等人;Zhang等人;Zhang等人)。

        针对这一困境,增强MLLMs对高分辨率图像感知能力的新兴研究日益受到关注。现有方法大致可分为三类:

(1)基于裁剪的方法(Chen等人;Liu等人;Li等人),

(2)高分辨率视觉编码器方法(Luo等人;Ge等人;Lu等人),

(3)基于搜索的方法(Wu & Xie,2024;Wang等人;Shen等人,2024)。

尽管取得了显著进展,但基于裁剪和高分辨率视觉编码器的方法仍需要对高分辨率图像进行下采样以避免过长的视觉标记序列,从而导致大量细粒度细节的丢失。虽然基于搜索的方法避免了降采样,但也面临一些限制。这些方法遵循从高分辨率到低分辨率的自上而下搜索,但在初始阶段,模型难以准确感知小物体(Wang等人),常常导致错误的搜索路径。

这些限制促使我们重新思考高分辨率感知的根本挑战。理想情况下,有效的高分辨率感知需要一个具备强大长上下文能力的MLLM——例如,使用ViT-L/14(Dosovitskiy等人,2021)处理8K高分辨率图像会生成约30万个视觉标记。这引发了一个问题:高分辨率感知的关键是否在于增强MLLMs的长上下文能力,而非仅仅依赖现有的启发式方法,尤其是考虑到近期在通用大语言模型长上下文技术方面的突破。具体而言,检索增强生成(RAG)在最新的长上下文大语言模型中已被证明非常有效,它通过检索关键片段并减少无关信息的影响(Jin等人,2024)。受此启发,本文提出了一个被广泛忽视的问题:是否可以通过像通用大语言模型那样直接利用RAG增强MLLMs的长上下文能力,以克服现有高分辨率感知方法的局限性?

然而,探索这一问题面临重大挑战,因为图像与文本不同,是二维的(不考虑通道维度),具有宽度和高度。作为一项初步研究,我们首先关注两个关键方面:检索到的图像裁剪块的布局方式以及裁剪块数量对性能的影响。这引出了以下具体挑战:  
1) 检索到的图像裁剪块应如何组织?
此外,检索到的关键片段数量对RAG性能至关重要(Jin等人,2024),这促使我们提出第二个研究问题:  
2) 检索到的图像裁剪块数量如何影响最终性能? 
基于对这两个问题的洞察,我们进一步提出第三个研究问题:  
3) 如何设计RAG系统以增强MLLMs对高分辨率图像的感知能力?

针对第一个挑战,我们使用HR-Bench(Wang等人)和V*Bench(Wu & Xie,2024)进行了一系列实验,研究不同布局策略的效果。我们评估了最先进的MLLMs(Liu等人)在各种布局配置下的表现。具体而言,我们比较了三种策略:  
1) 按检索分数升序排列(Jin等人,2024),  
2) 按原始顺序排列检索到的图像裁剪块,  
3) 保留裁剪块之间的相对位置关系。  
实验结果表明,保持图像裁剪块的相对位置关系能显著提升高分辨率感知能力,尤其是依赖空间关系的任务。

第二个问题,本文研究了检索到的图像裁剪块数量的影响。我们发现,最佳裁剪块数量取决于任务类型。对于单实例感知任务,少量裁剪块即可显著提升性能,而过多的裁剪块会因图像分辨率过高导致性能下降。相比之下,对于跨实例感知任务,较少的裁剪块会导致信息丢失和性能降低,而较多的裁剪块有助于保留关键细节并减少性能下降。然而,过多的裁剪块仍会因分辨率过高而损害性能。

针对第三个问题,我们整合前两项研究的洞察,设计了一个新框架,称为检索增强感知(RAP)。如图1(a)所示,RAP通过VisRAG(Yu等人,2024)检索与查询相关的图像裁剪块来处理高分辨率图像。我们提出了一种简单高效的布局方法,称为**空间感知布局**,用于保留裁剪块之间的原始相对空间关系。为了确定最佳裁剪块数量,我们引入了一种新方案,称为**RE-Search(检索探索搜索)**,它根据模型对检索信息充分性的置信度自适应调整裁剪块数量。

具体而言,VisRAG首先计算每个图像裁剪块与查询的相似度分数,然后保留相似度分数最高的前K个裁剪块,并通过空间感知布局确保它们的相对空间关系得以保留。为了确定最佳K值,我们构建了一棵RE-Tree,其中每个节点代表通过保留不同比例裁剪块合成的新图像。树内的搜索过程由检索相似度分数和模型对图像是否提供足够信息以回答查询的置信度共同指导。

综上所述,我们的主要贡献如下:  

  • 据我们所知,这是首个探索利用视觉RAG增强MLLMs高分辨率图像感知能力的研究。我们的发现强调了保留检索图像裁剪块空间信息的关键作用,以及根据任务类型调整裁剪块数量的必要性。
  • 我们提出了RAP,一种无需训练的框架,包含用于保留图像裁剪块位置的空间感知布局和用于自适应选择最佳裁剪块数量的RE-Search。
  • 实验结果表明,RAP方法持续带来显著性能提升,在高分辨率图像基准测试中平均准确率提升达24%,该优势在通用多模态大语言模型(MLLM)基准测试中同样成立。

4. 检索增强感知框架提案

4.1 方法概述

基于第3节的研究发现,我们提出创新性框架——检索增强感知(RAP)该框架的核心设计理念是通过检索关键图像区块替代原始高分辨率图像,在保留必要视觉信息的同时降低分辨率,从而提升多模态大语言模型(MLLM)对高分辨率图像的感知能力。

为实现这一目标,我们首先将输入图像划分为若干裁剪块,计算每个裁剪块与文本查询之间的相似度分数(式 (1)),并选取相似度最高的前 K 个裁剪块,合成出一幅新的图像 V′。随后,我们设计了一种空间感知布局(Spatial-Awareness Layout)算法,以保持这些裁剪块在合成图像中的相对位置关系。为了自适应地选择最佳的 K,我们提出了检索-探索搜索(Retrieved-Exploration Search,RE-Search),该方法根据模型对合成图像 V′ 的置信度及其与查询的相似度来动态确定 K。空间感知布局和 RE-Search 的具体实现将在后续章节详细介绍。具体实现包含三个关键步骤:

  1. 图像分块处理:将输入图像划分为多个区块

  2. 相似度计算:基于公式1计算各区块与查询语句的相似度得分

  3. 自适应合成:选取相似度最高的前K个区块,通过空间感知布局算法合成新图像V'。为动态确定最优K值,我们提出检索探索搜索(RE-Search)机制,该机制综合考量模型对V'的置信度及其与查询的匹配程度。

  • 去冗余:剔除了那些对当前查询不重要的空白行/列,使图像更小,推理更快。

  • 保位置:剩下的裁剪块在压缩后仍然按相对顺序排列,模型可继续利用它们的空间关系。

  • 可逆映射:通过 Φ\PhiΦ 而非盲目重排,确保每个像素块在新旧图像间有明确对应,便于后续定位、热图叠加等操作。

5. 实验

5.1 在高分辨率基准上的结果
基准数据集
我们在两个高分辨率基准上评估了 RAP:V* Bench 和 HR-Bench。V* Bench 来源于 SA-1B (Kirillov et al., 2023),图像平均分辨率为 2246 × 1582。HR-Bench 的详细构成可参见第 3.1 节。

主要结果
如表 2 所示,与原始的 MLLM 相比,几乎所有模型在加入 RAP 后性能都有显著提升,证明了 RAP 与模型结构无关的通用性。我们发现,RAP 在 FSP 与 FCP 两类任务上均能带来大幅增益:在 HR-Bench 4K 与 8K 上,最高分别提升了 21.0% 和 21.7% 的准确率。此外,对于需要空间推理能力的任务,RAP 的改进更加突出(例如,在 V* Bench 上使用 LLaVA-v1.5-7B 时,准确率提升高达 +39.5%)。结果表明,RAP 在高分辨率场景下具有明显优势。


5.2 在通用多模态基准上的结果
基准数据集
我们还在 MME-RealWorld (Zhang et al., 2024c) 基准上测试 RAP,该基准为手工策划、贴近实际应用场景,包含 5 大类共 43 个子任务。由于篇幅所限,这里仅展示在 9 个随着 RAP 表现波动较大的子任务上的结果。

主要结果
如表 3 所示,RAP 在 LLaVA-v1.5-13B 上的大部分子任务都有提升,尤其是 MO/Orientation(+7.3%)、AD/Intention(+6.0%)和 OCR/license(+10.3%)。但我们也观察到,对于 Diagram 和 Table 类型的任务,性能提升并不显著,甚至在部分场景下略有下降。我们认为,这是由于此类任务对模型的空间感知和复杂推理能力依赖较强,而这正是当前 MLLM 的先天短板。


5.3 消融研究
为了更好地理解 RAP 中各模块的作用,我们在 HR-Bench 8K 上(使用 LLaVA-v1.5-7B)进行了消融实验,如表 4 所示:

  1. 仅用 VisRAG 检索裁剪:用检索到的关键裁剪替换原始 HR 图像,平均准确率提升 4.5%,其中 FSP 任务提升显著,而 FCP 任务却出现明显下降;

  2. 加入空间感知布局:在保留裁剪的同时保持其相对位置后,FCP 任务精度较 “+VisRAG” 得到恢复和提升;

  3. 再加上 RE-Search 优化 K 值:针对不同样本动态选择最优裁剪数后,FSP 和 FCP 均获得了统一的、平均 +21.7% 的准确率提升。


5.4 性能与效率
针对 RAP 可能带来的效率顾虑,表 5 给出了 RAP 与当前最先进的基于搜索方法(如 DC²、Zoom Eye)在吞吐量和准确率上的对比。得益于直接计算裁剪块与查询之间的相关性,RAP 无需分级划分图像,极大加速了搜索流程,同时在性能上也保持领先。


5.5 我们的方法为何有效?
回顾 RAP 的设计理念:检索与查询相关的图像裁剪,以降低输入给 MLLM 的图像分辨率,帮助模型更精确地“看”到关键信息。为探索其内在机理,我们设计了以下实验:

  1. 是否必须检索与查询相关的裁剪?
    在 HR-Bench 8K 上,用 LLaVA-v1.5-7B 比较“随机保留 K=4个裁剪”与“用 VisRAG 检索到的 4 个相关裁剪”。如表 6 所示,后者性能显著优于前者,说明“检索相关裁剪”是必要的。

  2. RAP 能否准确选出合适的 K?
    我们可视化了 LLaVA-v1.5-7B 在 HR-Bench 8K 上 RAP 所选 KK 的分布(见图 4(a))。结果表明,RAP 能有效减少裁剪数,同时带来 +21.7% 的整体准确率提升。对 FSP 任务,RAP 选出的 KK 较小;对 FCP 任务,则分布在更大的 KK 区间(如 K≥60K\ge60)。实验验证了 RAP 能为不同任务提供恰当的裁剪数量,从而真正降低了图像分辨率输入并提升了性能。


6. 结论

本文提出了一种无需额外训练的检索增强感知(Retrieval-Augmented Perception, RAP)框架,用以提升多模态大模型(MLLM)对高分辨率图像的理解能力。我们在多项主流 MLLM 基准上实证了 RAP 的有效性和通用性。归纳实验结论如下:

  1. 检索与查询相关的图像裁剪,可带来显著性能提升;

  2. 保持裁剪块之间的相对空间关系,对于依赖位置信息的任务尤为关键;

  3. 所需保留裁剪数 K 会随任务类型而异,需动态选择。

未来工作中,我们将进一步探索更多的 Token 压缩技术,以继续提高高分辨率感知的效率与精度。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐