在这里插入图片描述


一、论文信息

  • 论文题目:SkyEyeGPT: Unifying remote sensing vision-language tasks via instruction tuning with large language model
  • 论文作者:Yang Zhan, Zhitong Xiong, Yuan Yuan
  • 发表单位:School of Artificial Intelligence, Optics, and Electronics (iOPEN), Northwestern Polytechnical University, Xi’an, 710072, China
    Chair of Data Science in Earth Observation, Technical University of Munich, Munich, 80333, Germany
  • 发表会议\期刊:ISPRS Journal of Photogrammetry and Remote Sensing (ISPRS JPRS) 2025, Volume 221, Pages 64-77
  • 代码链接

二、论文主要贡献

  • 统一的遥感视觉语言指令数据集 SkyEye-968k:针对遥感多模态大语言模型缺乏指令数据的挑战,构建了大规模高质量的指令跟随数据,包含单任务和多任务对话指令。
  • 遥感多模态大语言模型:开发了 SkyEyeGPT,统一了多粒度遥感视觉语言任务,开创了遥感视觉与大语言模型统一建模的先河。本文提出的两阶段调优方法能够增强模型的指令跟随能力和多轮对话能力。
  • 全面的基准测试:为遥感多模态大语言模型提供了全面的基准测试。SkyEyeGPT 在单图像、区域级和多图像任务上均取得了具有竞争力的性能。特别地,在部分测试中,其表现与 GPT-4V 相当,令人鼓舞。
  • 开源 SkyEyeGPT 以支持实际应用:向社区公开发布以下资源:在线遥感多模态聊天机器人、模型检查点、指令跟随数据集和代码库,以支持实际场景中的应用。

三、论文创新点

3.1 统一的遥感视觉语言指令数据 SkyEye-968k

为填补在遥感领域尚无等效于通用领域所能获取的指令微调数据集数据集这一空白,本文精心规划并专门为遥感视觉语言大模型构建了统一的遥感视觉语言指令数据 SkyEye-968k。该数据集包含 96.8 万个训练样本,由公开数据重组和少量经人工验证的生成数据组成。详细信息如表 1 所示。
在这里插入图片描述
本文确保验证集或测试集中的图像不会出现在指令数据中,从而消除了数据泄露的风险。SkyEye-968k 数据集分为两部分。

3.1.1 单任务图文指令

  • 图像描述任务指令:具体而言,本文整合了 5 个遥感图像描述数据集(RSICD、RSITMD、UCM-Captions、Sydney-Captions 和 NWPU-Captions)和 1 个无人机视频描述数据集(见表 1)。用于简要描述遥感图像内容的遥感图像描述指令列表如表 2 所示。这些指令表达相同的含义,但采用不同的自然语言表述。
    在这里插入图片描述
  • 视觉问答任务指令:本文整合了 3 个公开的遥感视觉问答数据集(RSIVQA、RSVQA-LR 和 RSVQA-HR)。ERA-VQA 数据集是基于航空视频事件识别(ERA)数据集生成的。本文对被标记为 “非事件” 的航空视频的准确类别进行了修正。以帧图像和关于事件主题的问题作为输入。遥感视觉问答的指令列表如表 3 所示。
    在这里插入图片描述
  • 定位任务指令:本文整合了 2 个公开的遥感视觉定位数据集(RSVG 和 DIOR-RSVG)。用于定位遥感目标空间位置的遥感视觉定位指令列表如表 4 所示。这些指令表达相同的含义,但采用不同的自然语言表述。借鉴生成目标解析和定位指令的方法,本文创建了首个遥感短语定位数据集(RSPG),并对不准确的样本进行了人工修改和筛选。以遥感图像和短语作为输入,输出目标边界框可以是单个或多个。RSPG 任务的指令相对简单,直接使用短语或指代表达作为输入。
    在这里插入图片描述

3.1.2 多任务对话指令

单任务指令仅关注高质量的对齐图文数据,以提升 SkyEyeGPT 在每个特定任务上的性能。经过第一阶段调优后,当与用户进行多轮对话时,随着上下文变得更加复杂,模型可能难以有效处理后续任务。要将 SkyEyeGPT 打造成一个熟练的聊天机器人,必须重点关注如何增强其多任务对话能力,确保提供良好且无缝的用户体验。为解决这一挑战,本文通过混合或重组不同任务的数据集,创建了遥感多任务对话指令。

具体而言,本文混合了对应的图像描述和视觉问答数据集,得到 UCM-Conversa 和 Sydney-Conversa 指令。利用 DIOR-RSVG 数据集和 DIOR 数据集,构建了包含视觉定位、短语定位和指代表达生成任务的 DIOR-Conversa 指令。类似地,利用 RSIVQA 和 DOTA 目标检测数据集,构建了包含视觉问答和短语定位任务的 DOTA-Conversa 对话指令。为保证高质量,DOTA-Conversa 数据经过了人工验证和筛选。通过引入人类参与,确保了指令的高质量。


四、方法

4.1 整体架构

如图 3 所示,SkyEyeGPT 由视觉编码器、对齐层和基于大语言模型的遥感开放式任务解码器组成。
在这里插入图片描述
如图3所示,SkyEyeGPT由视觉编码器、对齐层和基于大语言模型的遥感开放式任务解码器组成。

视觉编码器:采用预训练的视觉Transformer EVA-CLIP作为视觉编码器,训练过程中参数保持冻结。对于输入的遥感图像 I ∈ R H × W × 3 I \in \mathbb{R}^{H \times W \times 3} IRH×W×3,其中 H H H W W W 分别表示图像的高度和宽度,3表示通道数(三通道彩色图像格式,即通用RGB结构)。首先将遥感图像的分辨率标准化为448×448。随后,使用EVA模型将图像分割为图像块,并从这些图像块中提取图像嵌入 Z v ∈ R N × D Z_{v} \in \mathbb{R}^{N \times D} ZvRN×D Z v Z_{v} Zv 全称visual embedding,视觉嵌入,即图像的视觉特征向量),其中 N N N 是图像块的数量, D D D 是每个图像块提取出来的特征维度。为增强模型对视频序列的理解能力,无人机视频特征由多个帧图像的特征拼接而成。

对齐层:本文采用线性层来弥合模态差距,将视觉编码器输出的遥感视觉特征与先进大语言模型的语言特征进行对齐。输入分辨率对于准确理解精细的遥感图文表示至关重要。然而,448×448的高分辨率会产生过多的图像块 N N N,这会降低大语言模型处理上下文输入的效率,并且对资源要求极高。因此,本文不直接将遥感图像嵌入输入线性层,而是采用一种简单且有效的方法,直接将四个相邻的视觉嵌入拼接,使图像块数量减少四倍。线性层将视觉嵌入 Z v ′ ∈ R N 4 × ( 4 × D ) Z_{v}' \in \mathbb{R}^{\frac{N}{4} \times (4 \times D)} ZvR4N×(4×D) 转换为语言空间中的嵌入 F v ∈ R N 4 × d F_{v} \in \mathbb{R}^{\frac{N}{4} \times d} FvR4N×d,其中 d d d 是大语言模型的语言特征标准维度大小。

基于大语言模型的遥感开放式任务解码器:本文选择开源的 LLaMA2-chat 作为语言模型,它是一个仅解码器的大语言模型。解码器以视觉标记序列 F v F_{v} Fv 和语言指令为输入,生成任务特定的答案。本文承认存在更复杂(但成本更高)的方法来连接遥感图像和语言或其他在遥感数据上预训练的编码器。本文在消融实验中探索了可能更高效或更复杂的SkyEyeGPT架构。

4.2 两阶段指令调优

模型在遥感多模态指令跟随数据上进行训练,以遵循一系列任务特定指令。SkyEyeGPT的输入模板和指令示例如表6所示。
在这里插入图片描述
为实现高效的SkyEyeGPT,本文设计了两阶段指令调优方法。

输入与输出模板:本文构建了多种任务输入,遵循表6中的对话输入模板。将遥感图像输入视觉编码器以获取遥感图像特征,但视频描述任务需要输入关键帧图像序列。本文引入了任务特定标识符,如[caption][vqa][refer],添加在指令之前。这种设计实现了遥感视觉语言任务的统一,同时允许模型灵活生成任务特定的输出。模型的输出(即答案或响应)跟在[/INST]之后。图像描述和视觉问答的输出直接采用原始任务的答案。区域级定位任务的输入或输出需要目标的边界框。本文将坐标表示为自然语言形式 < x 1 > < y 1 > < x 2 > < y 2 > {<x_{1}><y_{1}><x_{2}><y_{2}>} <x1><y1><x2><y2>,其中 ( x 1 , y 1 ) (x_{1}, y_{1}) (x1,y1) ( x 2 , y 2 ) (x_{2}, y_{2}) (x2,y2) 分别表示框的左上角和右下角坐标。坐标值经过归一化、乘以100并四舍五入为整数。RSPG任务使用⟨delim⟩符号拼接多个目标框的坐标文本。

阶段1:遥感图文对齐:该阶段使用单任务图文指令训练模型,帮助SkyEyeGPT构建基础的多任务遥感细粒度知识。本文根据每个任务中各数据集的样本频率分配适当的采样比例。该策略使模型能够公平地获得解决每个任务的能力,确保小规模数据集不会被忽略,大规模数据集也不会主导训练过程。将每个样本视为单轮对话 X c = ( X i n s t r u c t , X a ) X_{c}=(X_{instruct }, X_{a}) Xc=(Xinstruct,Xa)。通过输入模板获得对话输入,其中⟨Img⟩⟨/Img⟩表示遥感图像特征的占位符。将该输入通过嵌入转换为标记 X i n s t r u c t X_{instruct } Xinstruct,然后用给定的遥感图像特征 F v F_{v} Fv 替换 X i n s t r u c t X_{instruct } Xinstruct 中的占位符标记。随后将完整的输入标记输入大语言模型。SkyEyeGPT在 ( F v , X i n s t r u c t ) (F_{v}, X_{instruct }) (Fv,Xinstruct) 的条件下生成长度为 L L L 的答案 X a X_{a} Xa。训练目标是最大化如下定义的损失函数:

L = log ⁡ P ( X a ∣ F v , X i n s t r u c t ; θ ) = ∑ i = 1 L log ⁡ P ( x i ∣ F v , X i n s t r u c t , X a , < i ; θ ) , \begin{aligned} \mathcal{L} &= \log P\left( X_{a} | F_{v}, X_{instruct };\theta \right) \\ &= \sum _{i=1}^{L}\log P\left( x_{i} | F_{v}, X_{instruct },X_{a,<i} ; \theta \right) , \end{aligned} L=logP(XaFv,Xinstruct;θ)=i=1LlogP(xiFv,Xinstruct,Xa,<i;θ),

其中 P P P θ \theta θ 分别是条件概率和可训练参数, X a , < i X_{a,<i} Xa,<i 是当前预测标记 x i x_{i} xi 之前的答案标记。

阶段2:多任务对话微调:该阶段聚焦于多任务对话指令,以更好地回答多轮多任务问题,使SkyEyeGPT在多任务对话中能够生成更自然、更可信的输出。本文继续使用第一阶段的数据集,并添加多任务对话指令。但对多任务对话指令给予更高的数据采样比例,对单任务指令给予较低的采样比例。该策略使模型能够保持在各类任务上已取得的优异性能,同时提升对话能力和处理开放式任务的能力。多轮对话表示为列表 X c = ( X i n s t r u c t 1 , X a 1 , . . . , X i n s t r u c t n , X a n ) X_{c}=(X_{instruct }^{1}, X_{a}^{1}, ..., X_{instruct }^{n}, X_{a}^{n}) Xc=(Xinstruct1,Xa1,...,Xinstructn,Xan),其中 X i n s t r u c t n X_{instruct }^{n} Xinstructn 是第 n n n 轮的指令。与单任务指令不同,多任务指令调优可以累积其他任务的历史问题和答案,为当前任务提供更多线索。目标函数更新如下:

L = log ⁡ P ( X a ∣ F v , X i n s t r u c t ; θ ) = ∑ i = 1 L log ⁡ P ( x i ∣ F v , X i n s t r u c t , < i , X a , < i ; θ ) , \begin{aligned} \mathcal{L} &= \log P\left( X_{a} | F_{v}, X_{instruct };\theta \right) \\ &= \sum _{i=1}^{L}\log P\left( x_{i} | F_{v}, X_{instruct, <i}, X_{a,<i} ; \theta \right) , \end{aligned} L=logP(XaFv,Xinstruct;θ)=i=1LlogP(xiFv,Xinstruct,<i,Xa,<i;θ),

其中 X i n s t r u c t , < i X_{instruct, <i} Xinstruct,<i 是当前预测标记 x i x_{i} xi 之前所有轮次的指令标记。因此,历史输入和输出标记被累积起来,前几轮的指令和答案可以作为当前任务响应的参考。


五、实验分析

5.1 实验细节

为提升模型的有效性和训练效率,本文的视觉语言对齐层和大语言模型使用 MiniGPT-v2 的预训练权重进行初始化。在第一阶段,在单任务图文指令上对 SkyEyeGPT 进行端到端微调 35 个 epoch。在第二阶段,添加多任务对话指令,再训练 5 个 epoch。在上述两个阶段,均采用低秩适应(LoRA)方法微调对齐层和大语言模型。两个训练阶段的实现细节相同。使用 AdamW 作为优化器,设置批量大小为 1,学习率为 10 − 5 10^{-5} 105,采用余弦学习率调度器。为控制过拟合,设置权重衰减为 0.05。LoRA 的秩为 64。所有训练均在 4 块 NVIDIA 3090 GPU 上进行。第一阶段耗时约 50 小时,第二阶段耗时约 7 小时。本文的 SkyEyeGPT 能够在有限资源下对模型进行微调,并促进遥感视觉和语言两种模态之间的对齐。

5.2 遥感多模态聊天机器人

本文开发了一个遥感多模态聊天机器人演示,展示了 SkyEyeGPT 的视觉语言理解和对话能力。据本文所知,同期的现有遥感多模态大语言模型均不具备视频处理能力。图 5 展示了详细描述的部分对比结果。
在这里插入图片描述
令人惊喜的是,SkyEyeGPT 的表现与 GPT-4V 相当甚至更优。SkyEyeGPT 的第一句话是对图像的整体概述,而 MiniGPT-4、Shikra 和 MiniGPT-v2 仅局限于描述网球场,SkyEyeGPT 和 GPT-4V 则更准确地将其描述为运动场或球场。MiniGPT-4 和 MiniGPT-v2 的描述均存在错误,而 Shikra 擅长指称对话,不适合进行详细描述。GPT-4V 表现出色,但它忽略了图像左上角的建筑物和底部的停车场,而 SkyEyeGPT 准确地描述了这些内容。本文使用预训练权重初始化网络,然后通过 LoRA 微调将其泛化能力迁移到遥感领域。本文的模型能够高效学习遥感视觉语言的新知识,同时适当地继承自然域的先验知识结构和理解能力。

5.3 遥感图像描述

图像描述任务是评估遥感视觉与语言对齐质量的关键任务。模型根据用户输入的遥感图像和指令生成简短描述。在 UCM-caption、Sydney-caption和 RSICD 数据集上的实验结果如表 7 所示。
在这里插入图片描述

除 CIDEr 指标外,本文在大多数指标上取得了最优性能。对于专用模型,本文仅报告了少数最新的当前最优方法。本文在无人机视频描述数据集 CapERA(Bashmal 等,2023)上取得了当前最优结果,证明了模型出色的视频理解能力。

MiniGPT-4 生成的描述更长且细节更丰富,因此现有的评估指标难以提供准确的评估,尤其是 CIDEr 指标。GeoChat 并非针对图像描述数据集开发,它擅长定位、详细图像描述和带定位的图像描述等任务。当 GeoChat 处理图像描述任务时,在许多情况下仍会提供详细的长描述,因此在现有评估指标上表现极差,几乎所有指标都为 0。RSGPT和 RS-CapRet取得了最高的 CIDEr 分数。需要注意的是,RSGPT 的结果是在每个完整的图像描述训练数据集上单独训练 5 个 epoch 后获得的,而 RS-CapRet 是在所有图像描述训练数据集上联合训练后获得的。它们之所以能取得高 CIDEr 分数,是因为它们仅针对特定的图像描述数据集进行微调,以生成与真实标签长度和语义相似的结果。通过分析发现,与真实标签相比,本文的模型倾向于生成不同长度或语义更丰富的描述。现有的评估指标难以提供准确的评估,尤其是 CIDEr 指标。

基于 ChatGPT 的遥感图像描述新型评估方法:为解决这一问题,本文从 Sydney-caption 测试集的 5 个真实标签中随机选择一个作为参考标签。ChatGPT 使用提示 1 判断生成的描述是否覆盖了真实标签中的所有视觉对象和关系,使用提示 2 判断生成的描述是否可以作为真实标签的替代描述。结果如表 8 所示。
在这里插入图片描述

  • 提示 1:有一个遥感图像描述 1 “真实标签描述”,还有另一个遥感图像描述 2 “生成描述”。遥感图像描述 2 是否覆盖了遥感图像描述 1 中显示的所有对象和视觉关系?仅回答是或否,无需任何解释。
  • 提示 2:有一个遥感图像描述 1 “真实标签描述”,还有另一个遥感图像描述 2 “生成描述”。基于遥感图像描述 1 和你的理解,你认为遥感图像描述 2 可以作为另一个描述吗?仅回答是或否,无需任何解释。

实验结果表明,SkyEyeGPT 生成的描述更接近真实的视觉对象和关系。SkyEyeGPT 的准确率分别为 51.72% 和 56.90%,显著高于其他方法。令人惊讶的是,本文的新型评估方法得到的模型性能排序与传统评估指标的排序恰好相反。因此,有必要重新思考图像描述任务的评估方法。在本文的新型评估方法下,GeoChat 取得了与 MiniGPT-v2 相似的性能,而非接近 0% 的准确率。当 MiniGPT-v2 能够生成与真实标签字数相近的描述时,传统评估方法给出的性能远高于 GeoChat。这是因为新型评估方法是基于描述内容而非仅基于长度、词汇或格式来衡量准确率。基于 ChatGPT 的评估能够提供更合理的结果。

5.4 遥感视觉定位

在 DIOR-RSVG和 RSVG数据集上的定量结果如表 9 所示。
在这里插入图片描述
DIOR-RSVG 要求模型具备更好的属性感知和关系推理能力,而 RSVG 则要求更强的数值地理空间关系理解能力。现有许多通用多模态大语言模型无法处理区域级定位任务,例如 MiniGPT-4、LLaVA-1.5 等。本文的测试表明,Shikra 的鲁棒性较差,在自然数据集上表现良好,但在训练集域外表现不佳。Qwen-vl 和 MiniGPT-v2 在遥感数据上表现较好。由于 RSVG 更具挑战性,许多遥感多模态大语言模型未提供评估结果。

在 DIOR-RSVG 数据集上,除 H 2 H^2 H2RSVLM 外,其他模型均能达到专用模型的水平。GeoChat 和 LHRSBot 是遥感多模态大语言模型中定位性能较好的模型。GeoChat 在 CLIP 模型中将输入图像大小缩放至 504×504,除视觉输入外,区域位置也可以与提示一起输入 GeoChat。这些策略支持在高分辨率遥感图像中进行更好的视觉定位。SkyEyeGPT 在 DIOR-RSVG 数据集上的性能比当前最优专用模型高出约 5%,在 RSVG 数据集上高出约 10%。本文将目标边界框转换为自然语言表示,并将坐标归一化到 1-100 之间,为 RSVG 任务带来了性能提升。此外,这一显著提升还归因于 SkyEye-968k 中除 RSVG 任务外,还包含了区域级 RSPG 和指代表达生成任务。SkyEyeGPT 对小目标具有良好的鲁棒性和精确的定位能力。

5.5 遥感视觉问答

表 9 展示了 RSVQA 评估的结果。本文报告了每个子类的 top1 准确率和平均准确率。RSVQA-LR是监督评估最常用的数据集,许多多模态大语言模型未提供 RSVQA-HR 的结果,尤其是 Testset1。研究发现,所有通用多模态大语言模型的性能相近,且在 RSVQA 任务上表现不佳。除 RSGPT 和 RS-LLaVA 外,其他遥感多模态大语言模型均无法超过专用模型。需要注意的是,RSGPT 的结果是在整个 RSVQA 训练数据集上训练 5 个 epoch 后获得的,而 RS-LLaVA 是在整个 RSVQA 训练数据集和极少的图像描述数据集上联合训练后获得的。它们之所以能取得最优结果,是因为它们仅针对特定的 RSVQA 数据集进行微调。本文的 SkyEyeGPT single 与 GeoChat 性能相当。此外,在本文的 SkyEye-968k 中,RSVQA 数据集的图像属于卫星影像,而其他图像属于航空或无人机影像。RSVQA 任务的图像模态差异可能导致性能损失。解决不同来源遥感图像的模态差异问题是本文未来工作的重点。

消融实验

在本节中,本文详细分析了 SkyEyeGPT 的关键组件和超参数的影响。

多任务学习与两阶段指令调优:为探究 SkyEyeGPT 的多任务学习和两阶段指令调优方法的影响,本文开发了两个变体(SkyEyeGPT s i n g l e single single 和 SkyEyeGPT o n e − s t a g e one−stage onestage ),分别与单任务调优和单阶段指令调优进行对比。处理开放式任务的模型通常需要理解和生成不限于特定答案的响应,这要求模型具备更深层次的理解和生成能力。 s i n g l e single single 表示模型在任务特定数据集上进行训练和测试,仅考虑特定类型的答案响应,这自然会表现出更好的性能。如表 7 所示,在 RSICD 数据集上,开放式的 SkyEyeGPT 模型性能略低于 SkyEyeGPT-single 模型,但差距不大,且仍优于其他对比方法。如表 9 所示,在 RSVQA 任务上,RSGPT 显著优于 SkyEyeGPT,这可能是因为它们在这些数据集上进行了专门训练,使其响应能够适应 RSVQA 任务的特定特征和要求。然而,SkyEyeGPT 在其他任务上的性能与不具备开放式任务能力的模型相当甚至更优。总体而言,SkyEyeGPT 在广泛的任务中实现了精度与泛化能力的平衡,尽管它并非在每个数据集上都始终领先。这种平衡是一种刻意的设计选择,旨在确保模型在多样化场景中保持有效性和适应性,这对于开放式任务尤为重要。对比本文的完整模型和 one-stage 模型可以看出,第二阶段的多任务对话指令能够显著提升各类任务的性能。

视觉语言对齐层:为证明本文的视觉语言对齐层足以对齐遥感视觉和文本特征,本文设计了三个变体:(a) 直接移除线性层(w/o Linear Layer);(b) 使用多个线性层(2 个或 3 个)替代单个线性层;© 使用 Q-Former 替代单个线性层。所有变体采用相同的训练方式,结果如表 10 所示。所有变体的性能均不理想,其中 © SkyEyeGPT + Q-Former 最接近 SkyEyeGPT。这表明在本文的 SkyEye-968k 指令训练下,单个线性层足以将遥感视觉特征与大语言模型对齐。
在这里插入图片描述

任务标识符与 LoRA 适配器:为研究任务标识符和 LoRA 适配器对结果的影响,本文进行了消融实验,详细结果如表 11 所示。
在这里插入图片描述

消融模型 (b) 表示移除所有指令中的任务标识符来训练 SkyEyeGPT。消融模型 (a) 和 © 表示将本文的单个 LoRA 适配器替换为任务特定适配器。结果表明,当存在任务标识符时,使用任务特定 LoRA 适配器并不能提升模型性能。在没有任务标识符的情况下,它确实能提升性能,但仍不如本文的完整模型。在本文的完整模型中,任务标识符可以帮助大语言模型区分不同任务,而单个 LoRA 适配器能够实现跨任务的信息共享,提升多任务理解能力和多任务学习效率。消融模型 © 的任务特定适配器无法在不同任务之间共享信息,导致性能略有下降。在没有任务标识符的情况下,消融模型 (b) 中的单个 LoRA 适配器无法充分应对多任务的固有复杂性,导致模型性能显著下降。相比之下,使用任务特定适配器的消融模型 (a) 显著增强了模型对单个任务的理解能力,但由于缺乏跨任务的协作共享,其性能仍低于本文的完整模型。对比消融模型 (a) 和 © 可以看出,当使用任务特定适配器时,任务标识符对模型性能的影响极小。

低秩适应:为研究 LoRA 秩对结果的影响,本文设置了不同的秩进行实验,结果如表 12 所示。
在这里插入图片描述

随着秩的增加,模型性能先上升后下降,这与低秩近似技术的理论一致。当秩为 64 时,模型性能最佳。根据理论分析,LoRA 能够以显著更少的可训练参数实现接近全微调的性能。然而,基于 LoRA 的性能趋势,本文 SkyEyeGPT 框架的全微调性能将显著更低。LoRA 之所以能提供比全微调更好的性能,是因为它利用了模型参数的低秩特性。大语言模型在预训练阶段已经学习了丰富的特征表示,其权重矩阵通常具有低秩结构。通过引入低秩矩阵来模拟这种结构,LoRA 能够以更少的参数近似这种表示,从而在保留模型大部分预训练能力的同时减少参数数量。相比之下,全微调会破坏视觉编码器和大语言模型的预训练空间。对于参数数量庞大的遥感多模态大语言模型,全微调极易发生过拟合,导致模型的泛化能力大幅下降。LoRA 旨在引入显著更少的可训练参数,限制了过拟合的风险。LoRA 的可插拔特性使其能够被多个任务共享和重用,这有助于本文的多任务学习。LoRA 在保持大语言模型预训练的泛化能力和任务理解能力的同时,能够更好地在不同任务之间共享信息。


六、个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解有限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐