深度学习论文: Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
深度学习论文: Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
PDF: https://arxiv.org/abs/2605.07141
PyTorch代码: https://github.com/shanglianlm0525/CvPytorch
PyTorch代码: https://github.com/shanglianlm0525/PyTorch-Networks
1 概述
开放世界指代分割需将自由文本表达映射到像素级区域。现有 MLLM 虽具备强开放世界定位能力,但输出仅限于稀疏边界框,无法满足密集预测需求。近期基于 MLLM 的分割方法,或直接预测稀疏轮廓点,难以重建连续边界;或依赖 SAM 等外部分割模型,增加架构复杂度和部署成本。
我们提出 Qwen3-VL-Seg,一个参数高效的框架,将 MLLM 预测的边界框作为语义结构先验,解码为像素级指代掩码。其核心是轻量级框引导掩码解码器,集成多尺度空间特征注入、空间‑语义查询构建、框引导高分辨率像素融合及迭代掩码感知查询优化,仅新增 1700 万参数(约为基座模型的 0.4%)。
为支持开放世界训练,我们基于 SA‑1B 构建 SA1B-ORS,含类别导向(CoRS)和实例描述(DeRS)两个子集。评估方面,我们构建 ORS-Bench 基准,含分布内与分布外子集,覆盖多种指代表达类型。
大量实验表明,Qwen3-VL-Seg 在封闭集与开放世界场景下均表现优异,尤其在语言密集型指令上优势突出,且具备良好的分布外泛化能力。同时,通用多模态基准评测显示,模型在适配分割任务后仍能较好保持原有通用能力。
2 Qwen3-VL-Seg
2-1 Overview
开放世界指代分割,就是根据一句文字描述,在图中把对应的物体精确到像素地“抠”出来。现在的大模型虽然很会“看”,也能大概框出位置,但只能给边界框,没法给出精细轮廓。这就好比知道了目标在哪个小区,却不知道具体是哪栋楼。我们的做法是在已有大模型后面接一个专做分割的解码器,用大模型给出的框作为“线索”,引导后续的精细分割,一步步从粗框走向精掩码。
具体来说,解码器会从视觉编码器的中间层提取特征,做一些轻量增强,再与融合了语言信息的多模态特征合并,形成一张密集的“记忆图”。同时,我们结合框的位置和文本语义来生成目标查询,让查询从一开始就带着位置先验。为了还原边缘细节,我们还设计了一个高分辨率融合模块,只允许框内的浅层纹理参与计算,避免背景干扰。最后,用第一轮预测的掩码反过来调整查询,再做第二轮预测,让结果更准、更利落。
整个流程就是“先定位、后细化”,大模型负责粗定位,解码器负责精雕细琢。
2-2 网络结构
如下图,解码器由四部分构成:多尺度空间特征注入、空间-语义查询构建、边界框引导的高分辨率像素融合、迭代式掩码感知查询优化。
2-2-1 构建记忆特征
大模型顶层的特征太“宏观”,缺乏细节,所以我们从中间层取多级特征,用一个小型适配器给每层加上局部空间偏置,再把这些增强后的特征和顶层特征拼在一起,融合成多尺度视觉特征。另一方面,我们把多模态视觉嵌入(即结合了文字信息的视觉表征)还原成二维图,加上刚才的多尺度特征和可学习的位置编码,就得到了解码器需要的完整记忆。这份记忆既有语义又有空间细节,是后续预测的基础。
2-2-2 生成目标查询
查询向量要同时“认得”目标和“知道”它在哪。我们就把预测框的坐标、宽高编码成位置向量(宽高取对数以适用不同尺寸),再与文本分割令牌的特征相加,经过标准化和线性层,形成初始查询。然后,这个查询经过几层解码器,与记忆特征交互,得到强化后的查询。这样查询自带空间先验,比纯靠文字搜索要准确得多。
2-2-3 高分辨率细节融合
浅层特征里藏着边缘细节,但背景噪声也多。我们利用预测框做一个“软性门”:把框稍微放大,并在框内生成由中心向边缘递减的权重,框外则几乎为零。同时把之前的多尺度特征上采样到较高分辨率,再把门控处理后的浅层特征叠加进去。这样,模型只在目标附近补充高频信息,背景被有效抑制,既丰富了边界,又降低了干扰。
2-2-4 两次预测,自我修正
一次预测往往不够,尤其对细长物体或杂乱场景。所以我们增加一轮优化:先根据当前查询生成动态卷积核,在像素特征上做出初始掩码;然后根据这个掩码(软权重)对像素特征做加权平均,提取出目标区域的整体表征,将其加回查询,得到更新后的查询;再用新查询做第二次预测。这样查询能根据自身预测的像素证据调整,修正上一轮的偏差,使边缘更清晰。最终取第二次预测的掩码并上采样到原图尺寸,同时由一个辅助头输出置信度分数。
3 Dataset and Benchmark Construction 数据集与评测基准构建
3-1 SA1B-ORS
SA1B-ORS 是基于 SA-1B 中 200 万张图像构建的大规模复合数据集,含两个互补子集:SA1B-CoRS(类别导向,105 万样本)和 SA1B-DeRS(描述性导向,194 万样本)。前者提供类别级监督,后者补充实例级细粒度描述,共同覆盖开放世界指代分割需求。
3-1-1 SA1B-CoRS

将 SA-1B 的碎片化、无类别标注转化为类别导向的指代分割数据,经五阶段处理:
- 实例蒸馏:利用 RAM++ 标签和 WordNet 筛选可指代实体(如人、车辆、动物等),剔除场景词、颜色等弱指代概念,再经开放词汇定位模型验证,生成带标签和框的实体集。
- 粗掩码获取:对每对标签-图像,用 Qwen3-VL-Plus 预测框,SAM2 生成粗掩码作为后续先验。
- 细掩码合并:以粗掩码为引导,合并 SA-1B 碎片。计算 IoF(交集/碎片面积)选择高重叠碎片,合并后补充未覆盖区域,经形态学处理,获得完整实体级掩码。
- MLLM 验证:将图像、掩码高亮图和标签输入 Qwen3-VL-Plus,检查类别一致性、覆盖度、污染、碎片和遗漏,仅保留通过验证的候选,容忍边界误差但拒绝严重缺陷。
- 指代描述生成:为每个验证后的掩码生成配对的指代表达,并附元数据。最终得到 105 万训练样本。
SA1B-CoRS 覆盖面广,但无法处理同类多实例需区分的情况,故引入 SA1B-DeRS。
3-1-2 SA1B-DeRS

针对类别名不足以唯一识别目标的复杂场景,构建描述性指代分割数据,经三阶段:
- 指令整理:输入原图、掩码叠加图和坐标,让 Qwen3-VL-Plus 从类别、属性、状态、位置、关系五方面生成区分性描述。
- 认知验证:将原图和描述再次输入 MLLM,让其预测目标框,计算与真实框的 IoU,低于 0.8 则丢弃,确保描述准确对应目标。
- 显著性筛选:剔除面积占比过小的实例,保留视觉显著目标,减少背景噪声。
最终得到含显著目标和准确描述性指令的数据集,增强模型描述性分割能力。
3-1-3 数据分布
SA1B-ORS 在类别数和样本量上远超 RefCOCO 系列和 LVIS(图 6a);类别分布呈长尾(图 6b),常见类别占主导;描述性指令占比 64.8%(图 6c),强化复杂指代解析;词云显示空间介词和属性形容词高频出现(图 6d),保障了实例定位能力。
3-2 ORS-Bench
构建高质量评测套件 ORS-Bench,含分布内(ID)和分布外(OOD)两个子集,分别评估模型的泛化能力。
3-2-1 ORS-ID-Bench
采用与训练相同的数据流程,含 9,055 个验证样本,涵盖四类指令:单实例类别(2,465)、多实例类别(1,823)、短语指令(2,946)和描述性指令(1,821)。数据来源包括 COCO、LVIS、SA1B-CoRS、RefCOCO 系列及 DeRS,经人工严格验证,保证掩码精度和语义对齐。
3-2-2 ORS-OOD-Bench
针对训练集缺失或稀有的场景,构建 OOD 测试集,涵盖六类各 200 个样本(图 7):
- 类别 OOD:选取训练频率低于 10⁻⁴ 或未出现的类别。
- 面积 OOD:面积比 <0.002 或 >0.7 的实例。
- 指令 OOD:生成禁止直接命名、含否定、疑问式、需复杂推理或长上下文等五类困难指令。
- 遮挡 OOD:高遮挡目标。
- 光照 OOD:低光/夜间图像。
- 风险敏感场景:自动驾驶、医学诊断等。
所有样本经人工验证,该基准可全面衡量模型在极端条件下的鲁棒性,推动指代分割研究发展。
4 Implementation
4.1 Multi-stage Training 多阶段训练策略
本研究采用两阶段训练方案,旨在同步强化模型的跨模态理解能力与面向密集预测任务的细粒度感知能力,确保推理逻辑与空间表征的协同优化。
第一阶段:分割导向的领域适配 本阶段核心目标为构建稳健的指代分割能力,其基础是预训练视觉‑语言主干已具备的物体定位能力。具体而言,本文将主干网络从自然语言指令中提取的空间先验,迁移至像素级密集预测任务。在此框架下,通过LoRA对语言模型进行参数高效适配,同时联合训练视觉编码器与掩码解码器,统一于指令跟随体系。模型在公开指代分割数据集与SA1B‑ORS的混合集上训练,采用固定输入模板,并监督生成包含边界框和掩码占位符的结构化输出;掩码解码器负责将占位符标记解码为最终二值掩码。该阶段实现了粗粒度定位与细粒度分割的衔接,而视觉编码器的同步微调进一步优化了面向掩码的视觉特征表达。
第二阶段:感知与理解的协同增强 在第一阶段基础上,本阶段着力恢复并强化模型的通用多模态理解与推理能力,同时保持并提升指代分割性能。首先将第一阶段训练得到的LoRA权重合并入大语言模型主干,随后对主干网络与掩码解码器进行全参数微调,视觉编码器则保持冻结。训练数据按指代分割、通用多模态理解、多模态推理 3∶1∶2 的比例混合;推理部分采用原始Qwen3‑VL‑Instruct模型,通过离策略蒸馏生成以STEM内容为核心的蒸馏数据。本阶段在巩固第一阶段视觉表征的同时,显著提升了语言理解与推理能力。
4.2 Instruction Paradigm and Prompt Design 指令范式与提示设计
为支持开放词汇场景,本工作的指令跟随范式严格遵循Qwen3‑VL的上下文结构,采用ChatML格式,可在结构化对话中自然嵌入多模态输入。
指令模板 针对类别级分割与描述性分割,分别设计任务专属模板。按指令粒度,用户提示定义如下:
-
基于类别的分割:“在图像中定位并分割所有属于以下类别 的实例,以JSON格式输出边界框坐标和掩码。”
-
基于描述的分割:“在图像中定位并分割与描述 相匹配的目标对象,以JSON格式输出边界框坐标和掩码。”
结构化输出格式 为确保输出高度结构化且易于机器解析,模型被约束生成确定的JSON模式。对每个识别实例,预测三个关键字段:bbox_2d(归一化二维边界框坐标)、label(类别名称或标识符)、mask(占位符,形如 <mask_start><mask_token><mask_end>),该占位符作为掩码解码器生成二值掩码的桥梁。

4.3 Implementation Details 实验配置细节
本工作以Qwen3‑VL‑4B为基础主干。新增的掩码解码器仅含1700万参数(约为基础多模态大语言模型参数的0.4%),在实现像素级精确掩码预测的同时,基本保留了主干网络的效率优势。
第一阶段采用秩为32的LoRA,迭代10,000次。原始大语言模型权重冻结,LoRA适配器、视觉编码器及掩码解码器可训练。初始学习率设为1×10⁻⁴,采用余弦退火调度;视觉编码器使用0.01倍差异化学习率,以兼顾分割任务适配与预训练特征空间的稳定性。模型端到端优化,联合损失函数包含文本生成损失和分割损失,后者为逐像素二值交叉熵损失与DICE损失的加权和。
第二阶段将第一阶段LoRA权重合并回主干,随后进行5,000次全参数微调,其间主干网络与掩码解码器联合更新,视觉编码器冻结。采用较低学习率7×10⁻⁷,配合余弦衰减完成最终精调。
5 Experiments
Referring Expression Segmentation

Referring Expression Comprehension

Open-world Referring Segmentation

OOD Referring Segmentation

General Multimodal Evaluation

更多推荐


所有评论(0)