1. BaseInfo

Title EVF-SAM:Early Vision-Language Fusion for Text-Prompted Segment Anything Model
Adress https://arxiv.org/abs/2406.20076
Journal/Time 202406
Author 华中科技和 Vivo
Code https://github.com/hustvl/EVF-SAM/
Read 250218

是技术报告,严格来说不算论文

2. Creative Q&A

  1. 实证研究了哪些文本提示编码器(例如 CLIP 或 LLM)擅长适应 SAM 进行引用表达式分割并引入 EVF-SAM
  2. 文本与图像的早期融合
    在这里插入图片描述
    (a) 两阶段的,先检测再分割。Grounded-SAM
    (b) 含文本编码器的 SAM ,对文本提示进行编码,为 SAM 提供文本嵌入。存在模态差异。
    © 使用大型语言模型 (LLM)并进行微调。资源消耗高,计算成本高。且输入是复杂的对话模板。
    (d) 本文工作,多模态提示代替纯文本

3. Concrete

3.1. Model

在这里插入图片描述
三部分构成:

  1. Multimodal Encoder, 采用 BEIT-3 作为多模态编码器,它制定了多路转换器。文本由 XLMRobertaTokenizer 标记化,而图像被调整为 224x224 并由 1/16 卷积层修补。在编码器的每个块中,图像和文本标记将融合在注意块中,然后馈入单独的前馈网络 (FFN)。ViT 来检索 [CLS] 令牌作为输出多模态嵌入。
  2. Projector, 不同的基础模型往往具有不同的嵌入维度(BEIT-3Large 为 1024,BEIT-3-Base 为 768,SAM 掩码解码器为 256)。采用一个简单的 MLP 投影仪,其中包含 2 个线性层,由 ReLU 激活。(设计简单的原因:简单的 MLP 就很有效,使用 MLP 可以有效地训练和推理,简单的 MLP 对基础模型的预训练知识几乎不会有影响。)
  3. Segment Anything Model (SAM).Adapted prompt encoder for SAM.
    SAM 包含:ViT 架构的 Image Encoder 提取特征图;Prompt Encoder:提示编码器:接收交互式提示并将它们编码为隐藏嵌入;Mask Decoder:一个轻量级的掩码生成器,根据之前的嵌入输出最终的掩码。
    本文中保留了图像编码器和掩码解码器的架构。对提示编码器进行扩展,以进一步从多模态编码器收集嵌入。
    原始提示编码器将点或框提示编码为稀疏嵌入,其形式为 RB×N×DR^{B\times N\times D}RB×N×D ,在本文中,将来自多模态编码器的投影多模态嵌入,其形式为 RB×1×DR^{B\times 1\times D}RB×1×D ,与零初始化的稀疏嵌入连接,然后输入到掩码解码器中。B 代表 batch size,D 代表嵌入维度(the embedding dimension)

如何对SAM的文本提示进行编码。主要有 3 种方案:直接融入,后期融合,前期融合。
前期融合:在特征提取过程中定义了融合,其中两种模态都可以访问另一个模态的密集信息。它结合了编码器内的跨模态融合。
在这里插入图片描述

在这里插入图片描述
CLIP 在文本和图像模态之间表现出很强的对齐,这种对齐不足以用于分割等细粒度任务。


直接采用表达短语或句子作为输入。(LLM 需要指令模板工作)
多模态编码器 (EVF) 在我们的训练过程中是完全可训练的
使用多任务进行统一训练,包括语义分割和细粒度部分分割。

3.2. Training

初始化权重:EVF - SAM 模型使用 SAM - ViT - Huge和 BEIT - 3 - Large的公开权重进行初始化。
优化内存策略:采用 DeepSpeed 与 ZeRO - 2 进行模型并行,以优化内存消耗。
每个 GPU 的批量大小为 16,使用 2 步梯度累积,因此每次迭代的总批量大小为 128。
采用 AdamW 优化器,初始学习率设置为 1e - 4,并使用线性衰减学习率调度。
所有模型训练 15,000 次迭代(大约 1 天),使用二元交叉熵损失(BCE)和 dice 损失(两种损失的权重均为 1.0) 。

3.2.1. Resource

所有模型在 4 块 NVIDIA L40s GPU 上进行混合精度训练。

3.2.2 Dataset

RefCLEF、RefCOCO、RefCOCO+ 、 RefCOCOg
额外训练数据:Objects365、ADE20K、PASCAL-Part、PartImageNet 、HumanParsing
EVF-SAM可以处理不同粒度的文本提示分割,例如语义级、实例级和部分级分割。

3.3. Eval

在这里插入图片描述

3.4. Ablation

  1. 探究不同多模态编码器(如 CLIP、ViLT、BEIT - 3)和融合方法(早期融合、晚期融合)的效果。仅用文本编码器时分割性能有限,而多模态编码器能显著提升性能,且 BEIT - 3 早期融合的效果优于晚期融合或仅用文本。
    在这里插入图片描述
  2. 微调或冻结 EVF - SAM 中多模态编码器、提示编码器和掩码解码器等模块的影响。
  3. 使用不同的多模态特征表示作为 SAM 提示的效果。
    在这里插入图片描述
  4. 不同的基础模型
    在这里插入图片描述5. 含附录
    简单混合引用分割和语义分割的训练数据时,会出现性能下降的情况。性能下降的原因是不同任务之间存在语义冲突。为了缓解上述冲突,使用了一个特殊的文本标记 [semantic],并在语义 / 部分分割时输入‘[semantic]{category}’ ,这里 {category} 代表具体的类别 。

4. Reference

5. Additional

2025 年 3 月:发布了最新的评估基准 GSEval,它是一个全面且多粒度的定位基准。
EVF - SAM v2
2024 年 9 月:将 EVF - SAM 扩展到功能强大的 SAM - 2。新模型不仅参数更少,在图像预测方面有改进,还在视频预测方面表现出色(由 SAM - 2 提供支持)。只需在 RES 数据集上进行简单的图像训练过程,EVF - SAM 就具备了零样本视频文本提示功能
在线实时推理: https://huggingface.co/spaces/wondervictor/evf-sam2

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐