51c视觉~合集48
我自己的原文哦~ https://blog.51cto.com/whaosoft/13572120
#Seg4Diff
无需分割头,揭示并放大扩散Transformer中的涌现分割能力
来自韩国科学技术院(KAIST)、高丽大学和苏黎世联邦理工学院等机构的研究者们,共同发表了一篇题为 「Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers」 的论文,并被 NeurIPS 2025 会议接收。该研究提出了一个名为 Seg4Diff 的系统性分析框架,其名称意为“为扩散模型做分割”(Segmentation for Diffusion)。
这项工作深入探究了当前最先进的文本到图像生成模型——多模态扩散变换器(MM-DiT)的内部工作机制。研究团队的 新发现 是,这类模型在生成图像的过程中,其内部的特定层天然地具备了强大的“语义分组”能力,能够将文本描述与图像中的具体区域精确对应。这是一种 涌现属性 ,意味着模型无需专门训练就能进行高质量的开放词汇语义分割。更进一步,研究者还提出了一种轻量级微调方法,能够显著增强这一能力,从而在提升分割准确率的同时,也提高了生成图像的保真度,为构建集视觉感知与生成于一体的统一模型铺平了道路。
- 论文标题:Seg4Diff: Unveiling Open-Vocabulary Segmentation in Text-to-Image Diffusion Transformers
- 作者:Chaehyun Kim, Heeseong Shin, Eunbeen Hong, Heeji Yoon, Anurag Arnab, Paul Hongsuck Seo, Sunghwan Hong, Seungryong Kim
- 机构:韩国科学技术院(KAIST)、高丽大学、苏黎世联邦理工学院
- 论文地址:https://arxiv.org/abs/2509.18096
- 项目主页:https://cvlab-kaist.github.io/Seg4Diff/
- 代码仓库:https://github.com/cvlab-kaist/seg4diff
研究背景
近年来,以 Stable Diffusion、Midjourney 为代表的文本到图像(Text-to-Image)扩散模型取得了惊人的发展,它们能够根据简单的文本提示生成细节丰富、符合物理规律的逼真图像。这些模型的核心能力之一,是通过“跨模态注意力(Cross-Attention)”机制,将语言概念(如“一只猫”)与图像中的视觉特征(猫的像素区域)联系起来。
随着技术演进,像 Stable Diffusion 3 中采用的 多模态扩散变换器(Multi-Modal Diffusion Transformer, MM-DiT) 架构进一步提升了这种对齐能力。MM-DiT 不再像早期模型那样将文本和图像分开处理,而是将它们的信息“拼接”在一起,通过一个统一的自注意力(Self-Attention)机制进行联合建模。这使得模型能够更灵活、更深入地理解文本与图像之间的复杂关系。
然而,一个关键问题始终悬而未决:在模型庞大而复杂的网络结构中,这种关键的图文对齐究竟发生在“哪里”?又是“如何”发生的?对这些内部机制的理解不足,限制了我们进一步挖掘和利用这些强大生成模型潜力的能力。这篇论文的研究正是为了填补这一空白。
Seg4Diff:一个系统性的分析框架
为了揭开 MM-DiT 内部的神秘面纱,研究者们提出了 Seg4Diff 框架。它并非一个新模型,而是一套用于系统性分析、增强并利用 MM-DiT 注意力结构的完整流程。
识别“语义对位专家层”
研究团队首先对 MM-DiT 的多模态注意力机制进行了深入剖析。在 MM-DiT 中,注意力计算分为四种类型:图像到图像(I2I)、文本到文本(T2T)、图像到文本(I2T)和文本到图像(T2I)。其中,I2T 和 T2I 是实现跨模态对齐的关键。
通过一系列巧妙的实验,他们发现并非所有层都对图文对齐做出同等贡献。他们通过主成分分析(PCA)可视化、分析注意力特征范数、以及对特定层进行扰动测试等方法,观察不同层的行为。
扰动实验尤其具有启发性:当干扰某些层的 I2T 注意力时,生成的图像结构会严重退化;而干扰其他层则影响甚微。这表明模型内部存在明确的功能分化。
最终,他们 首次识别并命名了一个特定的 MM-DiT 模块——“语义对位专家层”(semantic grounding expert layer)。这个中间层的模块,在他们的实验中特指第9层,始终如一地负责将文本 token 与空间上连贯的图像区域进行精确对齐。
从注意力到开放词汇分割
这一发现的直接应用就是实现开放词汇的语义分割。研究者指出,从“语义对位专家层”提取出的 I2T 注意力图(Image-to-Text attention map),其本身就是一张高质量的分割掩码。例如,对于文本提示“一只猫”,其对应 token 的注意力图会自然地高亮出图像中猫的区域。
基于此,他们设计了一个无需额外训练的分割方案:直接利用 I2T 注意力分数作为图文相似度的度量,为每个文本 token 生成对应的分割预测。这种方法可以处理任意文本,因此是“开放词汇”的。
轻量级微调,性能再提升
为了进一步放大这种涌现的分割能力,研究者提出了一种简单而高效的轻量级微调方案,名为 “掩码对齐”(Mask Alignment)。
该方法在标准的扩散模型微调流程中,引入了一个额外的 LoRA 适配器和一个简单的对齐损失。具体来说,他们使用带有现成掩码标注的图像数据进行微调,并施加一个损失函数,以“鼓励”专家层产生的 I2T 注意力图尽可能地与真实的分割掩码保持一致。
这种方法非常“轻量”,因为它只在专家层上附加了一个小型的 LoRA 适配器进行训练,而无需改动庞大的预训练模型主体。这使得训练过程既快速又节省资源。
实验结果与分析
Seg4Diff 框架在分割和生成两个任务上都取得了令人瞩目的成果。
分割性能
经过掩码对齐微调后,MM-DiT 在开放词汇语义分割和无监督分割任务上都展现出强大的性能。定性结果显示,模型能够精确地分割出各种对象,即使是复杂的场景也能很好地处理。
生成质量提升
一个意外的惊喜是,这种针对分割的微调同样能反哺图像生成。经过掩码对齐后,模型生成的图像在多个方面都得到了改善:
- 结构一致性:减少了物体“缺胳膊少腿”或结构错乱的问题。
- 对象计数:能更准确地生成指定数量的对象。
- 颜色和纹理:细节和真实感得到进一步优化。
这一结果有力地证明了语义分组能力是提升生成保真度的关键因素之一。当模型更“懂”图像结构时,它就能生成更“对”的图像。
总结
Seg4Diff 的工作具有重要的贡献价值:
- 揭示了新机制:首次系统性地分析并证明了语义分组是 MM-DiT 的一种涌现属性,并精确定位了其发生的关键层——“语义对位专家层”。
- 提出了新应用:展示了如何直接利用扩散模型的内部注意力图来实现高质量、零样本的开放词汇语义分割,为生成模型的“可解释性”和“可利用性”提供了新思路。
- 开发了新方法:提出了一种轻量级的“掩码对齐”微调策略,能同时提升模型的分割和生成两大能力,实现了“1+1>2”的效果。
- 推动了领域发展:这项研究为打破视觉感知(如分割)和视觉生成(如文生图)之间的壁垒提供了坚实的一步,向着构建更通用、更强大的统一视觉基础模型迈进。
最重要的是,作者 已经开源了他们的代码 ,为社区复现和跟进这项研究提供了便利。xx认为,这项工作巧妙地“挖掘”而非“添加”模型的能力,为如何理解和利用强大的AI生成模型提供了宝贵的启示。
....
#Being-VL
师夷长技,用NLP的BPE算法统一视觉语言模型
论文标题:Unified Multimodal Understanding via Byte-Pair Visual Encoding
作者团队:Wanpeng Zhang, Yicheng Feng, Hao Luo, Yijiang Li, Zihao Yue, Sipeng Zheng, Zongqing Lu
作者机构:北京大学,加州大学圣地亚哥分校,中国人民大学,BeingBeyond
论文地址:https://arxiv.org/abs/2506.00596
项目主页:https://beingbeyond.github.io/Being-VL-0.5
代码仓库:https://github.com/beingbeyond/Being-VL-0.5
前言
大家好,今天xx要聊的话题,是关于如何让AI更好地“读图会意”。目前的多模态大模型(MLLM)在融合视觉和语言信息方面取得了很大进展,但背后一直存在一个根本性的挑战:图像和文字,这两种模态的信息表示方式,存在一道天然的鸿沟。
目前主流的方法主要分两派:
- 连续派:用一个视觉编码器(比如CLIP)把图片变成一长串连续的向量。这种方法语义信息保留得不错,但这些“模拟信号”般的视觉特征,和语言模型习惯处理的“数字信号”般的文本Token格格不入,存在“模态鸿沟”,而且计算量大,容易产生幻觉。
- 离散派:用VQ-GAN等技术把图片“像素化”成一堆离散的视觉Token。这样做虽然统一了格式,但这些Token往往只代表了基础的颜色和纹理,缺乏高级语义,就像把一幅画拆成了一堆马赛克色块,很难理解画的是什么。
有没有办法能鱼与熊掌兼得呢?来自北大、UCSD、BeingBeyond等机构的研究者们带来了一篇非常有启发性的工作——Being-VL,他们创造性地将自然语言处理(NLP)领域大名鼎鼎的BPE(Byte-Pair Encoding)算法引入了视觉领域,试图为视觉和语言的统一表示找到一条新路。
核心思想:像学文字一样学看图
BPE算法的核心思想很简单:在文本处理中,它会不断地把语料库里最高频出现的相邻字符对(比如'e'和's')合并成一个新的、更长的子词('es'),如此迭代,最终形成一个从“字母组合”到“常用单词”的层级化词表。
Being-VL就借鉴了这个思想,把图片也看成一篇“文章”。
如上图所示,整个流程分为两步:
- 构建BPE视觉词表:首先,用一个VQ-GAN把图片切分成一堆基础的视觉“偏旁”(离散Token)。然后,在大量的图片数据上,不断寻找那些既频繁出现、空间位置又相对固定的相邻Token对,将它们合并成一个新的“视觉词汇”。比如,“猫鼻子”的Token和“猫眼睛”的Token总是一起出现,并且位置固定,那么它们就可以被合并成一个代表“猫脸”的新Token。通过这种方式,模型就学会了一个从基础纹理到复杂物体(比如整个“猫”或“箱子”)的层级化视觉词典。
- 统一多模态理解:当一张新图片输入时,模型先用VQ-GAN进行离散化,然后用上面学到的BPE词表进行“分词”,得到一系列包含高级语义的视觉Token。这些视觉Token和文本Token一起,被无缝地送入一个统一的Transformer模型中进行理解。xx觉得,这个过程真的就像我们阅读图文混排文章一样自然。
优先引导的编码方案 (Priority-Guided Encoding)
为了构建出高质量的视觉词表,作者没有简单地只看“频率”,而是设计了一个“优先引导”的打分机制,同时考虑了 “共现频率” 和 “空间一致性”。只有那些既经常一起出现、空间关系又稳定的Token对,才会被优先合并。这保证了新生成的视觉词汇是真正有意义的视觉概念,而不是随机的拼凑。
训练策略:循序渐进的课程学习
有了层级化的视觉词表,训练也得跟上节奏。作者为此设计了一套三阶段的“课程学习”策略。
如上图所示,整个训练过程就像一个人的学习成长过程:
- 第一阶段: Embedding对齐。先让模型学习基础的图文对应关系,比如让它知道哪些视觉Token对应“猫”,哪些对应“狗”。这个阶段主要训练新加入的视觉Embedding层,语言模型主体部分冻结。
- 第二阶段:选择性微调。开始接触更复杂的感知和推理数据,并解冻Transformer模型的前几层,让模型学习更深层次的跨模态交互。
- 第三阶段:完全微调。在最复杂的指令和推理数据上进行端到端的微调,释放模型的全部潜力。
这种从易到难、逐步深入的课程学习方法,与BPE视觉词表的层级化特性完美契合,使得模型能够高效地掌握视觉语言的奥秘。
实验结果:统一模型有多强?
Being-VL在多个主流的视觉语言评测基准上都取得了非常出色的成绩。
从上表可以看到,在“离散Token”这条赛道上,Being-VL-0.5 和 Being-VL-0.5+ 全面超越了之前的模型。更重要的是,它们成功地缩小了与“连续派”顶尖模型(如LLaVA-Next, VILA-1.5)的性能差距,在VQAv2和MMBench等关键指标上达到了相当的水平。例如,Being-VL-0.5+在VQAv2上取得了80.6的得分,在MMBench上取得了72.1的得分,这证明了BPE视觉编码这条路是完全走得通的,并且极具潜力。
BPE Token激活机制分析
这张Embedding权重分布的可视化图非常有趣。在没有BPE的基础模型中(上图顶部),文本Token和视觉Token的权重分布差异巨大,泾渭分明,这正是“模态鸿沟”的体现。而加入了BPE词表后(中图和下图),两者的权重分布变得更加均衡和统一,说明BPE确实起到了桥梁作用,拉近了视觉和语言的距离。
扩展潜力与训练效率
作者还探讨了BPE词表大小的影响。如上图所示,更大的词表(如16K)虽然在训练初期效率稍低,但随着数据量的增加,其性能扩展潜力也更大。这说明该方法具有很好的可扩展性,未来可以通过更大的词表和更多的训练数据,进一步提升模型性能。
消融实验
一系列详尽的消融实验也证明了“课程学习”和“渐进式解冻”等训练策略的有效性。例如,标准的多阶段训练方法比简单粗暴的单阶段训练在感知和推理任务上分别高出12.8%和14.1%。
总结
总的来说,xx认为Being-VL这项工作非常亮眼。它不仅仅是提出了一个新模型,更是为解决多模态领域长期存在的“模态鸿沟”问题,提供了一个全新的、统一的视角。将NLP中成熟的BPE思想巧妙地迁移到视觉领域,并通过一系列精心设计的策略使其落地,最终实现了与主流连续派方法相媲美的性能,这本身就是一次成功的探索。
这种统一的Token表示方法,未来甚至有潜力扩展到多模态生成任务,让模型像写文章一样“画画”。
Being-VL获得了ICCV25 highlight,作者会在会场介绍工作,欢迎大家前来探讨工作!!
具体信息:
Exhibit Hall I #1195
Wed 22 Oct 11:15 a.m. HST — 1:15 p.m. HST
....
#VT-FSL
山大等提出:让LLM看图说话生成新样本,刷新10项SOTA
让机器像人类一样,只看几张图片就能认识一个全新的事物,这是计算机视觉领域一个非常经典且富有挑战性的任务,我们称之为“小样本学习”(Few-Shot Learning, FSL)。
过去的方法通常是想办法给模型补充一些额外的“知识”(语义信息),或者设计复杂的模块来融合这些知识。但这里有个痛点:模型补充的知识很可能是凭空“脑补”的,和实际给它的那几张图片对不上号,导致指导信息有噪声,效果自然大打折扣。
最近,一篇被 NeurIPS 2025 接收的论文 《VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning》,为我们提供了一个非常优雅的解决方案。来自山东大学等机构的研究者们提出了一个名为 VT-FSL 的新框架,巧妙地利用大语言模型(LLM)来解决上述难题。
- 论文标题:VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning
- 作者:Wenhao Li, Qiangchang Wang, Xianjing Meng, Zhibin Wu, Yilong Yin
- 机构:山东大学、深圳河套学院、山东财经大学
- 论文地址:https://arxiv.org/abs/2509.25033
- 代码仓库:https://github.com/peacelwh/VT-FSL
- 录用信息:NeurIPS 2025
VT-FSL的核心思想
VT-FSL的核心可以概括为两步:先让LLM“看图说话”生成精准的补充材料,再通过一种巧妙的几何方法将所有信息“三位一体”地对齐。
整个框架如上图所示,主要包含两大创新模块:
- 跨模态迭代提示(Cross-modal Iterative Prompting, CIP)
- 跨模态几何对齐(Cross-modal Geometric Alignment, CGA)
接下来,xx带大家一步步拆解这两个模块的精妙之处。
第一步:让LLM“看图说话”,精准生成新样本
传统方法直接用类别名(比如“阿拉斯加雪橇犬”)去问LLM,得到的描述可能非常宽泛。而CIP的聪明之处在于,它不仅告诉LLM类别名称,还把那仅有的几张“小样本”图片一并“喂”给LLM看。
通过一个包含“策略、感知、提炼、结论”四个阶段的结构化推理过程,CIP引导LLM生成 根植于视觉证据的、非常精确的类别描述。这个描述不会天马行空,而是紧密围绕着给定的样本图像。如下图所示,生成的描述非常具体详细。
有了这样高质量的文本描述,能做什么呢?
- 生成文本提示:它本身就是对类别的高层语义补充。
- 生成视觉提示:更绝的是,研究者们利用这个描述,通过一个文本到图像的生成模型(如Stable Diffusion),零样本合成了更多 语义一致的新图像!
这样一来,原来只有几张样本的窘境被彻底打破了。凭空获得了高质量的文本知识和多样化的视觉样本,极大地丰富了对新类别的表示。
第二步:“三位一体”的几何对齐
现在我们手头有了三种信息:原始的 支持样本(Support)、LLM生成的 文本描述(Textual)、以及合成的 新图像(Synthetic)。如何将它们高效地融合起来呢?
这里就轮到第二个神器——跨模态几何对齐(CGA) 登场了。
CGA的思路非常新颖。它将这三种信息的特征向量看作是三维空间中的三个点,这三个点可以构成一个平行六面体。CGA的目标,就是通过优化来 最小化这个平行六面体的体积。
从几何上直观理解,体积最小,就意味着这三个点在空间中被“挤”得更近,趋向于共线甚至共点。这强制使得三种模态的表示在特征空间中高度对齐和一致,从而实现了全局和非线性的信息融合,远比简单的特征拼接或相加要鲁棒得多。
刷新10项SOTA,效果斐然
理论上听起来很完美,那实际效果如何呢?VT-FSL在 10个不同的小样本学习基准 上都取得了新的SOTA(State-of-the-Art)成绩,涵盖了标准、跨域、细粒度等多种复杂场景。
以最经典的miniImageNet和tieredImageNet数据集为例,VT-FSL在1-shot和5-shot设置下均显著超越了以往的所有方法。
在细粒度分类任务上,VT-FSL同样表现出色,展现了其强大的特征分辨能力。
这些实打实的数据,充分证明了VT-FSL框架的有效性和泛化能力。
总而言之,VT-FSL通过“看图说话生成新样本”和“几何对齐融合特征”这两招,优雅地解决了小样本学习中的核心痛点。它不仅为我们展示了LLM在视觉任务中的巨大潜力,也为多模态学习领域提供了新的思路。作者已经开源了代码,xx强烈推荐感兴趣的同学去深入研究一番。
....
#VideoOrion
将视频中的物体动态编码进大语言模型,理解视频涨点10%以上!
论文标题:VideoOrion: Tokenizing Object Dynamics in Videos
作者团队:Yicheng Feng, Yijiang Li, Wanpeng Zhang, Hao Luo,Zihao Yue, Sipeng Zheng, Zongqing Lu
作者机构:北京大学、加州大学圣地亚哥分校、中国人民大学、BeingBeyond
论文地址:https://arxiv.org/abs/2411.16156
前言
来自北京大学和加州大学圣地亚哥分校等机构的研究者们提出了一个名为VideoOrion的新型视频大语言模型(Video-LLM)。
我们知道,现在的大模型看懂图片已经不是什么难事了,但要真正理解视频,尤其是视频里各种物体是怎么动的、互相之间有什么交互,其实还挺难的。目前的很多模型为了计算效率,不得不丢掉视频中的大量信息,导致理解得比较“粗糙”。
而VideoOrion这个工作,就像是给大模型装上了一双“火眼金睛”,专门用来“盯”住视频里的每一个重要物体。它的核心思想,就是把对整个视频的“全局理解”和对特定物体的“焦点关注”结合起来。
从上图的对比中我们能直观地看到,相较于之前的其他方法,VideoOrion能够捕捉到更精细的细节。
VideoOrion的核心架构
为了实现这种“全局”与“焦点”的结合,VideoOrion设计了一个非常巧妙的双分支架构。
如上图所示,这个架构主要包含两个部分:
- 视频为中心的分支 (Video-Centric Branch) :这个分支负责“看全局”,它会处理视频的整体信息,比如背景、场景氛围等,生成“上下文Token”,给大模型一个关于视频的整体印象。
- 物体为中心的分支 (Object-Centric Branch) :这是VideoOrion的秘密武器。这个分支会动用一套“检测-分割-追踪”的流水线,把视频里一个个的物体给识别出来,并且追踪它们在整个视频里的运动轨迹。然后,它会把每个物体的时空动态信息压缩成专属的“物体Token”。
最后,这两类Token——代表全局上下文的“上下文Token”和代表每个物体动态的“物体Token”——会被一起喂给大语言模型。这样一来,LLM就能同时“看到”视频的整体画面和其中每个物体的具体行为,从而做出更精准、更深入的理解和回答。
这个设计的输入是视频,输出则是对视频内容的文本描述或问答。xx觉得,这种解耦的设计非常高明,它让模型既不会丢失宏观信息,又能精准捕捉微观动态,解决了以往模型“看得见”但“看不清”的痛点。
方法细节
为了让“物体为中心的分支”能高效工作,作者采用了一套成熟的“检测-分割-追踪”流程。
具体来说,模型会先用像GroundingDINO这样的通用检测器来找到视频关键帧中的物体,然后用SAM(Segment Anything Model)进行精确分割,得到物体的轮廓(Mask)。最后,通过XMem这样的多物体追踪算法,把这些物体在不同帧之间的身份关联起来,形成完整的运动轨迹。
整个训练过程分为三个阶段:首先是视频为中心分支的预训练,然后是物体为中心分支的预训练,最后是在多种指令数据上进行多模态指令微调。这样的分步训练策略,保证了模型各个模块都能得到充分的学习。
实验效果怎么样?
VideoOrion在多个视频理解基准测试中都取得了非常亮眼的成绩。
主流Benchmark性能对比
在上表中,作者将VideoOrion与当前最先进的(SOTA)Video-LLM进行了比较。结果显示,VideoOrion在MVBench、EgoSchema、Perception-Test等多个主流Benchmark上都取得了具有竞争力的性能,一致性地超越了次优方法。特别地,与拥有相同视频为中心分支的基线模型VideoLLaMA2相比,VideoOrion在各项指标上平均提升了超过10%,这充分证明了“物体为中心”分支的有效性。
视频指代任务 (Video Referring Task) 表现
由于引入了显式的物体Token,VideoOrion天然就擅长处理需要“指代”视频中特定物体的任务。
实验结果表明,无论是零样本(zero-shot)设置还是经过微调,VideoOrion在视频指代任务上的表现都远超此前的专用模型Artemis和Merlin,这说明物体Token确实能让模型精准地“理解”我们到底在问哪个物体。
消融实验
为了进一步验证各个模块的有效性,作者还进行了一系列消融研究。
上表对比了仅使用视频分支(video-only)和完整VideoOrion模型的性能。结果很明显,加入了物体为中心分支后,模型在所有测试集上的性能都有了一致的提升。
同时,对物体分支进行预训练也至关重要。与随机初始化的物体分支相比,经过预训练的分支能带来显著的性能改善,证明了预训练对于学习有效的物体表示是必不可少的。
作者还探讨了不同的物体投影器设计、不同的检测-分割-追踪流程组件选择等,大量的实验都验证了当前设计的鲁棒性和有效性。
案例分析
光看数字可能不够直观,我们来看看具体的例子。
上图展示了当被问到不同问题时,VideoOrion如何动态地调整对不同物体Token的注意力。当问题是“这个人在干什么?”时,模型会更关注“人”这个物体。当问题是“杯子前面是什么?”时,模型则会把注意力更多地放在“茶包”和“杯子”上。这种动态的注意力分配机制,让VideoOrion能够根据指令灵活地聚焦于最相关的信息。
即使在一些复杂的场景下,比如需要理解人与人之间的交互,VideoOrion也能给出更准确的描述。
局限性与未来
当然,没有哪个模型是完美的。作者也坦诚地指出了VideoOrion的一些局限性。
例如,物体追踪流水线的性能直接影响最终效果。如果视频质量不高,或者物体检测、追踪失败了,模型的理解就会出错。上图就展示了一个追踪失败的例子。
此外,注意力机制偶尔也可能“开小差”,错误地关注了不相关的物体,导致判断失误。
同时,引入这个复杂的物体分支也带来了额外的计算开销,推理时间增加了约38.5%。不过,xx认为,考虑到其带来的显著性能提升,这个代价是值得的。并且作者也指出,未来随着视觉基础模型的进步,这些问题都有望得到缓解。
一个令人振奋的发现是,随着训练数据的增加,VideoOrion的性能能够持续稳定地提升,这展示了它巨大的潜力。
总的来说,VideoOrion为视频理解领域提供了一个非常新颖且有效的思路:通过显式地为视频中的物体建立动态模型,让大模型能够从“看热闹”进化到“看门道”。
....
#Wan-Alpha
天津大学联合腾讯提出:一键生成高质量透明视频,发丝级抠图不再是梦
对于视频创作者和设计师来说,获取带透明背景的视频素材(也就是RGBA视频)一直是个头疼的问题。无论是繁琐的手动抠图,还是效果不尽人意的自动工具,都耗费了大量时间和精力。随着AI视频生成技术的飞速发展,一个更理想的解决方案浮出水面:我们能不能直接从文本生成带透明通道的视频呢?
最近,来自天津大学和腾讯的研究者们就带来了这样一个令人兴奋的工具。在他们的新论文 《Wan-Alpha: High-Quality Text-to-Video Generation with Alpha Channel》 中,他们提出了一个名为 Wan-Alpha 的全新框架,能够直接生成视觉质量极高、动态效果逼真,并且带有精确透明度的RGBA视频。
从下面的效果图就能直观感受到它的强大,无论是半透明的物体、酷炫的发光特效,还是像发丝一样复杂的细节,Wan-Alpha都能精准地渲染出来。
- 论文标题: Wan-Alpha: High-Quality Text-to-Video Generation with Alpha Channel
- 作者: Haotian Dong, Wenjing Wang, Chen Li, Di Lin
- 机构: 天津大学、腾讯
- 论文地址: https://arxiv.org/abs/2509.24979
- 项目主页: https://donghaotian123.github.io/Wan-Alpha/
- 代码仓库: https://github.com/wechatcv/wan-alpha
核心挑战:如何让AI同时理解色彩与透明度?
要生成RGBA视频,模型必须同时学习RGB(色彩)和Alpha(透明度)两个通道。这是一个不小的挑战,因为如果分开处理,很容易导致色彩和透明度之间出现错位或不一致,比如物体的边缘很清晰,但它的透明蒙版却是模糊的,这在实际应用中是无法接受的。
现有的一些方法往往为了保证透明度的准确性而牺牲了整体的视觉质量,导致生成的视频看起来很“假”,实用性大打折扣。
Wan-Alpha的巧思:将透明度“藏”进色彩的潜在空间
为了解决这个问题,Wan-Alpha提出了一个非常巧妙的方案:联合学习RGB和Alpha通道。其核心在于设计了一个高效的变分自编码器(Variational Autoencoder, VAE),它能将Alpha通道的信息编码到RGB的潜在空间中去。

上图就是整个VAE的架构,我们可以把它理解为以下几个步骤:
- 特征提取:首先,将一个透明视频拆分成RGB视频和Alpha视频(即透明度蒙版)。然后,将它们分别送入一个预训练并冻结的VAE编码器,得到各自的特征表示。
- 特征融合:这是最关键的一步。一个专门设计的“特征融合模块”(Feature Merge Block)会将上述两种特征进行拼接,并通过3D卷积和注意力机制进行深度融合,最终生成一个统一的潜在特征
Z。 - 统一训练:这个融合后的
Z,既包含了色彩信息,也包含了透明度信息。后续的扩散模型(Diffusion Transformer)只需要学会根据文本提示来生成这个统一的Z即可。 - 分离解码:当
Z被生成后,再分别送入两个不同的VAE解码器,一个用于重建RGB视频,另一个用于重建Alpha视频。
xxx认为,这种将Alpha信息“嵌入”到RGB潜在空间中的设计,是保证色彩和透明度高度一致性的关键。因为模型在学习生成一个统一的潜在表示时,就已经被迫理解了两者之间的内在联系。
“好马配好鞍”:高质量的RGBA视频数据集
先进的算法也需要高质量的数据来“喂养”。为了训练Wan-Alpha,研究团队还专门构建了一个高质量、高多样性的RGBA视频数据集。这些数据包含了复杂的边缘(如毛发)、特殊的光效和半透明效果,为模型学习精细的透明度渲染提供了坚实的基础。
效果对比:不止是“能用”,更是“好用”
与现有的SOTA方法相比,Wan-Alpha在视觉质量、运动真实感和透明度渲染方面都表现出了明显的优势。从下面的对比图可以看出,对于飘动的长发这种极具挑战性的场景,其他方法生成的透明蒙版要么边缘模糊,要么细节丢失严重,而Wan-Alpha则能生成清晰、锐利且细节丰富的发丝边缘,效果非常惊艳。
无论是飞翔的巨龙,还是喝水的运动员,Wan-Alpha生成的视频主体清晰、动态自然,并且Alpha通道干净利落,可以直接用于二次创作。
总而言之,Wan-Alpha的出现,极大地推动了高质量透明视频生成技术的发展,为视频编辑、游戏开发、VR/AR等众多应用场景提供了强大的工具。作者已经开源了模型,这无疑会大大方便广大开发者和创作者。
....
#Visual Jigsaw
南洋理工联合商汤提出:像玩拼图一样,显著提升多模态大模型的视觉理解力
最近,多模态大语言模型(MLLM)的发展日新月异,但大家有没有发现,很多模型似乎更偏爱处理文字,而在“看图说话”的“看”这个环节,总感觉还差那么点意思。它们或许能识别出图像里的物体,但对于更精细的视觉细节、动态的时间顺序或是三维空间关系,理解起来就有些吃力了。
为了解决这个问题,来自南洋理工大学、林雪平大学和商汤科技的研究者们提出了一个非常有创意的方案。他们的新论文 《Visual Jigsaw Post-Training Improves MLLMs》 介绍了一种名为 Visual Jigsaw 的后训练框架。
“Visual Jigsaw”直译过来就是“视觉拼图”。它的核心思想,就是让模型像玩拼图游戏一样,通过重建被打乱的视觉信息,来增强对视觉信号的内在理解。
- 论文标题:Visual Jigsaw Post-Training Improves MLLMs
- 作者:Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu
- 机构:南洋理工大学、林雪平大学、商汤科技
- 论文地址:https://arxiv.org/abs/2509.25190
- 项目主页:https://penghao-wu.github.io/visual_jigsaw/
- 代码仓库:https://github.com/penghao-wu/visual_jigsaw
让模型玩一场“视觉拼图”游戏
目前,提升MLLM能力的主流方法是基于强化学习的后训练,但这主要集中在文本层面。视觉输入通常只是被用来提取一些稀疏的线索,服务于基于文本的推理,这限制了模型视觉能力的深度发展。
为了让模型真正“懂”视觉,研究者们设计了 Visual Jigsaw。这是一个通用的自监督后训练框架,其核心是一个排序任务:将视觉输入(如图片、视频或3D数据)分割成块并打乱顺序,然后要求模型用自然语言输出正确的排列。
这个过程最巧妙的地方在于,它完全是 自监督 的,不需要任何人工标注。正确的顺序是天然存在的,模型可以根据预测与真实顺序的匹配度获得奖励信号,这与一种称为“来自可验证奖励的强化学习”(Reinforcement Learning from Verifiable Rewards, RLVR)的技术天然契合,也无需引入额外的视觉生成组件。
具体来说,研究者们设计了三种拼图任务:
图像拼图 (Image Jigsaw)
将一张图片分割成若干不重叠的图块,打乱顺序后,模型需要预测出它们在光栅扫描顺序(从左到右,从上到下)下的正确索引。这能锻炼模型对图像内容的细粒度感知和空间关系理解。
视频拼图 (Video Jigsaw)
将一段视频切分成多个片段,打乱后,模型需要预测它们原始的时间顺序。这个任务旨在增强模型对动态过程和时序关系的理解。
3D拼图 (3D Jigsaw)
从一张RGB-D图像中,根据深度值采样一些点,在RGB视图中标注出来并打乱。模型需要根据这些点在图像中的样子,恢复它们从近到远的正确深度顺序。这直接提升了模型对三维几何和空间布局的感知能力。
实验效果:拼图“玩”得好,能力提升大
那么,让模型玩拼图的效果究竟如何呢?实验结果相当惊人。研究者们在多种视觉模态的基准测试上验证了Visual Jigsaw的有效性。
从上面的雷达图可以直观地看到,经过Visual Jigsaw后训练的模型,在图像的细粒度感知、空间感知、组合理解,视频的时序理解,以及3D的几何感知等多个维度上,都取得了显著的进步。
图像理解能力提升
在多个图像理解基准测试上,经过Image Jigsaw训练的模型表现出了全面的性能提升,尤其是在细粒度感知、空间理解和组合式理解方面。
例如,在下面的例子中,原始模型错误地判断了图中的小熊,而经过拼图训练后的模型则能正确理解图像内容。
视频和3D理解同样出色
不仅是静态图像,在视频和3D数据上,Visual Jigsaw同样威力不减。
Video Jigsaw任务显著增强了模型在多个视频理解基准上的表现。
而3D Jigsaw则让模型在深度比较任务和更广泛的3D感知任务上都获得了稳定的性能增益。
研究者们还发现,这个方法甚至能提升那些以推理为导向的MLLM的视觉感知能力,同时不损害其原有的推理能力。
总结
Visual Jigsaw 的提出,为我们提供了一个全新的视角来思考如何提升多模态大模型的视觉能力。它通过一个简单而通用的“拼图”任务,巧妙地将自监督学习与强化学习结合起来,在不增加额外标注成本和模型复杂度的前提下,显著增强了模型对图像、视频和3D数据的内在理解。
这项工作不仅证明了以视觉为中心的自监督任务在后训练阶段的巨大潜力,也为未来设计更多样的视觉预训练任务带来了启发。作者已经开源了代码,感兴趣的朋友不妨去亲自尝试一下。
....
#STAGE
中科大等提出:首个稳定且可泛化的自回归图像生成强化学习框架
最近,强化学习(RL)在文生图领域的应用可以说是风生水起,通过引入奖励机制,确实能让生成图像的质量和对齐度更上一层楼。但如果你想把这套玩法搬到自回归(Autoregressive, AR)图像模型上,事情就变得棘手起来。训练过程非常不稳定,跑着跑着,预训练好的模型能力就被“带偏了”,结果往往是提升有限,甚至图像质量下降,泛化能力也一言难尽。
针对这个痛点,来自中国科学技术大学和美团的研究者们深入剖析了其中的问题,并提出了一套名为 STAGE 的稳定、可泛化的 GRPO(Generalized Reinforcement Policy Optimization)框架。STAGE 的全称是 Stable and Generalizable GRPO,其核心思想就是让强化学习的训练过程更加“稳健”,别再那么“任性”。
论文与项目资源
- 论文标题: STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
- 作者团队: Xiaoxiao Ma, Haibo Qiu, Guohui Zhang, Zhixiong Zeng, Siqi Yang, Lin Ma, Feng Zhao
- 所属机构: 中国科学技术大学,美团
- 论文地址: https://arxiv.org/abs/2509.25027
- 代码仓库: https://github.com/krennic999/STAGE
强化学习在AR模型上的“水土不服”
让我们先来聊聊为什么现有的方法会“水土不服”。自回归模型生成图像,就像我们写句子一样,是一个个 token 顺序“吐”出来的。当用强化学习去优化时,问题就来了。
研究者发现,主要有两个“拦路虎”:
- 矛盾的梯度更新:在优化过程中,并不是所有的 token 都对最终图像质量有贡献。但传统的 GRPO 算法会一视同仁地更新,导致一些“无辜”或“无关紧要”的 token 产生了与优化目标相悖的梯度。这种内部冲突,尤其是在学习率较大或 KL 散度约束较弱时,会严重干扰预训练模型的分布,导致性能下降。
- 不稳定的策略熵动态:策略的熵可以理解为模型生成结果的多样性。在训练中,这个熵值会剧烈波动,有时为了追求高奖励,模型会变得“偏执”,只生成一些高度相似的“安全”图像,丧失了多样性,陷入“奖励黑客”(Reward Hacking)的陷阱。
上图直观展示了训练过程中梯度冲突导致的分布偏移问题,以及同一提示词下生成样本的高度相似性。
STAGE框架:两大“法宝”稳定军心
为了应对上述问题,STAGE 框架祭出了两大“法宝”。整个框架的流程如下图所示,在每次迭代中,策略模型生成一组样本,计算奖励,并结合参考模型的输出,得到对数概率和熵。接着,通过新提出的机制计算出最终的目标函数,用于更新模型。
1. 优势/KL重加权 (Advantage/KL Reweighting)
这个机制的核心思想是“区别对待”。它通过一个基于相似性的重加权策略,来智能地调整每个 token 在更新中的“话语权”。对于那些可能引起冲突的 token,就降低它们的更新权重,从而缓解梯度矛盾。这就像一个聪明的指挥官,协调内部矛盾,让大家一致对外,共同向着提升图像质量的目标前进。
2. 熵奖励 (Entropy Reward)
为了防止模型变得“偏执”,STAGE 引入了一个与参考模型(通常是预训练好的原始模型)相关的熵奖励。这个奖励机制会鼓励当前模型的策略熵向参考模型看齐。也就是说,如果模型生成的结果太多样化或太单一,都会受到“惩罚”。这有助于将模型的探索范围维持在一个合理的区间,既能寻找更优的生成策略,又不会偏离原始分布太远,从而稳定了训练过程。
上图展示了不同奖励机制下的效果。可以看到,基于规则的 GenEval 奖励(中)可能会给出相同的分数,让模型“困惑”;而 STAGE 的熵奖励(右)则能给出明确的偏好,引导模型向更理想的策略熵靠拢。
实验效果:稳定性和泛化能力双提升
那么,STAGE 的实际效果如何呢?xxx只能说,效果相当显著。
从定性对比来看,无论是在 GenEval 还是 T2I-CompBench 等基准上,STAGE 都表现出了优于基线 GRPO 的性能。生成的图像在结构稳定性、布局一致性和细节刻画上都更胜一筹。
在更精细的细节和结构稳定性上,STAGE 也展现了它的优势。下面这张图对比了原始模型、基线 GRPO 和 STAGE 在人脸、盔甲、汽车结构等细节上的表现,提升是肉眼可见的。
甚至在老大难的文字渲染任务上,STAGE 也能在保持图像质量的同时,更准确地捕捉文本结构。
定量结果同样印证了 STAGE 的有效性。根据实验数据,在 Janus-Pro 7B 模型基础上,STAGE 将 GenEval 分数提升至 0.89,这一成绩超过了许多现有的扩散和自回归模型。下方的表格更清晰地展示了,无论是最终检查点的性能(Ours)还是最佳性能(Ours*),STAGE 都稳定优于基线方法。
更重要的是,STAGE 表现出了强大的泛化能力。在 GenEval 奖励下训练的模型,在 T2I-CompBench 的多个子任务(如属性、空间关系等)上都取得了一致的性能增益。这说明 STAGE 学到的不仅仅是针对特定奖励的“应试技巧”,而是真正提升了模型的通用生成能力。
总结
总的来说,STAGE 框架通过巧妙的“优势/KL重加权”和“熵奖励”机制,成功缓解了强化学习在自回归图像生成模型上应用时的两大核心难题:梯度冲突和训练不稳定。它不仅让模型的训练过程更加平稳,还显著提升了生成图像的质量和跨任务的泛化能力。
这项工作为如何将强化学习的威力更安全、更有效地应用到自回归AIGC模型中,提供了一个有价值的思路和实践方案。
....
#MASt3R-Fusion
武大新作:融合IMU与GNSS,为新一代视觉SLAM注入“多感官”智慧
大家好,今天xx想和大家聊一个机器人和自动驾驶领域的核心技术——SLAM。简单来说,SLAM(即时定位与地图构建)就是要解决一个根本问题:一个机器人在未知环境中,如何知道“我在哪?”以及“周围长啥样?”。这个问题解决了,才能实现真正的自主导航。
近年来,基于学习的“前馈式”视觉模型(Feed-forward Models)给SLAM领域带来了新的活力。它们能直接从图像中“看”出3D结构,在弱纹理等传统方法抓瞎的场景里表现出色。但这些新方法往往是“纯视觉”的,忽略了机器人身上其他有用的传感器,比如IMU(惯性测量单元)和GNSS(全球导航卫星系统)。
如何将新潮的AI视觉模型与经典的多传感器融合技术优雅地结合起来?来自武汉大学的研究者们给出了一个漂亮的答案——MASt3R-Fusion。
- 论文标题: MASt3R-Fusion: Integrating Feed-Forward Visual Model with IMU, GNSS for High-Functionality SLAM
- 作者: Yuxuan Zhou, Xingxing Li, Shengyu Li, Zhuohao Yan, Chunxi Xia, Shaoquan Feng
- 机构: 武汉大学
- 论文地址: https://arxiv.org/abs/2509.20757
- 项目地址: https://github.com/GREAT-WHU/MASt3R-Fusion (作者称即将开源)
技术背景:当“AI视觉”遇上“经典融合”
在MASt3R-Fusion之前,SLAM领域主要有两大技术路线:
- 经典几何方法:比如大家熟知的ORB-SLAM系列,它们通过匹配图像间的特征点来计算位姿,依赖多视几何,但在纹理稀疏或快速运动时容易失效。
- 前馈式视觉模型:比如近两年大火的DUSt3R、MASt3R等。这些模型用深度学习的方式,直接从两张图片回归出稠密的3D点云和匹配关系。它们见过海量数据,自带强大的3D空间先验,因此在弱纹理场景下非常鲁棒。但缺点是,它们是纯视觉的,存在尺度不确定性(地图可能会随时间整体变大或变小),而且没有利用IMU、GNSS这些能提供真实尺度和绝对位置的宝贵信息。
MASt3R-Fusion的目标,就是取二者之长,将前馈式模型的强大视觉感知能力与传统多传感器融合的高精度、全局一致性结合起来。
MASt3R-Fusion:优雅融合之道
MASt3R-Fusion的系统框架非常清晰,分为实时SLAM和全局优化两个主要阶段。
强大的视觉前端
系统的前端,也就是“眼睛”,采用了一个类似MASt3R的前馈式模型。它接收图像对,直接输出稠密的3D点图(pointmaps)和特征描述子。这为后续的位姿估计和数据关联提供了非常鲁棒和稠密的信息。
融合核心:因子图优化
MASt3R-Fusion的核心是一个基于“因子图(Factor Graph)”的优化框架。xx打个比方,因子图就像一张“关系网”,上面有代表机器人状态(位姿、速度等)的“节点”,以及代表各种传感器测量信息的“边”(因子)。比如:
- IMU预积分因子:提供了连续帧之间高频的运动信息。
- GNSS因子:提供了全局绝对位置信息。
- 视觉因子:提供了相邻或有重叠区域的帧之间的相对位姿关系。
整个系统就是通过求解这张“关系网”,找到一个最优的机器人轨迹和地图,使其最符合所有传感器的测量结果。
关键创新:从Sim(3)到SE(3)的桥梁
这里就引出了本文最核心的技术贡献。前馈视觉模型估计的位姿和地图是在一个“相似变换”空间(Sim(3))下的,也就是说它的尺度会漂移。而IMU和GNSS的测量是在真实的“米”为单位的度量空间(SE(3))下的。如何将这两种不同“语言”的信息融合在一起呢?
作者设计了一种新颖的基于Sim(3)的视觉对齐约束,并将其巧妙地转换为SE(3)因子图能够理解的形式。如下图所示,它不再像传统BA(Bundle Adjustment)那样联合优化所有地图点和相机位姿,而是基于前馈模型提供的可靠的(无尺度)3D结构,只优化相机位姿和点云的尺度。
通过引入“同构群变换”,论文在理论上完美地搭建了一座从Sim(3)到SE(3)的桥梁,使得视觉信息可以被严谨地、紧耦合地融入到多传感器优化框架中。
此外,系统还设计了分层的因子图结构,兼顾了实时性的滑动窗口优化和全局一致性的回环检测与优化,使得系统既快又准。
实验效果:精度与鲁棒性双丰收
MASt3R-Fusion在多个公开数据集和自采数据集上都取得了非常出色的表现。
在经典的KITTI-360数据集上,无论是VIO(视觉惯性里程计)的相对位姿精度,还是加入回环和全局优化后的绝对轨迹精度,MASt3R-Fusion都显著优于ORB-SLAM3、VINS-Fusion等知名系统。
在更具挑战性的SubT-MRS洞穴数据集上,面对弱纹理、光照变化剧烈的环境,MASt3R-Fusion的优势更加明显,轨迹精度远超其他方法。
在融合GNSS的城市场景测试中,MASt3R-Fusion表现出极强的鲁棒性。即使在GNSS信号出现粗差甚至中断100秒的情况下,系统依然能凭借强大的VIO性能和全局优化能力,保持亚米级的定位精度。
最后,系统还能实时重建出稠密且度量准确的3D地图,效果非常惊艳。
总结
总的来说,MASt3R-Fusion做了一件非常漂亮的工作:它没有在“学习派”和“几何派”之间做选择,而是将前沿的AI视觉模型作为了一个强大的“视觉传感器”,并将其无缝地、严谨地融入到了经典的多传感器融合优化框架中。这不仅发挥了AI模型在感知上的鲁棒性,也继承了传统优化方法在精度和全局一致性上的优势。
....
#DC-VideoGen
NVIDIA祭出视频生成“通用加速器”:提速14.8倍,单卡跑4K,让所有模型焕发新生!
自Sora问世以来,AI视频生成的浪潮一波高过一波。我们惊叹于那些以假乱真的画面,但背后那天文数字般的算力消耗,也让无数开发者和普通用户望而却步。难道高质量的视频生成,注定只是少数巨头的“算力游戏”吗?
今天,NVIDIA的研究团队给出了一个响亮的回答:不一定。他们带来了一个名为 DC-VideoGen 的框架,像一个即插即用的“通用加速器”,可以直接作用于任何预训练好的视频扩散模型,在几乎不损失质量的情况下,带来最高 14.8倍 的推理加速,甚至让 单卡生成4K视频 从梦想照进现实。
- 作者: Junyu Chen, Wenkun He, Yuchao Gu等 (NVIDIA)
- 论文地址: https://arxiv.org/abs/2509.25182
- 项目地址: https://github.com/dc-ai-projects/DC-VideoGen
视频生成的“速度与激情”为何难以兼得?
要理解DC-VideoGen的巧妙之处,我们得先聊聊视频生成为什么这么“慢”和“贵”。
视频是由一连串图片组成的,数据量极其庞大。一个短短几秒的1080p视频,就包含了几百万甚至上千万的像素点。让模型直接在原始像素上进行生成,计算量是不可想象的。所以,现在主流的扩散模型(比如Stable Diffusion)都采用了一种“先压缩,再生成”的策略。它们会用一个叫做“自编码器”(Autoencoder, AE)的东西,先把高清视频压缩到一个小得多的“潜在空间”(Latent Space)里,生成过程就在这个“小世界”里进行,最后再由自编码器解压还原成视频。
问题就出在这个“压缩”环节。现有的视频自编码器(VAE)压缩率普遍不高(比如8倍空间压缩),面对4K这样的超高分辨率,压缩后的数据量依然庞大,导致生成过程还是又慢又吃显存。这就是当前视频生成模型难以逾越的“性能瓶颈”。
DC-VideoGen的两板斧:极致压缩 + 无痛迁移
DC-VideoGen正是为了砍掉这个瓶颈而来,它挥出了漂亮的两板斧。
- 第一板斧:打造一个极致压缩的“新世界” (DC-AE-V) 。NVIDIA研究员们训练了一个全新的、压缩能力超强的 **深度压缩视频自编码器 (DC-AE-V)**。它的压缩率达到了惊人的 **32倍甚至64倍**,同时还有4倍的时间压缩。这意味着,经过它处理后,扩散模型要操作的数据量被急剧缩小,为后续的疯狂加速奠定了基础。
- 第二板斧:让大模型“无痛迁移” (AE-Adapt-V) 。有了新世界,怎么让原来生活在旧世界的“神”(预训练大模型)搬过去,并且还保留一身神通呢?这就是 AE-Adapt-V 的任务。它是一套高效的适配策略,能让大模型快速、稳定地适应新的潜在空间,整个过程只需要极低的成本。比如,改造一个14B参数的大模型,成本仅为从头训练的 1/230 !
技术探秘:DC-AE-V的“块-因果”智慧
要在如此高的压缩率下保证视频质量,绝非易事。传统方法在这里遇到了两难的困境。
如上图所示,纯粹的“因果”模型(Causal VAE),在处理视频时,后面的帧只能参考前面的帧,信息单向流动。这样做的好处是能自然地处理长视频,但因为信息利用不充分,高倍压缩下画面会变得模糊。而“非因果”模型(Non-Causal)则允许每一帧都“看到”所有其他帧,信息双向流动,重构质量很高,但它学到的是一种“固定长度”的模式,一旦推理时视频变长,就会出现明显的拼接痕迹和逻辑错误。
DC-AE-V的 “块-因果”(Chunk-Causal) 设计就显得格外聪明。
它像一个聪明的电影剪辑师:
- 先把长视频切成固定长度的“小片段”(Chunk)。
- 在每个片段内部,信息可以双向、自由地流动,充分利用上下文信息来保证画面的精致细节。
- 在片段与片段之间,则严格遵守时间的先后顺序,信息单向流动,从而保证了对任意长视频的生成能力。
这种设计,可以说是鱼与熊掌兼得,既要了高质量的“里子”,又要了长视频生成的“面子”。
技术探秘:AE-Adapt-V的“翻译”艺术
让一个习惯了旧潜在空间(比如8倍压缩)的万亿参数大模型,去适应一个全新的、语言规则完全不同的潜在空间(比如64倍压缩),如果直接微调,就像让一个只懂英语的人去读德语,结果必然是“精神错乱”,训练过程会非常不稳定。
AE-Adapt-V的作用,就像是为大模型请来了一位“同声传译”。它包含一个“视频嵌入空间对齐”阶段,在正式微调前,它会先冻结住大模型的主体部分,只训练模型的“输入端”(Patch Embedder)和“输出端”(Output Head),让它们学会如何在新旧两个潜在空间的“语言”之间进行翻译。一旦这个“翻译系统”建立起来,大模型原有的丰富知识和语义理解能力就被完好地保留了下来。在这个坚实的基础上再进行轻量化的LoRA微调,自然事半功倍,效果又快又好。
影响与展望
DC-VideoGen的出现,其意义远不止于“快”。它证明了通过优化数据表示(更高效的自编码器)和模型适配策略,我们可以在不增加模型规模的前提下,大幅提升现有SOTA(State-of-the-art)模型的性能和效率。
对于开发者和创作者而言,这意味着原本需要数十分钟甚至数小时才能生成的一段高质量视频,现在可能几分钟就能完成。原本遥不可及的4K视频生成,现在单张专业级GPU即可胜任。这无疑将极大地解放生产力,催生出更多富有创意的应用。
....
#GCPO
自回归图像生成新模型,中科大等提出GCPO:仅用30%图像Token,实现超越GRPO全量token优化的效果
- 论文标题:Group Critical-token Policy Optimization for Autoregressive Image Generation
- 论文作者:Guohui Zhang, Hu Yu, Xiaoxiao Ma, JingHao Zhang, Yaning Pan, Mingde Yao, Jie Xiao, Linjiang Huang, Feng Zhao
- 作者机构:中国科学技术大学,上海创智学院,复旦大学,香港中文大学,北京航空航天大学
- 论文地址:https://arxiv.org/abs/2509.22485
- 代码仓库:https://github.com/zghhui/GCPO
- 模型权重:https://huggingface.co/zghhui/Janus-Pro-7B-GCPO-Geneval
GCPO:仅用30%图像Token,实现超越GRPO全量token优化的效果!
近年来,基于自回归(AR)的视觉生成模型在高质量图像生成领域取得了显著进展。与此同时,基于可验证奖励的强化学习(RLVR)技术也逐渐被引入视觉生成任务中,来进一步地提升生成图像质量和人类偏好对其程度。 然而,现有方法通常对所有图像Token进行均匀优化,忽略了不同Token在生成过程中的贡献差异。如何在AR生成过程中识别出关键Token,并对其进行有效的逐Token优化,成为当前研究的核心挑战。
为此,作者团队提出了一种全新的强化学习框架——Group Critical-token Policy Optimization(GCPO),实现了对关键Token的高效策略优化。
🔍 洞察关键:什么样的token值得重点关注?
作者从三个独特视角定义了AR生成中的关键token:
1. 因果依赖视角
由于AR模型的自注意力机制,早期生成的token持续影响后续所有token,对图像整体结构起到决定性作用。实验显示,对前10%的图像token添加扰动会导致图像全局结构发生明显变化,而对中间token的扰动仅影响有限的局部细节。
2. 熵梯度视角
研究发现,token熵的梯度图能够稳定地标识出图像中的结构区域。高熵梯度token通常对应于主体结构或视觉区域间的过渡区域,这些区域随着RL训练变得更加明显,显示出对RL训练的敏感性。
3. 多样性视角
在GRPO的组内采样中,某些位置的token在不同图像间展现出显著差异性。低相似度token往往对应复杂结构区域,为策略优化提供更丰富信息。
🛠 GCPO的核心设计
GCPO框架包含两大核心设计:
- 关键Token选择策略:综合上述三个角度,从全部Token中筛选出约30%的关键Token。
- 动态优势权重:基于策略模型与参考模型在关键Token上的置信度差异,为每个关键Token分配动态的优势权重,以分配不同程度的探索权重。
📊 实验结果出色
论文在多个模型(LlamaGen,Janus-Pro)和文本生成图像基准测试(Geneval,T2I-CompBench,DrawBench)上验证了GCPO的有效性:
- GenEval基准:Janus-Pro-7B + GCPO取得了0.90的高分,多个子指标有着明显提升。
- T2I-CompBench:在形状、纹理、空间关系等任务上,GCPO进一步展示出稳健的泛化性能,多项任务性能提升超20%,泛化性显著优于同样设置下的GRPO。
- 图像质量与人类偏好:在DEQA、ImageReward、PickScore等指标上,GCPO均优于基线方法,生成图像细节更自然、生动。
📊 消融实验
为了进一步证明关键token选择的合理性,论文进一步做了关键token(30%)和其他token(70%)的对比实验,从性能曲线可以清晰看到:
🟢 30%关键token:性能与100%全token的GRPO基线相当,甚至略有超越
🔴 70%普通token:性能显著下降,与基线存在明显差距
💡 GCPO完整框架:进一步拉开差距,达到最优性能
💡 总结与展望
GCPO的提出,不仅为AR视觉生成提供了一种新颖的token级优化方式,也揭示了图像Token在强化学习训练过程中的重要性差异。仅通过优化30%的关键Token,即可实现超越全Token优化的性能,极大地提升了模型表现。
相关代码、模型与所有的模型权重都已经开源,欢迎进一步地讨论交流~
本文亮点总结:
- 提出关键Token三视角选择法,涵盖因果、结构、多样性
- 设计动态优势权重,实现Token级差异化探索鼓励
- 仅用30% Token,性能超越全token训练的GRPO
- 在多项基准上实现新突破,同时适用于AR与多模态统一模型
....
#GeoVLM-R1
IBM联合苏黎世联邦理工等提出:用强化学习教VLM“看懂”卫星图
随着AI技术的发展,视觉语言模型(VLM)在理解自然图像方面已经取得了长足的进步。但如果把这些模型直接用到地球观测(EO),也就是遥感卫星图像上,效果往往不尽如人意。毕竟,从“上帝视角”看地球,和我们平时看生活照片,是完全不同的体验。
遥感图像的解读包含很多独特的挑战,比如目标检测、区域描述、变化检测、时序分析等等。最近,来自IBM、INSAIT、苏黎世联邦理工学院、穆罕默德·本·扎耶德人工智能大学(MBZUAI)等多个顶尖机构的研究者们,联合提出了一种名为 GeoVLM-R1 的新方法,专门解决这个问题。他们的论文 《GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning》,为我们展示了如何通过强化学习(RL)来“特训”VLM,使其成为一个遥感图像的理解专家。
- 论文标题:GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning
- 作者:Mustansar Fiaz, Hiyam Debary, Paolo Fraccaro, Danda Paudel, Luc Van Gool, Fahad Khan, Salman Khan
- 机构:IBM、INSAIT、苏黎世联邦理工学院、穆罕默德·本·扎耶德人工智能大学、林雪平大学、澳大利亚国立大学
- 论文地址:https://arxiv.org/abs/2509.25026
- 项目主页:https://mustansarfiaz.github.io/GeoVLM-R1/
为何遥感图像需要“特训”?
强化学习在提升模型推理能力方面已经展现了巨大潜力,但在遥感领域的应用还非常有限。直接将为自然图像设计的RL方法用于遥感VLM,会遇到两个主要问题:
- 任务多样性:遥感领域任务五花八门,一个通用的奖励信号(比如“回答正确/错误”)无法为模型提供精确的指导。
- 奖励稀疏:有效的奖励信号很难获得,导致模型训练不稳定,难以收敛。
为了解决这些问题,研究者们提出了一个新颖的后训练框架,其核心思想就是 “因材施教”——为不同的遥感任务设计不同的奖励函数。
GeoVLM-R1的“两阶段”训练法
GeoVLM-R1的训练过程分为两个阶段,如下图所示,首先进行监督微调,然后进行强化学习优化。
第一阶段:监督微调 (Supervised Fine-tuning)
首先,模型在一个包含多种地球观测任务的数据集上进行标准的监督微调。这一步的目的是让模型对遥感图像和相关任务有一个基本的了解,相当于“打好基础”。
第二阶段:基于任务感知奖励的强化学习
这是整个框架的精髓所在。在基础模型之上,研究者们采用了一种基于强化学习的优化策略(GRPO),并为其设计了独特的 任务感知奖励(Task-aware Rewards) 机制。
具体来说,奖励函数由两部分组成:
- 格式奖励 (Format Reward) :确保模型的输出遵循预定义的结构,比如必须包含
<think>...</think>的思考过程和<answer>...</answer>的最终答案。这保证了模型输出的可解释性。 - 任务感知准确率奖励 (Task-aware Accuracy Reward) :这部分是“因材施教”的关键。针对不同的任务,使用不同的评价指标作为奖励。例如:
- 对于 目标检测 任务,使用 交并比(IoU) 作为奖励。
- 对于 多标签分类 任务,使用 召回率(Recall) 作为奖励。
- 对于 图像描述 任务,使用 ROUGE-L或SBERT分数 作为奖励。
通过这种方式,模型在训练的每一步都能得到非常具体和精确的反馈,知道自己应该朝哪个方向优化,从而大大提升了训练的稳定性和最终的性能。
全面超越,效果显著
经过“特训”的GeoVLM-R1,在多个遥感任务基准上都表现出了优异的性能,一致性地超越了现有的通用VLM和专门为遥感设计的VLM。
在分类任务上,无论是零样本学习还是多标签分类,GeoVLM-R1都取得了稳定的性能提升。
在更具挑战性的指代目标检测、区域描述和定位描述等任务上,GeoVLM-R1同样展示了其强大的定位和理解能力。
此外,在变化检测和图像描述等时序相关任务上,GeoVLM-R1也表现出色。
这些实验结果充分证明,通过引入任务感知的强化学习后训练,可以有效提升VLM在复杂多样的遥感任务上的推理能力和鲁棒性。
xx认为,这项工作为如何将强大的基础模型适配到特定专业领域提供了一个极具价值的范例。虽然作者尚未放出代码,但他们承诺会公开发布模型和代码,值得我们持续关注。
....
#GeoComplete
新加坡国立大学提出:融合几何感知,图像补全PSNR提升超17%
最近,图像补全技术又有了新花样。当需要修复的图片区域很大,而且参考的视角又和目标图片差很多时,AI经常会“脑补”出一些奇奇怪怪、甚至有点时空错乱的内容。为了解决这个问题,来自新加坡国立大学的研究团队提出了一个名为GeoComplete的新框架。
简单来说,GeoComplete就像是给AI装上了一双“3D眼睛”。它不再仅仅依赖于2D图像信息,而是创新地引入了场景的3D几何结构作为引导,让图像补全不仅画面好看,更在几何上保持惊人的一致性。这个方法在权威基准测试中,将图像修复的PSNR指标 提升了超过17%,效果非常惊艳。
- 论文标题:GeoComplete: Geometry-Aware Diffusion for Reference-Driven Image Completion
- 作者:Beibei Lin, Tingting Chen, Robby T. Tan
- 机构:新加坡国立大学
- 会议:Accepted by NeurIPS 2025
- 论文地址:https://arxiv.org/abs/2510.03110
- 项目主页:https://bb12346.github.io/GeoComplete/
- 代码仓库:https://github.com/bb12346/geocomplete_codes
研究背景与挑战
参考驱动的图像补全(Reference-driven image completion)任务,是利用同一场景的其他视角图片来修复目标图片中的缺失区域。这在照片修复、虚拟现实等领域很有用。但就像开头提到的,当参考图和目标图视角差异大、有遮挡或者场景里有动态物体时,现有的方法就有点力不从心了。
比如像Paint-by-Example这类方法,它们主要依赖扩散模型(Diffusion Models)强大的生成能力,但因为缺少明确的几何约束,生成的物体常常会出现位置、大小和角度的错乱,看起来就像是随便“P”上去的,缺乏真实感。

上图就直观展示了GeoComplete与业界顶尖方法Paint-by-Example的对比。在处理有大面积缺失的图像时,GeoComplete(Ours)补全的部分在几何结构上明显比后者更合理、更符合真实世界。
GeoComplete的核心方法
为了解决几何一致性的难题,GeoComplete引入了两大核心创新:几何感知扩散(Geometry-Aware Diffusion) 和 目标感知掩码(Target-Aware Masking)。
整个框架的流程如上图所示。它的核心是一个双分支的扩散模型,一个分支处理熟悉的2D图像信息,另一个分支则专门处理3D几何信息,两者通过“联合自注意力机制”协同工作,确保最终生成的内容既符合视觉美感,又遵循几何逻辑。
1. 点云生成:给AI一双“3D眼”
模型的第一步,就是先从输入的参考图和目标图中构建出场景的3D点云。这一步是整个方法的基石。
具体来说,它会先用LangSAM等工具,根据文本提示(比如“猫”)把场景里的动态物体(比如一只走来走去的猫)给分割并移除掉,避免干扰。然后,利用VGGT模型估算出相机的位姿和深度图,最终重建出静态场景的3D点云。这个点云随后会被投影回2D平面,作为几何信息输入给扩散模型。
2. 双分支扩散架构:图像与几何的融合
GeoComplete的设计很巧妙,它没有粗暴地将几何信息和图像信息混在一起,而是设计了一个双分支结构:
- 目标分支(Target Branch):负责处理带遮罩的目标图像,专注于生成缺失区域的视觉内容。
- 点云分支(Cloud Branch):负责处理上一步生成的投影点云,提取纯粹的几何特征。
这两个分支的特征在模型的深层通过联合自注意力(Joint Self-Attention)机制进行融合。这样一来,当模型在“画”缺失部分时,就能时时刻刻参考点云分支提供的几何结构信息,确保画出来的东西“长”在正确的位置上。
3. 目标感知掩码:让模型更“聪明”
另一个亮点是目标感知掩码策略。在训练时,有些区域在参考图里看得到,但在目标图里因为遮挡等原因缺失了。这些区域对于补全来说是“信息富矿”。
GeoComplete会通过3D投影,智能地识别出这些“信息富矿”区域,并在训练时有选择性地对它们进行遮挡。这相当于在告诉模型:“嘿,注意看这些地方,它们能提供你不知道的重要线索!” 这种方式引导模型更高效地利用参考图像,而不是像以前的方法那样随机遮挡,从而在困难场景下表现更佳。
实验效果与分析
GeoComplete在多个基准测试上都取得了当前最佳(SOTA)的性能。
定量分析
从上表可以看到,在RealBench基准上,无论是低阶的PSNR、SSIM,还是高阶的DINO、CLIP等衡量感知质量的指标,GeoComplete都全面超越了之前的参考驱动方法(如Transfill, RealFill)和提示驱动方法。其中,PSNR指标达到了17.32,相比之前的SOTA方法RealFill(14.78)提升了约17.1%,这是一个非常显著的进步。
定性比较
光看数字可能不够直观,直接来看图。
上面两组对比图非常清晰地展示了GeoComplete的优势。无论是建筑的线条、物体的轮廓,还是场景的透视关系,GeoComplete生成的内容都与周围环境完美融合,保持了高度的几何一致性。而其他方法,或多或少都出现了结构扭曲、物体悬浮等问题。
消融实验与鲁棒性
为了证明每个模块的有效性,研究者还做了详尽的消融实验。
结果表明,无论是双分支扩散架构、联合自注意力,还是目标感知掩码,去掉任何一个都会导致性能明显下降。这证明了整个框架设计的合理性和各模块的必要性。
此外,研究者还测试了模型在点云有噪声、稀疏,或者动态物体分割不准等情况下的鲁棒性。结果显示,GeoComplete依然能保持稳定的高性能,展现了其在真实复杂场景中的应用潜力。
上表进一步比较了不同方法的计算开销,GeoComplete在带来巨大性能提升的同时,推理时间也控制在可接受的范围内。
总结
总的来说,GeoComplete通过将明确的3D几何约束引入到扩散模型中,为参考驱动的图像补全任务提供了一个非常强大和鲁棒的解决方案。它不仅解决了长期以来困扰该领域的几何一致性问题,也展示了融合多模态信息(2D视觉 + 3D几何)在生成任务中的巨大潜力。
....
#PocketSR
清华大学等提出:把超分专家放进口袋,4K图像处理仅需0.8秒
大家好,今天想和大家聊一篇非常有意思的新工作,来自清华大学、Joy Future Academy和香港科技大学(广州)的研究者们,他们联手打造了一款名为 PocketSR 的超分模型。
想象一下,手机里的照片模糊不清,细节全无,如果能像变魔术一样,一键让它变得高清锐利,是不是很酷?这就是“真实世界图像超分辨率”(Real-world image super-resolution, RealSR)技术要做的事。但长久以来,效果好的模型都太“重”了,动辄几十亿参数,在手机这种算力有限的设备上跑起来简直是天方夜谭。
而 PocketSR 的出现,就是为了解决这个痛点。它的名字非常形象——“口袋里的超分专家”,目标就是让高质量的生成式超分模型能轻松装进手机里。
下面是这篇论文的基本信息,感兴趣的朋友可以深入研究:
- 论文标题:PocketSR: The Super-Resolution Expert in Your Pocket Mobiles
- 作者团队:Haoze Sun, Linfeng Jiang, Fan Li, Renjing Pei, Zhixin Wang, Yong Guo, Jiaqi Xu, Haoyu Chen, Jin Han, Fenglong Song, Yujiu Yang, Wenbo Li
- 所属机构:清华大学、Joy Future Academy、香港科技大学(广州)
- 论文地址:https://arxiv.org/abs/2510.03012
现有方法的困境与 PocketSR 的破局之道
近几年,基于扩散模型(Diffusion Models)的生成式AI大放异彩,它们在图像生成、修复和超分上都取得了惊人的效果。比如 Stable Diffusion (SD),能够创造出细节丰富、充满真实感的图像。然而,这种强大能力的背后是巨大的计算开销。一个标准的SD模型,参数量巨大,推理一次需要好几秒甚至更久,这对于追求“即时”体验的移动端应用来说,显然是无法接受的。
上图展示了 PocketSR 的实际效果和效率优势。可以看到,无论是建筑的纹理还是人像的细节,PocketSR 都处理得相当出色,同时在模型大小和计算成本上实现了数量级的压缩。
为了让超分模型“飞入寻常百姓家”,研究者们必须对这些庞然大物进行极致的轻量化改造。PocketSR 团队就从两个核心部件下手:VAE(变分自编码器)和 U-Net。
PocketSR 的两大核心创新
PocketSR 的整体框架如下图所示。它巧妙地替换了 Stable Diffusion 中最臃肿的 VAE 部分,并对核心的 U-Net 网络进行了大刀阔斧的“瘦身”。
1. LiteED:给 VAE 来一次极限压缩
在 Stable Diffusion 中,VAE 负责将图像在像素空间和隐空间之间进行转换。它虽然效果好,但计算量和参数量都非常惊人。PocketSR 的作者们设计了一个全新的轻量级编码器-解码器结构,名为 LiteED。
上图是原始 SD VAE 解码器和 LiteED 解码器的结构对比,可以直观地看到 LiteED 在结构上的简化。
LiteED 通过一系列精巧的设计,比如简化网络层、减少通道数等,成功地将 VAE 的参数量 减少了 97.5%,同时还能保持高质量的图像编解码能力。这可以说是整个模型能够“瘦身”成功的第一大功臣。
这张图展示了关于 LiteED 设计的消融研究,证明了其在不同数据集上都能在保持高质量输出的同时,实现轻量化。
2. 在线退火剪枝:让 U-Net “智能瘦身”
U-Net 是扩散模型的核心,负责去噪和生成图像细节。直接裁剪 U-Net 很容易导致性能严重下降。为此,作者提出了一种名为“在线退火剪枝”(Online Annealing Pruning)的策略。
这个策略非常聪明,它不是一刀切地砍掉模型组件,而是在训练过程中,逐步地 将知识从复杂的、即将被剪掉的模块“蒸馏”到保留的轻量级模块中。就像金属退火一样,通过一个平滑、渐进的过程,让模型在瘦身的同时,最大限度地保留原有的“功力”。
为了配合剪枝,作者还引入了“多层特征蒸馏”(Multi-layer Feature Distillation)损失。这能确保在剪枝过程中,轻量化模型不仅学习最终的输出,还能学习到原始大模型中间层的丰富特征,从而更好地继承其强大的生成先验知识。
上图是剪枝策略的消融研究,展示了在线退火和多层特征蒸馏对于维持模型性能的关键作用。
这张表更详细地对比了不同剪枝策略的效果,数据证明了在线退火和多层蒸馏的组合是最优的。
作者还对剪枝的位置和比例进行了详尽的实验分析,确保每一刀都砍在最合适的地方,实现了效率和性能的最佳平衡。
以上表格分别展示了在残差块、交叉注意力、自注意力、前馈网络等不同模块上进行剪枝的性能对比,最终选出了最优的剪枝方案。
作者还探讨了通道剪枝比例的影响,并用实验证明了多层特征蒸馏在不同剪枝率下都能带来稳定的性能提升。
惊人的效果与效率
经过这一系列优化,PocketSR 的最终成品非常惊艳。
- 模型大小:仅为 146M 参数,相比动辄上十亿参数的SOTA模型,小了近10倍。
- 推理速度:处理一张 512x512 的图片,在单张 GPU 上可以达到 超过 60 FPS 的实时性能。更夸张的是,处理一张 4K 分辨率 的超大图像,也仅仅需要 0.8 秒!
上表将 PocketSR 与当前最先进的方法进行了定量比较。可以看到,PocketSR 在多个真实世界数据集上,性能与那些需要多步推理的复杂模型不相上下,甚至在某些指标上更优,而速度却快了几个数量级。
在经典的 DIV2K 数据集上,PocketSR 同样表现出色。
除了冷冰冰的数字,再来看看实际的视觉效果。
上图展示了 PocketSR 与其他方法的定性对比,即使是与需要多步推理的复杂模型相比,PocketSR 生成的图像在结构和纹理细节上都毫不逊色。
更多真实世界图像的超分结果对比,进一步证明了 PocketSR 的强大实力。
作者还通过消融实验证明了 Stable Diffusion 先验知识对于提升模型性能的重要性。
总结
xx认为,PocketSR 这项工作最大的意义在于,它展示了一条如何将庞大的生成模型“驯服”并部署到边缘设备的清晰路径。它没有满足于简单的模型压缩,而是深入到模型结构和训练策略的每一个细节,通过 LiteED 和在线退火剪枝等一系列创新,实现了性能和效率的极致平衡。
这不仅让高质量的图像超分在手机上成为可能,也为其他大模型在端侧的落地提供了借鉴。
....
#HoloV
港科大&上交大提出:剪掉近90%视觉Token,性能不掉点,多模态大模型推理“大瘦身”
多模态大语言模型(MLLMs)虽然功能强大,但处理高分辨率图片时,海量的视觉Token(可以理解为图像的“像素块”信息)带来了巨大的计算开销,让推理速度变得很慢。为了给这些“臃肿”的模型“瘦身”,学术界一直在研究视觉Token剪枝(Token Pruning)技术,也就是丢掉那些不重要的视觉信息。
最近,一篇被 NeurIPS 2025 接收的论文《Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention》对现有的剪枝方法提出了挑战,并带来了一个简单又高效的解决方案—— HoloV。这项研究由香港科技大学、INSAIT、索非亚大学和上海交通大学等机构的研究者们共同完成。HoloV这个名字源于“Holistic Vision”,强调了它在剪枝时所采用的“全局视觉”策略。
- 论文标题: Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
- 作者: Xin Zou, Di Lu, Yizhou Wang, Yibo Yan, Yuanhuiyi Lyu, Xu Zheng, Linfeng Zhang, Xuming Hu
- 机构: 香港科技大学(广州)、香港科技大学、INSAIT 索非亚大学、上海交通大学
- 录用会议: NeurIPS 2025
- 论文地址: https://arxiv.org/abs/2510.02912
- 项目地址: https://github.com/obananas/HoloV
现有方法的困境:只追“高光”,丢失全局
以往的Token剪枝方法,如FastV,大多采用一种“注意力优先”(Attention-First)的策略。它们通过计算文本和视觉之间的交叉注意力,或者利用特殊的[CLS] Token的注意力得分,来判断哪些视觉Token最“重要”,然后保留这些“高光”Token。
这种方法看似合理,但论文作者发现了一个致命缺陷:注意力机制倾向于关注那些语义相似的Token。比如,一张图里有一只猫,那么很多高注意力的Token可能都集中在描述这只猫的不同部位。在高比例剪枝(比如剪掉90%)的情况下,模型保留下来的可能是一堆关于“猫”的冗余信息,而图片中的背景、其他物体等全局上下文信息则被完全丢弃了。这导致模型性能急剧下降。
上图清晰地展示了这个问题,随着剪枝率的提高,基于注意力的方法(虚线)性能急剧恶化,而HoloV(实线)则能在高剪枝率下依然保持强大的性能。
上图右侧的可视化案例更直观,FastV保留的Token(绿色点)高度集中,存在大量冗余,而HoloV保留的Token则分布更均匀,覆盖了更丰富的上下文信息。
HoloV:从全局视角保留视觉上下文
为了解决上述问题,HoloV放弃了只追逐“高光”Token的思路,而是从一个更宏观、更整体的视角(Holistic Perspective)来重新思考Token的保留策略。
HoloV的核心机制可以概括为:
- 划分区域:将输入的图片看作由多个空间区块(Spatial Crops)组成。
- 预算分配:不再将所有“保留名额”都给注意力最高的Token,而是自适应地将剪枝预算分配到不同的空间区块中。
- 全局保留:通过对高亮Token进行重新排序,确保最终保留下来的Token能够覆盖全局的视觉上下文,而不是仅仅聚集在少数几个显著特征上。
通过这种方式,HoloV避免了“表征崩溃”(Representational Collapse)的现象,即使在极高的剪枝率下,也能有效地保留与任务相关的重要信息,实现了局部显著性和全局上下文的平衡。
实验结果:极致的效率-精度权衡
HoloV作为一个即插即用的框架,在多种任务、多种MLLM架构和不同剪枝率下都展现了卓越的性能。
最惊人的结果是,在LLaVA-1.5模型上,HoloV 在剪掉了88.9%的视觉Token后,依然保留了原始模型95.8%的性能,实现了顶尖的效率-精度权衡。
从上面两个性能对比表中可以看到,无论是在哪个基准测试上,HoloV(蓝色字体)的平均性能都远超其他SOTA方法,尤其是在高剪枝率(如87.5%)下,优势更为明显。
在推理速度上,HoloV也带来了实打实的提升。
该方法不仅适用于图像任务,在视频问答(Video QA)任务上同样有效。
下面的可视化案例生动地对比了FastV和HoloV在不同剪枝率下的表现。可以看到,HoloV更好地保留了图片中的关键对象和场景信息(如路标、远处的建筑等),而FastV则丢失了大量重要上下文。
此外,作者还对不同的模型(如Qwen2.5-VL)、不同的剪枝率、不同的超参数(如区块数量)进行了广泛的实验和消融研究,均验证了HoloV的有效性和鲁棒性。
总结
xx认为,HoloV的思路为多模态大模型的效率优化提供了一个全新的、有价值的方向。在追求效率、进行信息压缩时,不能仅仅关注局部的显著性,更要保留信息的完整性和多样性。“全局观”在AI的世界里同样至关重要。HoloV的提出,无疑为实现更高效、更实用的MLLM应用铺平了道路。
....
#MetaSeg
莱斯大学提出:参数减少90%,元学习隐式网络重塑医学图像分割
最近,来自莱斯大学的研究者们在医学图像分割领域投下了一颗“重磅炸弹”。他们提出了一种名为 MetaSeg 的新框架,巧妙地将元学习(Meta-learning)和隐式神经表示(Implicit Neural Representations, INRs)结合起来,旨在解决当前主流分割模型(如U-Net)参数量庞大、计算资源消耗高的问题。
这项研究成果已被 MICCAI 2025 会议接收,并进行了口头报告。最惊人的是,MetaSeg 在脑部MRI分割任务上,以不到10%的参数量,取得了与U-Net相当的性能。这听起来是不是有点不可思议?一起来看看他们是怎么做到的。
- 论文标题: Fit Pixels, Get Labels: Meta-learned Implicit Networks for Image Segmentation
- 作者: Kushal Vyas, Ashok Veeraraghavan, Guha Balakrishnan
- 机构: 莱斯大学
- 论文地址: https://arxiv.org/abs/2510.04021
- 项目主页: https://kushalvyas.github.io/metaseg.html
- 代码仓库: https://github.com/kushalvyas/metaseg
背景:当隐式神经表示遇到分割难题
在深入了解 MetaSeg 之前,我们先简单聊聊隐式神经表示(INRs)。你可以把它想象成一个“压缩”高手,它不是像传统图片那样存储每个像素的RGB值,而是训练一个小型神经网络,让这个网络学会一个坐标到信号(比如颜色、密度)的映射。只要给这个网络一个坐标(x, y),它就能告诉你这个点的颜色是什么。这种方法在三维重建、新视角合成等领域(比如大名鼎鼎的NeRF)取得了巨大成功,因为它能用极少的参数量表达极其复杂的信号。
然而,INRs 有个天生的“缺陷”:它通常是为单个信号(比如一张图片、一个三维场景)“量身定制”的,很难学习到一类数据(比如所有大脑的MRI图像)的共性语义结构。而图像分割恰恰需要模型理解这些共性,比如“这块区域是海马体”,“那块区域是脑干”。因此,直接把标准INR用于分割任务,效果往往不尽人-意。
另一方面,像 U-Net 这样的卷积神经网络(CNNs)虽然在医学图像分割上是“霸主”,但它们通常参数量巨大,训练和推理都需要消耗大量计算资源,这在许多资源受限的临床环境中是个不小的挑战。
方法:MetaSeg的“元学习”魔法
MetaSeg 的核心思想非常巧妙,它没有强迫INR去直接学习一个通用的分割模型,而是换了一种思路:“授人以渔”而非“授人以鱼”。它通过元学习,为INR找到了一个“最佳起点”,使其能够在面对一张新图像时,通过快速的自我调整,迅速掌握分割能力。
具体来说,MetaSeg 的流程分为两步:
- 元学习(Meta-learning)阶段:在训练阶段,MetaSeg 使用一个包含图像和对应分割标签的数据集。它的目标不是训练出一个能直接用的模型,而是学习一套最优的INR初始参数(θ∗, ϕ∗)。这套参数就像一个“万能钥匙”的模板,蕴含了脑部MRI图像的通用结构知识。这个INR很特别,它不仅能根据坐标预测像素强度(用于重建图像),还能预测该点的类别标签(用于分割)。
- 测试(Test-time)/微调阶段:当遇到一张新的、从未见过的测试图像时,MetaSeg 会加载这套预先学好的“最佳起点”参数。然后,它只根据新图像的像素信息进行快速微调(fit pixels),让INR网络去拟合这张新图像。由于起点非常好,网络不需要从零开始学习。当网络能够很好地重建出原图时(即像素拟合得差不多了),它的分割“技能”也随之被激活,能够准确地输出每个像素的类别标签(get labels)。
上图展示了这个神奇的过程。在微调刚开始时,分割效果还比较粗糙,但仅仅迭代几次(例如2次),Dice分数就迅速飙升到了0.85。随着对图像像素的拟合越来越好,分割精度也越来越高,最终在少量迭代后(如100次)达到最佳。这个过程体现了“拟合像素即可获得标签”的核心思想。
实验:轻量级模型的强大实力
口说无凭,实验为证。MetaSeg 在2D和3D的脑部MRI分割任务上都展示了其强大的竞争力。
从上方的定量比较表中可以看到,无论是在2D还是3D任务上,MetaSeg 的 Dice 分数都与主流的 U-Net 模型不相上下。但最关键的是它的参数量,MetaSeg-S 版本的参数量仅为0.2M,相比于 U-Net 的2.1M,足足减少了约90%!这意味着更低的内存占用和更快的潜在推理速度。
定性结果同样令人印象深刻。上图展示了 MetaSeg 在2D脑部MRI上对24个不同脑区的精细分割结果。即便是对于形态变化多样的结构,如心室(紫色)、脑干(灰色)和海马体(黄色),MetaSeg 都能给出准确的分割。
在更具挑战性的3D MRI容积分割上,MetaSeg 同样表现出色,能够精确地重建和分割三维脑部结构,与真实标签的吻合度(Dice)达到了0.93。
为什么MetaSeg能成功?
为了探究MetaSeg成功的秘诀,研究者们做了一项非常有趣的实验。他们将MetaSeg学到的特征与标准INR学到的特征进行了PCA可视化对比。
结果一目了然。标准INR学到的特征(右侧)看起来杂乱无章,缺乏明显的结构信息。而MetaSeg学到的特征(左侧)则与解剖结构高度相关:不同的主成分清晰地对应着大脑的不同区域,如内部脑区、心室、大脑皮层等。这说明,通过元学习,MetaSeg的INR被引导去学习对分割任务有意义的、具备语义信息的特征表示。
此外,消融实验也证明了他们提出的联合元学习初始化策略的优越性,显著优于随机初始化或只在图像上进行元学习等其他方案。
xx认为,MetaSeg为医学图像分割提供了一个全新的、极具潜力的视角。它不仅大大降低了模型的参数量,还展示了INR在处理复杂预测任务上的潜力。这种“学习一个好的起点”的元学习范式,对于处理小样本学习、个性化医疗数据等场景,可能有着巨大的应用价值。作者表示将开源了代码,鼓励感兴趣的读者去尝试。
....
#EEMFlow
电子科大等提出:从事件相机学习高效Meshflow与光流,速度提升30倍
大家好,今天想和大家聊一篇非常有意思的新工作,来自电子科技大学、香港科技大学和西南交通大学的研究者们,他们关注的是一个越来越火的领域——事件相机(Event Camera)。
这篇被 TPAMI 2025 录用的论文,标题为《Learning Efficient Meshflow and Optical Flow from Event Cameras》,不仅提出了一个全新的任务——基于事件的网格流估计(event-based meshflow estimation),还带来了一整套解决方案,包括一个大规模数据集和一个超高效的模型。
简单来说,事件相机是一种模仿生物眼睛工作原理的传感器,它不像传统相机那样固定频率曝光,而是只在像素亮度发生变化时才产生“事件”信号。这让它在处理高速运动和高动态范围场景时优势明显,不会产生运动模糊。而“Meshflow”则是一种稀疏的运动表示,它通过追踪网格顶点的位移来描述场景的动态,比计算每个像素运动的光流(Optical Flow)要高效得多。
作者们发现,虽然事件相机好处多多,但在 Meshflow 估计这个方向上,还存在两大难题:一是缺少专门的、带标注的数据集;二是事件数据本身密度不均的问题一直没得到很好的解决。
- 论文标题: Learning Efficient Meshflow and Optical Flow from Event Cameras
- 作者: Xinglong Luo, Ao Luo, Kunming Luo, Zhengning Wang, Ping Tan, Bing Zeng, Shuaicheng Liu
- 机构: 电子科技大学; 香港科技大学; 西南交通大学
- 论文地址: https://arxiv.org/abs/2510.04111
- 项目主页: https://github.com/boomluo02/EEMFlowPlus
- 代码仓库: https://github.com/boomluo02/EEMFlowPlus
- 录用信息: Accepted by TPAMI 2025
面对这些挑战,作者们可以说是“从无到有”地搭建了一套研究框架。
挑战与动机:为何需要新的数据集和方法?
事件相机虽然强大,但不同设备、不同场景下采集到的事件数据,其“密度”——即事件点的数量和分布——千差万别。如下图所示,现有的几个真实世界数据集(240C, MVSEC, DSEC, EventVOT)的事件密度分布几乎没有重叠,分辨率也各不相同,这给模型的泛化能力带来了巨大挑战。
此外,当时领域内还没有专门为 Meshflow 任务设计的大规模事件数据集,这极大地限制了相关研究的展开。
HREM/HREM+:首个大规模事件Meshflow数据集
为了解决数据荒的问题,作者首先构建了一个大规模、高分辨率(1280x720)的事件Meshflow数据集,命名为 HREM (High-Resolution Event Meshflow)。
上图展示了整个数据生成流程。他们从3D场景和相机参数出发,生成高帧率视频和密集的光流,然后通过事件模拟器生成事件数据,并最终处理得到作为基准真相(Ground Truth)的 Meshflow 标签。
为了让大家更直观地理解,上图展示了从密集光流生成稀疏 Meshflow 的过程,通过对网格顶点的运动进行中值滤波,最终得到平滑且鲁棒的运动场。
相比之前的同类数据集,HREM 的优势非常明显:
不仅如此,为了研究事件密度对模型性能的影响,作者还将 HREM 扩展为 HREM+ ,这是一个多密度事件数据集,为模型的鲁棒性研究提供了宝贵的资源。
HREM+ 数据集中不同密度的事件数据可视化
EEMFlow:轻量且高效的事件Meshflow网络
有了数据,接下来就是模型了。作者提出了一个名为 EEMFlow (Efficient Event-based MeshFlow) 的轻量级网络。
这是一个精心设计的编码器-解码器架构,输入是两个时间窗口内的事件体素网格(Voxel Grid),输出是预测的 Meshflow。它通过金字塔编码器提取多尺度特征,并利用扩张特征相关性(Dilated Feature Correlation)来计算代价空间(Cost Volume),最终由解码器输出结果。整个设计兼顾了速度和精度。
EEMFlow+:向密集光流的升级
作者并未止步于稀疏的 Meshflow,他们将 EEMFlow 升级为 EEMFlow+ ,使其能够支持密集的事件光流估计。这里的关键是一个名为 CDC (Confidence-induced Detail Completion) 的模块。
CDC 模块结合了基于密集卷积网络的自修正器(Self-corrector)和基于自注意力机制的自相关(Self-correlation),能够在从粗到精的光流恢复过程中,有效地修正双线性上采样带来的误差,从而保留清晰的运动边界。
ADM:应对变化的事件密度
为了解决前面提到的事件密度不一的“老大难”问题,作者还设计了一个即插即用的 ADM (Adaptive Density Module) 模块。
ADM 能够自适应地将输入事件数据的密度调整到一个更优的范围,这极大地增强了模型在不同场景、不同设备下的泛化能力。
惊人的实验结果:速度与精度的双重胜利
是骡子是马,拉出来遛遛。EEMFlow 的表现确实没让人失望。
从上图的计算开销与精度对比中可以看到,EEMFlow(红色圆圈)在保持极低端点误差(EPE)的同时,推理时间大幅领先,参数量也极小。
在 HREM+ 数据集上的定量比较更是直接。与近期的SOTA方法(如ERAFT)相比,EEMFlow将推理时间减少了92%(从93 ms减少到7 ms),参数量也大幅减少,而精度(Avg EPE)却依然领先。
定性效果如何?来看几组对比。
在HREM数据集上的Meshflow估计效果对比,EEMFlow的结果更接近真实情况。
使用估计的Meshflow进行图像对齐,EEMFlow带来的鬼影更少,说明对齐更准。
在DSEC数据集上的光流预测对比,EEMFlow+ 的结果细节更丰富,边界更清晰。
此外,实验还证明了 ADM 模块的巨大价值。加入 ADM 后,EEMFlow 和 EEMFlow+ 的性能分别提升了约 8% 和 10%,展现了其强大的泛化能力。
xx觉得,这项工作最亮眼的地方在于它的系统性。作者不仅敏锐地指出了领域空白,还亲手填补了它——从构建高质量数据集到设计超高效模型,再到解决实际应用中的核心痛点(数据密度),一气呵成,为事件相机的运动估计领域铺设了一条宽阔的道路。
作者已经将代码和数据集全部开源,感兴趣的朋友可以去项目主页一探究竟。
....
#Blendshape
帝国理工学院提出,引导扩散模型:精准控制人脸表情,身份始终如一
大家好,xx。今天想和大家聊聊一个在AI生成内容领域非常有意思的进展。我们都知道,让AI画一张人脸不难,但要让它在保持同一个人身份(ID)的同时,还能精准地做出各种细腻、甚至夸张的表情,一直是个技术难题。很多模型要么是“换脸不换人”,表情做不准;要么是“表情到位了,人却不像了”。
最近,来自帝国理工学院的研究者们带来了一项新工作,感觉给这个问题提供了一个相当漂亮的解决方案。他们发表在ICCVW 2025上的论文,提出了一种基于扩散模型的框架,通过“混合形状(Blendshape)”参数来引导,实现了身份一致且表情精准的人脸生成。
- 论文标题: ID-Consistent, Precise Expression Generation with Blendshape-Guided Diffusion
- 作者: Foivos Paraperas Papantoniou, Stefanos Zafeiriou
- 机构: 帝国理工学院
- 论文地址: https://arxiv.org/abs/2510.04706
- 代码仓库: https://github.com/foivospar/Arc2Face
一起来看看他们是怎么做到的。
背景:身份与表情的“两难困境”
在AI驱动的数字人、虚拟化身和自动故事生成等应用中,两个核心能力缺一不可:一是身份一致性,确保角色从始至终都是同一个人;二是精准的表演控制,能够随心所欲地控制角色的表情和动作。
近期的扩散模型在人脸身份保持方面取得了长足的进步,比如Arc2Face等模型已经能很好地根据一张照片生成同一个人的不同图像。然而,要在这个基础上实现对表情的精细化控制,同时不损害身份特征,依然充满挑战。现有方法往往难以驾驭那些微妙的微表情或是连续的表情变化,更不用说一些比较夸张、不对称的表情了。
上图直观展示了该方法的效果。左侧显示了模型可以利用blendshape参数,为任意主体生成各种精细甚至不对称的表情,效果优于现有方法。右侧则展示了其利用参考适配器(Reference Adapter)在不改变外观和背景的情况下编辑真实照片表情的能力。
方法:Blendshape引导的组合式设计
为了解决上述难题,研究者们在一个强大的ID一致性人脸模型(Arc2Face)的基础上,设计了一个巧妙的组合式框架。这个框架的核心思想是“解耦”,即将身份控制和表情控制分开处理,再优雅地融合。
整个框架如上图所示,主要包含两个创新点:
表情适配器 (Expression Adapter)
这是实现精准表情控制的关键。它的工作流程是:
- 提取表情参数:首先,使用一个现成的3D人脸重建方法,从一张参考表情图片中提取出FLAME模型的blendshape参数。你可以把blendshape理解为一组控制脸部肌肉运动的“滑块”,比如“眉毛上扬”、“嘴角微笑”等,通过数值来精确描述一个表情。
- 参数映射:一个简单的多层感知机(MLP)将这些数值化的blendshape参数映射到CLIP模型的潜在空间中。
- 双重注意力引导:在扩散模型的U-Net去噪过程中,研究者设计了一个双重交叉注意力机制。身份特征(ID embedding)和表情特征(expression features)分别拥有独立的键(key)和值(value)矩阵。这样一来,模型在生成图像的每一步,都能同时“关注”身份信息和表情信息,确保两者互不干扰,最终实现“形神兼备”。
可插拔的参考适配器 (Reference Adapter)
这个模块让模型具备了编辑真实照片的能力。
- 它引入了一个专门的Reference UNet,用于提取输入图像的多尺度特征。
- 这些特征通过LoRA权重调节的自注意力层,被注入到主干U-Net中。
- 在推理时,只要激活这个适配器,模型就能在保持原始图像外观(如光照、背景)和人物身份的同时,仅仅改变其面部表情。
通过在包含丰富表情变化的图像和视频数据集上进行训练,该模型不仅能生成喜怒哀乐等基本表情,还能驾驭此前工作经常忽略的微妙微表情和连续的表情过渡。
效果如何?
无论是定量分析还是定性比较,该模型都展示了卓越的性能。
与ID驱动方法的比较
在仅给定身份ID和目标表情参数的条件下,与PhotoMaker和EMO等方法相比,该模型生成的表情保真度更高,身份保留也更出色。
上图的视觉对比非常明显,在面对一些夸张或独特的表情时,其他方法要么表情复现不到位,要么人物身份发生了偏移,而本文方法则稳定地保持了高水准。
定量数据也证实了这一点。左图显示,该模型生成人脸与输入人脸的身份特征余弦相似度分布更接近1,意味着身份一致性极高。右图的用户偏好研究则表明,超过70%的用户认为该方法生成的表情更准确。
与参考图像驱动方法的比较
在编辑真实图像的场景下,与DreamFace、Face-diffuser等方法相比,该模型同样表现更优,能够更忠实地迁移表情,同时更好地保留身份和视觉一致性。
身份特征的余弦相似度分布(上图)再次证明了其在身份保持上的优势。
消融研究与失败案例
研究者还通过消融实验证明了他们设计选择的优越性。例如,直接使用ControlNet或基于面部表情识别(FER)网络的深度特征,效果均不如使用blendshape参数来得直接和精确。
当然,模型并非完美。在某些情况下,当参考图像的姿态或表情过于极端时,参考适配器可能会过度依赖源图像,导致表情迁移失败。不过,研究者发现通过调整LoRA的缩放因子,可以在姿态一致性和表情保真度之间进行权衡,缓解这一问题。
下面是一些补充的视觉效果对比和生成样本,大家可以更直观地感受到该方法的强大能力。
xx觉得,这项工作通过引入经典的3D人脸参数(blendshape)来指导强大的2D生成模型(扩散模型),实现了一种“古典与现代”的完美结合。它不仅提升了表情生成的可控性和精确性,也为未来数字人、虚拟现实和影视制作等领域提供了更具表现力的工具。作者已经开源了代码,感兴趣的朋友可以去亲自体验一下。
....
#Video-LMM Post-Training
罗切斯特大学等发布首个Video-LMM后训练综述:深入剖析SFT、RL与TTS三大支柱
最近,来自罗切斯特大学、美国西北大学、卡内基梅隆大学、加州大学圣塔芭芭拉分校、普渡大学、纽约大学、牛津大学、布朗大学、弗吉尼亚大学以及索尼集团的研究者们,联合发布了一篇非常及时的综述论文。这篇论文首次对视频大模型(Video-LMM)的“后训练” (Post-Training) 阶段进行了系统性的梳理和深入探讨。
简单来说,如果说预训练让模型具备了基础的感知能力,那么后训练就是将其从一个“能看懂”视频的系统,转变为一个“会思考”视频的推理引擎的关键阶段。这篇综述为我们描绘了一幅清晰的技术地图,帮助我们理解如何让视频大模型变得更强大、更智能。
- 作者: Yunlong Tang, Jing Bi, Pinxin Liu, Zhenyu Pan, Zhangyun Tan, Qianxiang Shen, Jiani Liu, Hang Hua, Junjia Guo, Yunzhong Xiao, Chao Huang, Zhiyuan Wang, Susan Liang, Xinyi Liu, Yizhi Song, Yuhe Nie, Jia-Xing Zhong, Bozheng Li, Daiqing Qi, Ziyun Zeng, Ali Vosoughi, Luchuan Song, Zeliang Zhang, Daiki Shimada, Han Liu, Jiebo Luo, Chenliang Xu
- 机构: 罗切斯特大学,西北大学(NU),CMU , UCSB ,普渡大学,NYU,牛津大学,布朗大学,弗吉尼亚大学,索尼
- 论文标题: Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
- 论文地址: https://arxiv.org/abs/2510.05034
- 项目主页: https://github.com/yunlong10/Awesome-Video-LMM-Post-Training
研究背景:从“感知”到“推理”的鸿沟
视频理解是计算机视觉领域最具挑战性的前沿之一。它不仅要求模型能够处理复杂的时空关系和长期依赖,还需要整合多模态的证据。近年来,结合了视觉编码器和强大语言解码器的视频大模型(Video-LMM)在视频理解任务上展现了惊人的潜力。
然而,将这些模型从基础的感知系统转变为复杂的推理引擎的关键阶段——后训练,在现有文献中的讨论却相对零散。不同的研究提出了各种方法,但缺乏一个统一的框架来理解这些技术的作用和联系。这正是本篇综述试图解决的核心问题。
上图展示了从2024年11月到2025年9月期间,Video-LMM后训练领域的研究趋势,可以看出这个方向的热度正在迅速攀升。
核心框架:后训练的三大支柱
这篇综述提出了一个结构化的分类法,将Video-LMM的后训练方法归纳为三大基本支柱。这个框架清晰地阐明了不同技术在提升模型推理能力方面所扮演的角色。
论文的核心框架如下图所示,涵盖了从数据、模型到评估的整个后训练流程。
监督微调 (Supervised Fine-Tuning, SFT)
SFT是后训练的第一步,旨在让模型学会遵循指令,并生成高质量的响应。特别地,结合思维链(Chain-of-Thought, CoT)的SFT,通过在微调数据中加入详细的推理步骤,可以显著提升模型在复杂推理任务上的表现。这相当于手把手地教模型如何“思考”和“解释”它的答案。
基于可验证目标的强化学习 (Reinforcement Learning, RL)
在SFT之后,RL被用来进一步对齐模型的行为,使其输出更符合人类的偏好或事实的准确性。与传统RLHF(基于人类反馈的强化学习)依赖主观偏好不同,视频任务的RL可以利用更客观、可验证的目标。例如,可以通过自动评估模型生成答案的正确性(如判断视频中的物体位置、计数是否准确)来设计奖励信号(Reward)。
论文总结了用于Video-LMM后训练的策略优化方法,包括基于偏好的对齐、验证器引导的流程等。
同时,奖励设计是RL中的关键,上表对Video-LMM后训练中的奖励设计进行了分类。
测试时扩展 (Test-Time Scaling, TTS)
TTS是一种“免费的午餐”,它通过在推理阶段增加计算量来提升模型性能,而无需重新训练。在视频任务中,TTS可以表现为多种形式,比如处理更高分辨率或更多的视频帧、在解码时生成多个候选答案并进行择优等。这些方法能够有效提升模型在处理长视频和需要精细时空定位任务上的表现。
模型、数据集与挑战
除了方法论,综述还全面梳理了当前主流的Video-LMM模型、用于后训练和评估的关键数据集及基准。
上表总结了主流的视频推理大模型及其关键信息。
上表则整理了在Video-LMM后训练中常用的数据集,为研究者提供了宝贵的资源索引。
最后,论文指出了当前领域面临的关键挑战,包括:
- 奖励设计:如何为复杂的视频任务设计出既准确又高效的奖励函数。
- 可扩展性:如何将后训练方法扩展到更长的视频和更大的模型。
- 成本与性能的权衡:如何在巨大的计算开销和模型性能之间找到最佳平衡点。
xx认为,这篇综述为视频理解领域的研究者和实践者提供了一个极其宝贵的统一框架。它不仅厘清了各种后训练技术的脉络,还指明了未来的研究方向和开放性问题。作者开源的资源库也为社区提供了一个共同学习和跟进的平台。
....
#JanusVLN
双重隐式记忆机制解耦语义与空间,开启视觉语言导航新范式
JanusVLN 把导航记忆拆成「语义+3D 空间」两份固定长度的隐式向量,单目 RGB 即可建模「最远黄色凳子」等细粒度方位,R2R-CE 成功率冲到 60.5%,推理延迟最高降 90%,让 VLN 首次摆脱显式地图膨胀烦恼。
- 论文标题:JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
- 论文链接:https://arxiv.org/abs/2509.22548
- 项目主页:https://miv-xjtu.github.io/JanusVLN.github.io/
- 代码地址:https://github.com/MIV-XJTU/JanusVLN
,时长00:53
01 研究背景与核心挑战
视觉-语言导航(Vision-and-Language Navigation, VLN)作为xx智能的关键任务,要求智能体在未知三维环境中,仅凭自然语言指令与连续视觉输入完成自主导航。近年来,多模态大语言模型(MLLM)显著提升了VLN的语义理解能力,但其普遍依赖的显式记忆机制——如构建文本认知地图或缓存历史图像帧——正成为性能提升的瓶颈。

现有方法面临三大根本性挑战:
- 空间信息严重失真:文本地图难以精确表达物体间的连续空间关系(如距离、方位),导致关键几何信息永久丢失;
- 计算效率低下:每一步决策需重复编码整个历史观测序列,计算开销随轨迹长度线性增长;
- 记忆无限膨胀:显式记忆规模随导航时长持续扩大,造成信息检索困难与“记忆爆炸”。
更深层次的问题在于,当前模型的视觉编码器多源自为二维图文匹配设计的CLIP范式,虽擅长语义理解,却严重忽视RGB图像作为三维世界投影所蕴含的透视、遮挡等丰富几何线索,制约了复杂场景下的空间推理能力。
02 创新突破:JanusVLN与双重隐式记忆范式
受人类大脑左右半球分别处理语义与空间信息的启发,我们提出JanusVLN——首个基于双重隐式记忆(Dual Implicit Memory)的VLN框架。该范式将智能体的记忆系统解耦为两个独立、固定大小的紧凑神经表征:
- 语义记忆:由2D视觉语义编码器(基于Qwen2.5-VL)提取“这是什么”的高层语义;
- 空间几何记忆:由3D空间几何编码器(基于预训练VGGT模型)推断“它在哪里及空间关系如何”的三维结构。
二者协同工作,仅需单目RGB视频流输入,即可赋予模型强大的三维空间感知能力,无需依赖深度相机或激光雷达等昂贵传感器。

03 高效增量式记忆更新机制
为彻底解决记忆膨胀与计算冗余问题,JanusVLN设计了一种混合增量更新策略:
- 初始窗口(Initial Window):永久保留起始若干帧的键值(KV)缓存,作为全局注意力锚点(“Attention Sinks”),维持长时序任务一致性;
- 滑动窗口(Sliding Window):动态缓存最近N帧的KV,确保对近期环境的敏锐感知。
该机制将记忆容量固定,每步仅处理当前帧,并通过注意力机制直接复用历史隐式记忆,避免对历史帧的重复计算,推理效率显著提升。
04 实验验证:全面超越现有方法
我们在VLN-CE(R2R与RxR)两大权威基准上进行了系统评估:
- 单目RGB输入下的SOTA性能:
- 在R2R-CE上,成功率(SR)达60.5%,较同类RGB方法(如NaVILA、StreamVLN)提升3.6–10.8个百分点;
- 在更具挑战性的RxR-CE上,SR达56.2%,领先先前方法3.3–30.7个百分点。
- 超越多模态输入方法:
仅用单目RGB输入,性能即超越依赖全景图、深度图、里程计等多源数据的先进方法10.5–35.5个百分点。 - 高效推理与强泛化能力:
推理延迟降低69%–90%,且在无额外训练数据情况下仍显著优于使用辅助数据的基线,验证了双重隐式记忆的高效性与泛化性。



05 定性分析:精准空间推理能力
在需精细三维理解的任务中(如“停在绿色盆栽旁边而非前方”、“走向最远的黄色凳子”),JanusVLN凭借其空间几何记忆,展现出卓越的环境建模与决策能力,成功完成复杂指令。

06 总结与展望
JanusVLN通过引入双重隐式神经记忆,首次在VLN中实现语义与空间感知的解耦建模,从根本上突破了显式记忆机制的局限。该框架不仅刷新了VLN领域的SOTA纪录,更推动研究范式从“2D语义主导”迈向“3D空间-语义协同”的新阶段,为构建具备高级空间认知能力的下一代xx智能体奠定了关键技术基础。
....
#SegMASt3R
AUPRC提升30%,宽基线分割匹配迎来新SOTA
最近,来自印度海得拉巴信息技术学院(IIIT Hyderabad)、海德堡大学和穆罕默德·本·扎耶德人工智能大学(MBZUAI)的研究者们,共同提出了一种名为 SegMASt3R 的新方法,专门解决计算机视觉中一个颇具挑战性的任务:宽基线图像的分割匹配(Segment Matching)。
简单来说,这个任务就是要在两个从非常不同、甚至完全相反的视角(比如旋转了180度)拍摄的图像中,准确地找到并匹配上相同的物体或区域。传统的关键点匹配在这种大视角变化下常常“失灵”,而分割匹配关注的是整个区域,因此在遮挡、光照变化和视角变化面前更加稳健。
SegMASt3R巧妙地借助了3D基础模型(3D Foundation Models)强大的空间理解能力,显著提升了匹配的准确性。这项工作已被NeurIPS 2025接收为Spotlight论文(前3.5%)。
- 论文标题: SegMASt3R: Geometry Grounded Segment Matching
- 作者: Rohit Jayanti, Swayam Agrawal, Vansh Garg, Siddharth Tourani, Muhammad Haris Khan, Sourav Garg, Madhava Krishna
- 机构: 印度海得拉巴信息技术学院(IIIT Hyderabad);海德堡大学;穆罕默德·本·扎耶德人工智能大学
- 论文地址: https://arxiv.org/abs/2510.05051
- 项目主页: https://segmast3r.github.io/
研究背景
想象一下,你先对着一个房间的正面拍了张照,然后又跑到房间的另一头,对着几乎相同的场景又拍了一张。这两张照片的视角差异巨大,很多物体看起来会很不一样。分割匹配要做的,就是在这两张照片里,把同一个沙发、同一张桌子给对应起来。
这项技术是很多高级视觉任务的基石,比如视频中的物体跟踪、场景图构建(Scene-Graph Construction)和即时定位与地图构建(SLAM)。然而,当视角变化过大时,即“宽基线”(wide-baseline)情况,现有的方法就很容易出错。它们要么因为依赖2D图像的外观特征而无法处理剧烈的几何变形,要么会混淆场景中相似的物体(比如两把一模一样的椅子)。
SegMASt3R方法详解
为了攻克这一难题,研究者们想到了一个绝妙的主意:借助3D基础模型的“几何感”。他们选择了MASt3R这个强大的3D基础模型作为主干网络。MASt3R本身就经过了大量3D视觉任务的训练,对场景的深度、形状和位姿有着深刻的理解。
SegMASt3R的整体流程如下图所示:
- 特征提取:首先,将一对宽基线图像输入到一个冻结的MASt3R骨干网络中,提取出包含几何信息的块级特征(patch-level features)。
- 分割特征聚合:同时,使用一个现成的分割工具(如SAM2)或真实标注(ground truth)来获取图像中的各个分割区域(masks)。然后,一个新设计的“分割特征头”(Segment-Feature Head)会将块级特征聚合成每个分割区域的专属描述符(per-segment descriptors)。
- 可微分匹配:最后,通过一个可微分的最优传输层(differentiable optimal-transport layer)来计算两张图中所有分割描述符之间的相似度,并输出最终的匹配结果。这个匹配层还包含一个“垃圾桶”(dustbin)机制,可以把在一张图中出现但另一张图中没有的物体给“扔进去”,避免错误匹配。
整个模型是端到端训练的,通过一个类似于SuperGlue的对比损失函数进行优化,让匹配上的分割区域特征更接近,没匹配上的更疏远。
实验效果惊人
为了验证SegMASt3R的实力,研究者们在ScanNet++和Replica这两个主流的室内场景数据集上进行了大量实验。
定量分析
实验结果表明,SegMASt3R在所有视角变化范围(从0°到180°)内,其性能都 远超当前最先进的方法,包括SAM2的视频传播器和多种局部特征匹配方法(LFM)。在衡量匹配精度的关键指标AUPRC上,提升幅度最高可达30%。
上表展示了在ScanNet++数据集上,随着视角差异(Pose-bins)增大,不同方法的性能变化。可以看到,SegMASt3R(最后一行)在所有区间都取得了最佳成绩(蓝色单元格),尤其是在90°-180°的大角度变化下,优势极为明显。
在Replica数据集上的结果也同样出色:
研究者还测试了模型在室外数据集MapFree上的泛化能力,以及在使用FastSAM产生的带噪声的分割掩码时的鲁棒性,SegMASt3R同样表现稳健。
消融实验也证明了模型设计的合理性,特别是MASt3R的跨视角注意力机制(cross-attention)对于提供关键的几何上下文至关重要。
定性效果
光看数字可能不够直观,下面的对比图能更清楚地展示SegMASt3R的强大。
在ScanNet++数据集中,面对几乎180°的视角变化,SAM2的视频传播方法完全“看花了眼”,把墙(粉色)和门(蓝色)错误地匹配到了一起。而SegMASt3R即使在视觉重叠极小的情况下,也能精准地找到正确的对应关系。
在室外场景中,DINOv2会混淆广告牌的两条腿,而SegMASt3R能正确区分。更有趣的是,当一个物体在另一张图中不可见时,SegMASt3R的“垃圾桶”机制会生效,正确地将其标记为“无匹配”,而DINOv2则会随便找一个不相关的物体匹配上去。
下游任务应用
更重要的是,SegMASt3R的优异性能可以直接赋能下游应用。
- 3D实例建图(3D Instance Mapping):在Replica数据集上,使用SegMASt3R进行跨帧的实例关联,其性能远超之前的SOTA方法ConceptGraphs,平均精度(AP)大幅提升。
- 图像目标导航(Image-Goal Navigation):研究者将SegMASt3R集成到导航方法RoboHop中,替换了原来基于DINOv2的匹配模块。结果显示,导航成功率(SPL)绝对提升了27%。如下图所示,基于DINOv2的导航机器人会因为错误地将墙壁匹配到柜子上而“迷路”,而SegMASt3R则能正确引导机器人穿过浴室,找到目标。
总结
xx认为,SegMASt3R的成功,关键在于它没有局限于2D图像的外观信息,而是巧妙地“站在巨人的肩膀上”,利用了3D基础模型预训练好的几何先验知识。这种“几何驱动”的思路为解决计算机视觉中长期存在的宽基线匹配问题提供了一个非常有效且简洁的新范式。它不仅在基准测试上取得了SOTA的性能,更在实际的机器人导航等任务中展现了巨大的应用潜力。
....
#CalibCLIP
中科院腾讯等联手提出:无需训练,校准CLIP“注意力偏差”,图像检索更精准
最近,视觉语言模型(VLM)在图文检索任务中大放异彩,但大家有没有发现,它们有时候会有点“跑偏”?模型可能过于关注图片里的背景、或者文本中一些非常通用的词汇,而忽略了那些真正能区分细节的关键信息。xx今天和大家分享一篇来自ACMMM 2025的最新研究,由中国科学院、哈尔滨工业大学(深圳)、西南交通大学和腾讯的研究者们共同完成。
他们提出了一个名为 CalibCLIP 的即插即用、无需训练的校准方法,专门解决VLM中的“主导语义”问题,让图文检索更精准。CalibCLIP这个名字也很有意思,可以理解为“校准版的CLIP (Calibrated CLIP)”,直指其核心功能。
- 论文标题: CalibCLIP: Contextual Calibration of Dominant Semantics for Text-Driven Image Retrieval
- 作者: Bin Kang, Bin Chen, Junjie Wang, Yulin Li, Junzhi Zhao, Junle Wang, Zhuotao Tian
- 机构: 中国科学院, 中国科学院大学, 哈尔滨工业大学(深圳), 西南交通大学, 腾讯
- 论文地址: https://arxiv.org/abs/2510.05586
- 代码仓库: https://github.com/kangbin98/CalibCLIP
- 录用信息: ACMMM 2025 (Oral)
“注意力跑偏”的老大难问题
现有的视觉语言模型,如我们熟知的CLIP,在进行图文匹配时,依赖于一个全局语义的对齐。模型会将图片和文本分别编码成一个全局特征向量,然后计算它们的相似度。问题在于,这个“全局特征”的生成过程并不完美。
研究者发现,无论是图片还是文本,总有那么一小部分“贡献低”的Token(可以理解为图片中的小块或文本中的词语)会不成比例地占据主导地位,过度捕获全局语义,从而抑制了那些真正具有辨别力的关键特征。
在视觉上,模型可能过度关注背景等低信息区域;在文本上,则可能过度依赖像“teddy”和“bear”这样的通用概念词,而当这些词被遮盖后,对其他更具辨识度词语的注意力才显著提升。
下面的注意力图也直观展示了这一点:基线模型(CLIP)的注意力(CLS Token)分散在很多无关区域,而CalibCLIP则能更准确地聚焦到任务相关的主体上。
这种现象导致模型在面对高度相似的样本时,区分能力会下降。
CalibCLIP:双管齐下的校准策略
为了解决这个问题,作者提出了 CalibCLIP 框架,它是一个无需训练的即插即用模块,从视觉和文本两个空间进行“校准”。
其核心思想可以分为两个部分:
1. 视觉空间:对比视觉增强器 (Contrastive Visual Enhancer, CVE)
CVE的目标是抑制视觉特征中的“主导”噪声。它分为三步:
- 视觉空间解耦:首先,利用文本查询作为参考,将图像特征解耦为“目标区域”和“低信息区域”(如背景)。
- 主导Token定位:在低信息区域中,通过评估自注意力和局部注意力偏差,识别出那些异常活跃、具有主导性的视觉Token。
- 上下文自适应特征修正:动态地抑制这些主导Token的表示,同时保持特征图的空间一致性,从而让模型的注意力重新聚焦到真正的目标上。
2. 文本空间:辨识性概念校准器 (Discriminative Concept Calibrator, DCC)
DCC则专注于解决文本中的语义主导问题。
- 文本子空间分解:它将文本概念分解为“通用属性”(如“衣服”、“动物”)和“辨识性属性”(如“条纹纹理”、“奔跑动作”)。
- 自适应语义调制:通过一种自适应的掩码策略,减弱通用概念的权重,从而放大辨识性概念的影响力。
- 基于辨识性相似度的推理:最后,在计算图文相似度时,除了传统的全局相似度,还额外引入了一个基于辨识性特征的相似度计算,使得模型能更好地捕捉细节差异。
实验效果:全面且显著的提升
CalibCLIP的有效性在三大类图文检索任务、七个公开基准数据集上得到了验证,可以说是取得了全面胜利。
- 基于文本的行人检索 (TBPR) :在CUHK-PEDES等三个数据集上,CalibCLIP带来了显著的性能提升。例如,在CUHK-PEDES上,R@1指标从未经调优的73.54%提升到了 76.72%。
- 文本到图像检索 (TIR) :在经典的Flickr30K和MSCOCO数据集上,CalibCLIP同样表现出色,平均Rank@k提升了 1.25% 到 1.63%。
- 组合图像检索 (CIR) :在更复杂的CIRR和FashionIQ任务上,CalibCLIP依然稳定提升,在CIRR上相对最先进的方法提升了 2.07%,在FashionIQ上也平均提升了 1.77%。
消融实验也证明了CVE和DCC两个模块各自的有效性,二者结合能达到最佳效果。
xx认为,这项工作最吸引人的地方在于它的“无需训练”特性。这意味着它可以作为一个轻量级的“补丁”,直接应用到现有的VLM上,而不需要耗费大量计算资源进行重新训练,具有很强的实用价值和泛化能力。
....
更多推荐


所有评论(0)