开头先纠正一个理念,我们要从研究者这个角度读文献、整理和总结文献,而不是文章的角度。下面开始这篇综述精读;这篇综述从多个新角度分析了视觉-语言模型的预训练工作,前期工作由中国科学院多人前期调研总结。

提前预告:下文文献分享,可以提前阅读Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

前言

来源:Arxiv:2202.09061v4[cs.cv]30 Jul 2022
主页:https://arxiv.org/abs/2202.09061

动机

为什么需要预训练?似乎现有研究都从固定角度来分析视觉-文本的预训练,那有其他新的视角吗?

因为预训练利于下游任务实施,不需要从头训练模型。

文章不仅从特征提取、模型架构,还创新性地从预训练目标、预训练数据集和下游任务方面希望给跨模态领域入门者一个总览和方向的指引,以及多方向给研究者未来发展点灯。

综述        

1.Feature extraction(包括特征提取和特征表示).
  • 图像特征提取:包括以下三个方法。

        基于目标检测的区域特征提取:最常见的是基于自下而上注意力机制的快速R-CNN,用一个边界框来获取每个区域的特征。VLP模型使用包围框来构造5维向量,并将该向量嵌入到一个称为视觉几何嵌入的高维表示(2048-d)中,因为依赖人工标注非常精细且效果好,但耗时,所以不能全过程都用。

        基于CNN的网格特征提取:利用卷积网络(CNNs)获取特征并离散化网格特征。

        基于ViT的碎片特征提取:通过将三维图像降成二维,N = HW/P2,由(H,w)二维原始图像分辨率和(P,P)二维图片碎片的分辨率计算成序列值输入transformer。

  • 视频特征提取:视频切片分成视频帧,每个帧作为图像进行图像特征提取,典型的是CNN-GFs and ViT-PFs
  • 文本特征提取:典型的BERT [2], RoBERTa [24], AlBERT [25], and XLNet [26]模型采用将文本分割成tokens,再词嵌入、计算位置编码嵌入、文本类型编码嵌入。
  • 特征表示:预训练模型广泛使用transformer编码器进行特征表示
2.Model architecture.

        (1)从多模式融合的角度来看,单流与双流相比;

        (2)从整体架构设计的角度来看,仅编码器与编解码器。

3.Pre-training objectives:将预训练目标分四个类别:完成、匹配、时态和特定类型。

        遮蔽语言模型:输入数据时遮盖掉部分数据,模型输出时根据上下文预测该数据,然后Softmax函数将其转换为预测归一化分布。然后出现两种情况,一对于硬标签(真实值),通过交叉熵损失函数来缩小预测值和真实值误差;二对于软标签(原始输出),利用KLdivergence(KL散度/相对熵)

        【了解KLdivergence:△||P(i)-Q(i)||常用于表示损失,常用机器学习最大似然估计、自分类编码器、贝叶斯、强化。DKL(P∣∣Q)=iP(i)log(Q(i)/P(i)),连续的用积分

  •  前缀语言模型:为了使模型同时具有良好的理解能力和生成能力,对前缀序列进行双向关注,并且只对剩余的tokens进行自回归因式分解

  • 遮蔽视觉模型:遮弊特征回归(AUTHOR提出)和遮蔽特征分类

        为了将视觉与语言映射到同一块区域,利用[CLS]作为两种模态的融合表示,在每一步从数据集中抽样正或负对。通过将配对样本中的视觉或文本替换为从其他样本中随机选择的图像或文本来创建负配对

  • 视觉-语言对比学习

  • 文本区域对齐【困难领域

  • 帧顺序建模
  •  特定的预训练对象
    • VQA(visual question answering)视觉问答
    • VC(visual captioning )视觉字幕
    • 课外补充:基础参考表达式(GRE)、图像条件去噪自动编码(IDA)、文本条件图像特征生成(TIFG)、目标检测(OD)[42]和对齐Kaleido块建模(AKPM)
4.Pre-training datasets.【引出问题:pre-train视频数据集质量参差-弱对齐、强对齐

5.Downstream tasks.

常见的下游任务:

  1. Visual Question Answering

  2. Visual Reasoning and Compositional Question Answering视觉推理,组合问答

  3. Visual Entailment (VE)视觉中蕴含文本
  4. Visual Commonsense Reasoning (VCR)视觉常识推理
  5. Natural Language for Visual Reasoning (NLVR)文本的T/False推理图文是否匹配
  6. Grounding Referring Expressions (GRE)指称表达定位;由字找人
  7. Category Recognition (CR)
  8. Multi-modal Sentiment Analysis
  9. Vision-Language Retrieval (VLR)
  10. Visual Captioning (VC)
  11. Novel Object Captioning at Scale (NoCaps) 
  12. Multi-modal Machine Translation (MMT) 
  13. Vision-Language Navigation (VLN)
  14. Vision-Language Navigation (VLN)
6.SOTA VLP模型

主流视频文字VLP模式摘要如表所示。

总结并展望

未来研究方向包括:

  • Incorporating Acoustic Information.融合声学信息

Cue:OPT论文以多种遮蔽策略学习了文字、图像、音频的多模态表示,并且能够生成文字和图像https://arxiv.org/pdf/2107.00249

  • Knowledgeable and Cognitive Learning.知识性,认知性学习,不再是仅仅拟合数据集

Cue这一问题的解决需要统一的认知模型架构、以知识为导向的预培训目标以及与新知识互动的支持

  • Prompt Tuning.微调参数—直接应用
  • Model Compression and Acceleration.提升效率

Cue:提升效率方法包括参数共享、模型剪枝、知识提炼和模型量化

  • Out-of-domain Pretraining.模型将学习的知识表示转移到未知下游任务中
  • Advanced Model Architecture.

通用句子总结积累(for useage)

  1. Although there are many surveys on pretrained language models  and pretrained vision models , to the best of our knowledge, this is the first survey focused on VLP. We hope that our survey can help researchers better understand this field and inspire them to design better models.虽然有许多关于预先训练的语言模型和预先训练的视觉模型[7]的调查,但据我们所知,这是第一次关注VLP的调查。我们希望我们的调查能够帮助研究人员更好地了解这个领域,并激励他们设计更好的模型。
  2. Most previous work on VLP utilizes pre-trained object detectors to extract visual features. The most commonly used object detection model is Faster R-CNN  with bottom-up attention.大多数以前关于VLP的工作利用预先训练的对象检测器来提取视觉特征。最常用的目标检测模型是具有自下而上注意的更快的R-CNN
  3. VLP models employ an auto-regressive decoder to generate a corresponding textual description of the image or video.VLP模型使用自回归解码器来生成图像或视频的相应文本描述。
  4. Pre-training datasets are significant for the success of cross-modal represen-tation learning. The quality and the size of pre-training datasets sometimes overwhelm the importance of training strategies and algorithms. Hence, a detailed description of several widely used pre-training datasets is necessary.训练前的数据集对于跨通道表征学习的成功与否具有重要意义。训练前数据集的质量和大小有时会压倒训练策略和算法的重要性。因此,有必要对几个广泛使用的训练前数据集进行详细描述。
  5. In most works, the pre-training datasets for VLP are constructedby combining public datasets across different cross-modal tasks or scenarios.在大多数工作中,VLP的预训练数据集是通过组合跨不同跨模式任务或场景的公共数据集来构建的。

【知识积累】BERT是MLM(掩码语言建模)典型模型,用来基于上下文预测,专注NLP;需要如seq2seq框架搭配生成文本。BERT变体——T5、BART编码器段用MLM破坏和重建文本,解码器端用自回归的LM重新生成;具备强大理解和生成能力。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐