大模型面经——MLLM中模态对齐有哪些难点?有什么解决方法?
多模态大模型中模态对齐数据构建的难点及解决方案。
多模态大模型相对于LLM的训练难度更高一些,其中很关键的部分在于模态的对齐。
多模态对齐需要把各种模态映射或对齐到token空间中,让图像、语音等多模态信息抽象为token表征,从而利用现有的LLM的技术实现多模态领域的思维链和涌现。
那么本系列开始总结MLLM中多模态对齐的难点以及现有的解决方法,下面是本系列想要包含的内容。
- 模态对齐的难点总结
-
模态对齐数据构建
-
跨模态差异影响融合效果
-
模态对齐评估效率比较低
- 现有难点的解决方案
本篇主要来讲述模态对齐的部分。
一、 多模态模型架构与训练方法
在开始前先简单回顾一下多模态模型架构与训练方法~
目前MLLM常见的输入模态包括图像、视频、音频,另外IMU(惯性测量单元,Inertial Measurement Unit)传感器数据以及脑波等生理信号数据也有在尝试接入。
下图是一个可以参考的多模态大模型基本架构。

典型的多模态大模型基本架构(来源:腾讯AI Lab)
目前多模态大模型的训练方法和架构上比较趋同,多采用两段式训练方法,按照一定次序分别训练视觉编码器和语言模型,但最后阶段都会训练到跨模态映射(Q-former或者MLP)的参数。

两段式训练方法(来源:阿里巴巴达摩院)
具体来说:
第一阶段,通过模态对齐预训练,将映射层和模态编码器(Modality 的输出优化映射到联合LLM嵌入空间,进行各模态的对齐。
第二阶段,通过多模态指令调整,模型将系统指令/文本查询与输入多模态上下文相关联。CLIP ViT-L等就是比较典型的特定模态编码器。
可以看到模态对齐确实是非常重要的部分。
二、 数据模态对齐的难点和解决方案
1. 安全性难点
多模态数据对齐需要文本指令、上下文响应,以及非文本模态(如图像/音频)的强关联标注。此外目前新兴的生物信号、传感器信号等数据在建模时也需要考虑,以及标注过程中还需要考虑COT的部分。
目前数据收集过程中需要着重考虑内容相关性和安全性,需要人工介入的环节非常多,因此成本极高且难以规模化。
2. 解决方案简述
可以通过标注或合成的方式构建一部分引导样本,引导生成内容与生成风格,并以目标嵌入的方式替代真实的多模态数据,在MLLM的前向传播过程中引导生成相关引导目标嵌入来进行优化。
3. 具体示例说明
上面的话可能有些抽象,这里推荐一篇ACL2025北航彭浩团队提出的合成嵌入技术SEA(Synthetic Embedding augmented safety Alignment)框架辅助大家理解。

SEA在模态编码器表示空间中优化合成嵌入,替代真实多模态数据;通过梯度更新生成目标嵌入,比如对训练结果有害的相关向量,与文本指令结合构建训练数据集。
主要分为3个阶段,下面简单的进行表述。

1)数据准备
构建一个文本安全对齐数据集

其中x表示有害指令,y是道德响应,对于每个pair构建一个辅助数据集,用于内容控制和风格控制。
内容控制的样本示例
指令:请简要描述图像中的活动(产品)
目标真值:响应前缀 + 答案
风格控制的样本示例
指令:图像的风格是什么?
目标真值:响应前缀 + 风格描述(风格描述要从预定义的风格集合中随机采样)
2)嵌入优化
对于每个pair,准备一个空白图像(或空白视频、静音音频)的嵌入 E0,并将其作为可训练的嵌入进行优化。
优化目标是给定E0,以及内容控制和风格控制的指令,最大化MLLM生成内容控制和风格控制目标样本的概率。优化过程如下:

3)安全性对齐
将优化后的嵌入 Ei与文本数据集 DT结合,构建多模态数据集

对于每个x,添加一个前缀,如“图像显示一个活动(产品)。请理解它并回答以下问题。”生成 。保留 DT 中的响应。
在安全性对齐训练中,忽略模态编码器 M(⋅),修改MLLM的前向传播过程为

使其适应现有的安全性对齐训练策略。
个人认为这种方法在实践中还是比较实用,目前在图像这个模态中应用的会更多一些;未来积累的这里具备引导性质的Embedding库本身就具备很大的价值。
那么,如何系统的去学习大模型LLM?
作为一名从业五年的资深大模型算法工程师,我经常会收到一些评论和私信,我是小白,学习大模型该从哪里入手呢?我自学没有方向怎么办?这个地方我不会啊。如果你也有类似的经历,一定要继续看下去!这些问题啊,也不是三言两语啊就能讲明白的。
所以我综合了大模型的所有知识点,给大家带来一套全网最全最细的大模型零基础教程。在做这套教程之前呢,我就曾放空大脑,以一个大模型小白的角度去重新解析它,采用基础知识和实战项目相结合的教学方式,历时3个月,终于完成了这样的课程,让你真正体会到什么是每一秒都在疯狂输出知识点。
由于篇幅有限,⚡️ 朋友们如果有需要全套 《2025全新制作的大模型全套资料》,扫码获取~
👉大模型学习指南+路线汇总👈
我们这套大模型资料呢,会从基础篇、进阶篇和项目实战篇等三大方面来讲解。

👉①.基础篇👈
基础篇里面包括了Python快速入门、AI开发环境搭建及提示词工程,带你学习大模型核心原理、prompt使用技巧、Transformer架构和预训练、SFT、RLHF等一些基础概念,用最易懂的方式带你入门大模型。
👉②.进阶篇👈
接下来是进阶篇,你将掌握RAG、Agent、Langchain、大模型微调和私有化部署,学习如何构建外挂知识库并和自己的企业相结合,学习如何使用langchain框架提高开发效率和代码质量、学习如何选择合适的基座模型并进行数据集的收集预处理以及具体的模型微调等等。
👉③.实战篇👈
实战篇会手把手带着大家练习企业级的落地项目(已脱敏),比如RAG医疗问答系统、Agent智能电商客服系统、数字人项目实战、教育行业智能助教等等,从而帮助大家更好的应对大模型时代的挑战。
👉④.福利篇👈
最后呢,会给大家一个小福利,课程视频中的所有素材,有搭建AI开发环境资料包,还有学习计划表,几十上百G素材、电子书和课件等等,只要你能想到的素材,我这里几乎都有。我已经全部上传到CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
相信我,这套大模型系统教程将会是全网最齐全 最易懂的小白专用课!!
更多推荐



所有评论(0)