论文解读:《Large Language Diffusion Models》(Shen Nie等,2024)
核心突破:首次证明扩散模型可在8B规模媲美LLaMA3,颠覆“自回归是LLM唯一路径”的固有认知
项目地址:https://ml-gsai.github.io/LLaDA-demo/

一、为什么需要挑战自回归范式?

当前大语言模型(LLM)几乎全部基于自回归建模(ARM),通过链式分解构建概率分布: pθ(x)=pθ(x1)∏i=2Lpθ(xi∣x1,…,xi−1)(2)

但ARM存在两大固有缺陷: 1. 顺序生成瓶颈:逐token生成导致计算效率低下 2. 推理方向受限:左到右的单向建模难以处理反向任务(如“反转诅咒”现象)

核心洞察:论文指出ARM并非LLM能力的本质来源,真正的基石是生成建模原则(公式1): maxθEpdata(x)log⁡pθ(x)⇔minθKL(pdata(x)∣∣pθ(x))(1) 只要优化该目标,任何概率模型都可能获得LLM能力!

二、LLaDA的核心技术:语言扩散模型

LLaDA提出**掩码扩散模型(MDM)** 架构,通过双向建模打破ARM的序列依赖:

1. 扩散过程定义

  • 前向过程:对输入序列 x _ 0 x\_0 x_0 逐步随机掩码(mask),在时间 KaTeX parse error: Undefined control sequence: \[ at position 8: t \\in \̲[̲0,1\] 时: qt|0(xti|x0i)={1−t,xti=x0it,xti=M(8) M M M为掩码符号, t = 1 t=1 t=1时序列完全掩码)

  • 反向过程:训练掩码预测器(Transformer)重构原始文本: L(θ)=−Et,x0,xt[1t∑i=1L1[xti=M]log⁡pθ(x0i|xt)](3)

图1:LLaDA预训练/SFT/推理流程。预训练时全序列随机掩码;SFT时仅掩码答案;推理时从全掩码状态逐步预测

2. 关键创新:动态掩码比率

与传统掩码语言模型(如BERT)不同,LLaDA在 KaTeX parse error: Undefined control sequence: \[ at position 8: t \\in \̲[̲0,1\] 连续采样掩码率,使其成为严格生成模型。理论证明公式(3)是负对数似然的上界: -E_{p_{\text{data}}}[\log p_{\theta}(x_0)] \leq \mathcal{L}(\theta) \quad (4) 这确保了模型优化的理论合理性。

三、突破性实验结果

在同等计算量(2.3T token预训练 + 4.5M pair SFT)下,LLaDA 8B展现出惊人性能:

1. 核心能力对标LLaMA3

任务类型关键指标LLaDA 8BLLaMA3 8B
语言理解MMLU(5-shot)65.965.4
数学推理GSM8K(4-shot)70.753.1
中文能力CMMLU(5-shot)69.950.7
代码生成HumanEval(0-shot)33.534.2

(表1:预训练模型基准测试,LLaDA在数学和中文任务显著领先)

图2:LLaDA在15个标准任务上与LLaMA3性能对比,8B规模实现全面竞争

2. 破解“反转诅咒”难题

传统ARM模型在反向任务中表现显著下降,而LLaDA因双向建模特性实现突破:

模型正向诗歌补全反向诗歌补全
GPT-4o82.734.3
LLaDA 8B Instruct48.842.4

(表3:LLaDA在反向任务中表现稳定,显著超越GPT-4o)

案例:给定“但闻人语响”,LLaDA成功预测上一句“空山不见人”,而GPT-4o输出错误结果

3. 指令跟随能力

经SFT后,LLaDA展现出多轮对话、多语言翻译、复杂推理能力:

用户:Lily每小时跑12km持续4小时,之后以6km/h跑步。问8小时总距离?
LLaDA:前4小时跑12*4=48km,后4小时跑6*4=24km,总计72km

(表4:LLaDA的数学推理与多语言翻译示例)

四、架构细节揭秘

1. 模型配置对比

参数LLaDA 8BLLaMA3 8B
Transformer层数3232
隐藏层维度40964096
FFN维度1228814336
注意力头数3232
总参数量8.02B8.03B

关键差异:LLaDA使用标准多头注意力(非分组查询),并调整FFN维度保持参数量一致

2. 高效推理策略

  • 低置信度重掩码:预测置信度最低的 f r a c s t \\frac{s}{t} fracst 比例token重新掩码
  • 半自回归分块生成:将序列分块处理,块内并行预测(见下图)

分块生成显著提升指令模型性能

五、启示与挑战

革命性意义:

  1. 打破ARM垄断:证明扩散模型可支持LLM核心能力(上下文学习、指令跟随)
  2. 双向建模优势:天然解决反转推理问题,为复杂推理开辟新路径
  3. 效率潜力:并行生成有望突破token-by-token瓶颈

待解挑战:

  • 推理速度:扩散步骤增加导致延迟(需25+步达到最优)
  • 多模态扩展:未探索图文混合任务
  • 人类对齐:尚未引入RLHF/DPO等对齐技术

个人感想:爱因斯坦曾言:“在困难中蕴藏着机遇”。LLaDA是一次尝试,更是一次对LLM本质的深刻反思——生成能力≠自回归,语言智能的探索之路远比想象宽广! 强烈推荐各位听一下李崇轩老师的talk:https://www.zhihu.com/question/568791838/answer/3072516351


参考文献
[1] Shen Nie et al. “Large Language Diffusion Models”. 2024
[2] Ou et al. “Your Absorbing Discrete Diffusion Secretly Models Conditional Distributions”. 2024
[3] Berglund et al. “The Reversal Curse”. NeurIPS 2023

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐