LLM-next:扩散大语言模型LLaDA
论文解读:《Large Language Diffusion Models》(Shen Nie等,2024)
核心突破:首次证明扩散模型可在8B规模媲美LLaMA3,颠覆“自回归是LLM唯一路径”的固有认知
项目地址:https://ml-gsai.github.io/LLaDA-demo/
一、为什么需要挑战自回归范式?
当前大语言模型(LLM)几乎全部基于自回归建模(ARM),通过链式分解构建概率分布: pθ(x)=pθ(x1)∏i=2Lpθ(xi∣x1,…,xi−1)(2)
但ARM存在两大固有缺陷: 1. 顺序生成瓶颈:逐token生成导致计算效率低下 2. 推理方向受限:左到右的单向建模难以处理反向任务(如“反转诅咒”现象)
核心洞察:论文指出ARM并非LLM能力的本质来源,真正的基石是生成建模原则(公式1): maxθEpdata(x)logpθ(x)⇔minθKL(pdata(x)∣∣pθ(x))(1) 只要优化该目标,任何概率模型都可能获得LLM能力!
二、LLaDA的核心技术:语言扩散模型
LLaDA提出**掩码扩散模型(MDM)** 架构,通过双向建模打破ARM的序列依赖:
1. 扩散过程定义
-
前向过程:对输入序列 x _ 0 x\_0 x_0 逐步随机掩码(mask),在时间 KaTeX parse error: Undefined control sequence: \[ at position 8: t \\in \̲[̲0,1\] 时: qt|0(xti|x0i)={1−t,xti=x0it,xti=M(8) ( M M M为掩码符号, t = 1 t=1 t=1时序列完全掩码)
-
反向过程:训练掩码预测器(Transformer)重构原始文本: L(θ)=−Et,x0,xt[1t∑i=1L1[xti=M]logpθ(x0i|xt)](3)

图1:LLaDA预训练/SFT/推理流程。预训练时全序列随机掩码;SFT时仅掩码答案;推理时从全掩码状态逐步预测
2. 关键创新:动态掩码比率
与传统掩码语言模型(如BERT)不同,LLaDA在 KaTeX parse error: Undefined control sequence: \[ at position 8: t \\in \̲[̲0,1\] 连续采样掩码率,使其成为严格生成模型。理论证明公式(3)是负对数似然的上界: -E_{p_{\text{data}}}[\log p_{\theta}(x_0)] \leq \mathcal{L}(\theta) \quad (4) 这确保了模型优化的理论合理性。
三、突破性实验结果
在同等计算量(2.3T token预训练 + 4.5M pair SFT)下,LLaDA 8B展现出惊人性能:
1. 核心能力对标LLaMA3
| 任务类型 | 关键指标 | LLaDA 8B | LLaMA3 8B |
|---|---|---|---|
| 语言理解 | MMLU(5-shot) | 65.9 | 65.4 |
| 数学推理 | GSM8K(4-shot) | 70.7 | 53.1 |
| 中文能力 | CMMLU(5-shot) | 69.9 | 50.7 |
| 代码生成 | HumanEval(0-shot) | 33.5 | 34.2 |
(表1:预训练模型基准测试,LLaDA在数学和中文任务显著领先)

图2:LLaDA在15个标准任务上与LLaMA3性能对比,8B规模实现全面竞争
2. 破解“反转诅咒”难题
传统ARM模型在反向任务中表现显著下降,而LLaDA因双向建模特性实现突破:
| 模型 | 正向诗歌补全 | 反向诗歌补全 |
|---|---|---|
| GPT-4o | 82.7 | 34.3 |
| LLaDA 8B Instruct | 48.8 | 42.4 |
(表3:LLaDA在反向任务中表现稳定,显著超越GPT-4o)
案例:给定“但闻人语响”,LLaDA成功预测上一句“空山不见人”,而GPT-4o输出错误结果
3. 指令跟随能力
经SFT后,LLaDA展现出多轮对话、多语言翻译、复杂推理能力:
用户:Lily每小时跑12km持续4小时,之后以6km/h跑步。问8小时总距离?
LLaDA:前4小时跑12*4=48km,后4小时跑6*4=24km,总计72km
(表4:LLaDA的数学推理与多语言翻译示例)
四、架构细节揭秘
1. 模型配置对比
| 参数 | LLaDA 8B | LLaMA3 8B |
|---|---|---|
| Transformer层数 | 32 | 32 |
| 隐藏层维度 | 4096 | 4096 |
| FFN维度 | 12288 | 14336 |
| 注意力头数 | 32 | 32 |
| 总参数量 | 8.02B | 8.03B |
关键差异:LLaDA使用标准多头注意力(非分组查询),并调整FFN维度保持参数量一致
2. 高效推理策略
- 低置信度重掩码:预测置信度最低的 f r a c s t \\frac{s}{t} fracst 比例token重新掩码
- 半自回归分块生成:将序列分块处理,块内并行预测(见下图)

分块生成显著提升指令模型性能
五、启示与挑战
革命性意义:
- 打破ARM垄断:证明扩散模型可支持LLM核心能力(上下文学习、指令跟随)
- 双向建模优势:天然解决反转推理问题,为复杂推理开辟新路径
- 效率潜力:并行生成有望突破token-by-token瓶颈
待解挑战:
- 推理速度:扩散步骤增加导致延迟(需25+步达到最优)
- 多模态扩展:未探索图文混合任务
- 人类对齐:尚未引入RLHF/DPO等对齐技术
个人感想:爱因斯坦曾言:“在困难中蕴藏着机遇”。LLaDA是一次尝试,更是一次对LLM本质的深刻反思——生成能力≠自回归,语言智能的探索之路远比想象宽广! 强烈推荐各位听一下李崇轩老师的talk:https://www.zhihu.com/question/568791838/answer/3072516351
参考文献:
[1] Shen Nie et al. “Large Language Diffusion Models”. 2024
[2] Ou et al. “Your Absorbing Discrete Diffusion Secretly Models Conditional Distributions”. 2024
[3] Berglund et al. “The Reversal Curse”. NeurIPS 2023
更多推荐



所有评论(0)