DeepSeek-V3.2-Exp浅析


在这里插入图片描述
DeepSeek-V3.2-Exp在DeepSeek-V3.2-terminus基础上引入了基于MQA的DSA(稀疏注意力)机制,使得训练和推理的成本极大的降低了。
这儿的DSA其实是一种token剪枝策略,其使得复杂度由 O ( L 2 ) O(L^2) O(L2)降到了 O ( L k ) O(Lk) O(Lk)。(这里的k是Top-K selector的,K个token)

模型结构

在这里插入图片描述

Lightning Indexer

在这里插入图片描述
在这里插入图片描述
基于公式和图可知,因为是基于MQA的DSA,是多个q和k按照(1)计算索引得分的。使用ReLU可以减少吞吐量。

Top-k Selector

在这里插入图片描述
选取Index分数最大的k个计算attention。

MQA-MLA vs MHA-MLA

在这里插入图片描述
MQA-MLA和MHA-MLA实现上还是有些许不一样。

训练策略

Pretrain+Post-Train。

继续预训练

Dense Warm-up Stage

这个阶段基于Dense权重,warm-up Lightning Indexer。
在这里插入图片描述

稀疏训练

这个阶段就引入了稀疏策略。
在这里插入图片描述

后训练

专家蒸馏

1)训练专家模型;
2) 收集训练数据;
3)基于专家蒸馏的数据进行训练。

混合RL

与以前的 DeepSeek 模型不同,这些模型是用多阶段强化学习训练的,将推理、智能体和人类对齐训练合并到一个 RL 阶段。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐