DeepSeek-V3.2-Exp浅析
·
DeepSeek-V3.2-Exp浅析
文章目录
DeepSeek-V3.2-Exp在DeepSeek-V3.2-terminus基础上引入了基于MQA的DSA(稀疏注意力)机制,使得训练和推理的成本极大的降低了。
这儿的DSA其实是一种token剪枝策略,其使得复杂度由 O ( L 2 ) O(L^2) O(L2)降到了 O ( L k ) O(Lk) O(Lk)。(这里的k是Top-K selector的,K个token)
模型结构

Lightning Indexer


基于公式和图可知,因为是基于MQA的DSA,是多个q和k按照(1)计算索引得分的。使用ReLU可以减少吞吐量。
Top-k Selector

选取Index分数最大的k个计算attention。
MQA-MLA vs MHA-MLA

MQA-MLA和MHA-MLA实现上还是有些许不一样。
训练策略
Pretrain+Post-Train。
继续预训练
Dense Warm-up Stage
这个阶段基于Dense权重,warm-up Lightning Indexer。

稀疏训练
这个阶段就引入了稀疏策略。

后训练
专家蒸馏
1)训练专家模型;
2) 收集训练数据;
3)基于专家蒸馏的数据进行训练。
混合RL
与以前的 DeepSeek 模型不同,这些模型是用多阶段强化学习训练的,将推理、智能体和人类对齐训练合并到一个 RL 阶段。
更多推荐



所有评论(0)