文章对比分析了三种主流序列建模架构:Transformer、Mamba和Hyena。详细介绍了它们的基本信息、计算步骤和机制差异。Transformer基于自注意力机制,时间复杂度高但并行性好;Mamba采用状态空间模型,线性复杂度且保留序列顺序;Hyena结合门控和长卷积,高效处理长序列。文章还通过BERT参数量计算示例,展示了模型参数计算方法,帮助读者理解不同架构的特点和适用场景。


大模型架构-Transformer、Mamba、Hyena

个人学习自用,一些解释限于仅处理字母序列,有错误或不准确的地方欢迎指正

序列建模发展基本信息总结

模型架构 提出年份 引用量(截至25.5.3) 核心机制 变体模型 时间复杂度 长距离建模 并行性 输入变化 后续传播 适用场景
RNN/LSTM/GRU 1980/1997/2014 \ 递归结构 \ O(n) 差/好/较好 \ \ 短序列建模/长序列建模/资源受限场景
Transformer NIPS会议 2017.6 (谷歌) 178283 自注意力机制 BERT / GPT O(n²) 超长序列受限 优秀 优秀 token→嵌入(+位置编码)→Q/K/V 全局注意力 长序列建模,主流NLP任务
Mamba 仅预印本 2023.12(卡内基梅隆大学) 3113 状态空间更新 Vision Mamba O(n) 优秀 优秀 token→嵌入→动态状态更新参数 状态更新 多模态长序列建模
Hyena ICML会议 2023.2(斯坦福大学) 347 长卷积+门控 Striped Hyena O(N log L) 优秀 优秀 token→嵌入→门控+卷积核生成 卷积 超长序列建模,生物序列等领域

计算步骤对比(输入为字母序列时)

步骤 Transformer Mamba Hyena 异同
1. 分词 需要 需要 需要 相同
2. 词嵌入 token 映射为向量 token 映射为向量 token 映射为向量 相同
3. 位置编码 必须,否则序列无顺序感 可选,SSM 隐顺序 可选,卷积天然顺序感知 不同
4. 投影 (X: 嵌入;W: 权重) Q = X ⋅ W Q Q = X \cdot W_Q Q=X⋅WQ​ K = X ⋅ W K K = X \cdot W_K K=X⋅WK​ V = X ⋅ W V V = X \cdot W_V V=X⋅WV​ Q 查询向量,KV 键值对 状态空间输入向量: u t = X ⋅ W p r o j u_t = X \cdot W_{proj} ut​=X⋅Wproj​ 门控准备: z t = σ ( X ⋅ W g a t e ) z_t = \sigma(X \cdot W_{gate}) zt​=σ(X⋅Wgate​) 卷积准备: h t = X ⋅ W c o n v _ p r o j h_t = X \cdot W_{conv\_proj} ht​=X⋅Wconv_proj​ 不同
5. 主干运算 注意力得分: scores = Q K T d \text{scores} = \frac{QK^T}{\sqrt{d}} scores=d ​QKT​ 注意力输出: attn_out = softmax(scores) ⋅ V \text{attn\_out} = \text{softmax(scores)} \cdot V attn_out=softmax(scores)⋅V 前馈映射: FFN = MLP(attn_out) \text{FFN} = \text{MLP(attn\_out)} FFN=MLP(attn_out) 动态矩阵: A ( x t ) , B ( x t ) , C ( x t ) , D ( x t ) A(x_t), B(x_t), C(x_t), D(x_t) A(xt​),B(xt​),C(xt​),D(xt​) 状态更新: h t = A ( x t ) ⋅ h t − 1 + B ( x t ) ⋅ x t h_t = A(x_t) \cdot h_{t-1} + B(x_t) \cdot x_t ht​=A(xt​)⋅ht−1​+B(xt​)⋅xt​ 输出: y t = C ( x t ) ⋅ h t + D ( x t ) ⋅ x t y_t = C(x_t) \cdot h_t + D(x_t) \cdot x_t yt​=C(xt​)⋅ht​+D(xt​)⋅xt​ 长卷积计算: conv_out = h t ∗ k ( τ ) \text{conv\_out} = h_t * k(\tau) conv_out=ht​∗k(τ) K ( t ) K(t) K(t) 卷积核长度为 t t t 不同
6. 非线性激活 前馈网络内使用 如 ReLU / GeLU 可选激活 SiLU 或其他 卷积后 ReLU / SiLU 激活 相似,位置不同
7. 残差连接 Attention 和 FFN 输出加残差 SSM 输出加残差 卷积输出加残差 相同
8. 层归一化 每子层后 LayerNorm 每 SSM/模块后 LayerNorm 每模块块后 LayerNorm 相同
9. 输出层 线性变换 + Softmax 分类或回归 线性映射 + 分类或回归 卷积输出或后接 MLP 不同

计算步骤解释(输入为字母序列时)

模型 主干运算解释 输入嵌入 Tokenization + Embedding 输入嵌入 位置编码 公式解释补充 对应下表 5.主干运算补充
Transformer 核心: 自注意力机制 1. 多头自注意力机制 (Multi-Head Self-Attention): 模型在不同表示的子空间中并行地关注不同位置。 2. 前馈神经网络 (Feed-Forward Neural Network, FFN): 对每个位置的表示进行非线性变换。 DNA Tokenize: k-mer、BPE、单碱基、可学习分词… Embedding: 将每个 token 转为向量(词嵌入矩阵) Transformer 需添加位置编码,引入序列中 token 位置信息。 QKV → softmax → FFN 计算 token 间相似度 聚合值向量 提取深层特征
Mamba 核心: 结构化状态空间模型 1. 卷积层 (Convolution):捕捉局部上下文信息。 2. 选择性状态空间模块 (Selective SSM): 动态地建模序列中的长期依赖关系。 同上 Mamba、Hyena 内部机制保留顺序依赖, 因此不使用位置编码,或使用简单增量偏置。 状态更新 → 选择性机制 A(x):控制前一状态的更新比例 B(x):控制当前输入对状态的影响 C(x):控制状态对最终输出的影响 D(x):控制输入对最终输出的影响
Hyena 核心: 隐式长卷积 1. 门控机制 (Gating Mechanism):控制信息流动。 2. 长卷积 (Long Convolution):捕捉长距离依赖关系。 同上 同上 隐式卷积 → 门控 控制信息前后强化/弱化 准备卷积输入、执行长距离卷积(FFT 实现)

BERT参数量计算

BERT参数量 = embedding层参数 + 层数 * 各层的参数 + 输出层参数。
假设训练此BERT,就1条训练数据(ACTG)长度为4,共2层Transformer,隐藏层维度hidden_size=8

步骤 模块 参数形状 参数量 说明
嵌入层:40+32=72 词嵌入矩阵 (5, 8) 40 词表大小 5 (A/C/T/G/[MASK]),嵌入维度 8
位置编码 (4, 8) 32 序列最大长度 4,可学习位置编码
投影层:64×4 = 256 Q 线性映射 (8, 8) 64 Query
K 线性映射 (8, 8) 64 Key
V 线性映射 (8, 8) 64 Value
注意力输出映射 ( W o u t p u t W_{output} Woutput​) (8, 8) 64
FFN 子层:280 FFN 升维 (8, 16) 128 第一层全连接
FFN 升维偏置 (16,) 16
FFN 降维 (16, 8) 128 第二层全连接
FFN 降维偏置 (8,) 8
LayerNorm:32 LayerNorm1:Attention 后 γ: (8,), β: (8,) 16 γ 是缩放函数,β 是偏移参数
LayerNorm2:FFN 后 γ: (8,), β: (8,) 16 每个特征维度单独缩放平移
输出层:40+5=45 输出层权重 (8, 5) 40 嵌入维度 → 词表大小
输出层偏置 (5,) 5
全部总参数:嵌入层 72 + 两层 Transformer 共 1136 + 输出层 45 = 1253

|
| 全部总参数:嵌入层 72 + 两层 Transformer 共 1136 + 输出层 45 = 1253 | | | | |

零基础如何高效学习大模型?

你是否懂 AI,是否具备利用大模型去开发应用能力,是否能够对大模型进行调优,将会是决定自己职业前景的重要参数。

为了帮助大家打破壁垒,快速了解大模型核心技术原理,学习相关大模型技术。从原理出发真正入局大模型。在这里我和鲁为民博士系统梳理大模型学习脉络,这份 LLM大模型资料 分享出来:包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等, 😝有需要的小伙伴,可以 扫描下方二维码免费领取🆓**⬇️⬇️⬇️

在这里插入图片描述

【大模型全套视频教程】

教程从当下的市场现状和趋势出发,分析各个岗位人才需求,带你充分了解自身情况,get 到适合自己的 AI 大模型入门学习路线。

从基础的 prompt 工程入手,逐步深入到 Agents,其中更是详细介绍了 LLM 最重要的编程框架 LangChain。最后把微调与预训练进行了对比介绍与分析。

同时课程详细介绍了AI大模型技能图谱知识树,规划属于你自己的大模型学习路线,并且专门提前收集了大家对大模型常见的疑问,集中解答所有疑惑!

在这里插入图片描述

深耕 AI 领域技术专家带你快速入门大模型

跟着行业技术专家免费学习的机会非常难得,相信跟着学习下来能够对大模型有更加深刻的认知和理解,也能真正利用起大模型,从而“弯道超车”,实现职业跃迁!

图片

【精选AI大模型权威PDF书籍/教程】

精心筛选的经典与前沿并重的电子书和教程合集,包含《深度学习》等一百多本书籍和讲义精要等材料。绝对是深入理解理论、夯实基础的不二之选。

在这里插入图片描述

【AI 大模型面试题 】

除了 AI 入门课程,我还给大家准备了非常全面的**「AI 大模型面试题」,**包括字节、腾讯等一线大厂的 AI 岗面经分享、LLMs、Transformer、RAG 面试真题等,帮你在面试大模型工作中更快一步。

【大厂 AI 岗位面经分享(92份)】

图片

【AI 大模型面试真题(102 道)】

图片

【LLMs 面试真题(97 道)】

图片

【640套 AI 大模型行业研究报告】

在这里插入图片描述

【AI大模型完整版学习路线图(2025版)】

明确学习方向,2025年 AI 要学什么,这一张图就够了!

img

👇👇点击下方卡片链接免费领取全部内容👇👇

在这里插入图片描述

抓住AI浪潮,重塑职业未来!

科技行业正处于深刻变革之中。英特尔等巨头近期进行结构性调整,缩减部分传统岗位,同时AI相关技术岗位(尤其是大模型方向)需求激增,已成为不争的事实。具备相关技能的人才在就业市场上正变得炙手可热。

行业趋势洞察:

  • 转型加速: 传统IT岗位面临转型压力,拥抱AI技术成为关键。
  • 人才争夺战: 拥有3-5年经验、扎实AI技术功底真实项目经验的工程师,在头部大厂及明星AI企业中的薪资竞争力显著提升(部分核心岗位可达较高水平)。
  • 门槛提高: “具备AI项目实操经验”正迅速成为简历筛选的重要标准,预计未来1-2年将成为普遍门槛。

与其观望,不如行动!

面对变革,主动学习、提升技能才是应对之道。掌握AI大模型核心原理、主流应用技术与项目实战经验,是抓住时代机遇、实现职业跃迁的关键一步。

在这里插入图片描述

01 为什么分享这份学习资料?

当前,我国在AI大模型领域的高质量人才供给仍显不足,行业亟需更多有志于此的专业力量加入。

因此,我们决定将这份精心整理的AI大模型学习资料,无偿分享给每一位真心渴望进入这个领域、愿意投入学习的伙伴!

我们希望能为你的学习之路提供一份助力。如果在学习过程中遇到技术问题,也欢迎交流探讨,我们乐于分享所知。

*02 这份资料的价值在哪里?*

专业背书,系统构建:

  • 本资料由我与鲁为民博士共同整理。鲁博士拥有清华大学学士美国加州理工学院博士学位,在人工智能领域造诣深厚:

    • 在IEEE Transactions等顶级学术期刊及国际会议发表论文超过50篇
    • 拥有多项中美发明专利。
    • 荣获吴文俊人工智能科学技术奖(中国人工智能领域重要奖项)。
  • 目前,我有幸与鲁博士共同进行人工智能相关研究。

在这里插入图片描述

内容实用,循序渐进:

  • 资料体系化覆盖了从基础概念入门核心技术进阶的知识点。

  • 包含丰富的视频教程实战项目案例,强调动手实践能力。

  • 无论你是初探AI领域的新手,还是已有一定技术基础希望深入大模型的学习者,这份资料都能为你提供系统性的学习路径和宝贵的实践参考助力你提升技术能力,向大模型相关岗位转型发展

    在这里插入图片描述在这里插入图片描述在这里插入图片描述

抓住机遇,开启你的AI学习之旅!

在这里插入图片描述

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐