吴恩达《Transformer LLMs 工作原理》课程五分钟速读
视频课程链接:https://learn.deeplearning.ai/courses/how-transformer-llms-work/lesson/nfshb/introduction

课程系统讲解了Transformer LLM的工作原理。首先回顾了语言模型从词袋、Word2Vec(静态词嵌入)到RNN+注意力的演进。核心在于Transformer架构,它通过自注意力机制(Q、K、V向量进行相关性评分与信息聚合)实现并行处理。
生成式LLM包含三大组件:分词器(子词划分)、Transformer块堆栈(自注意力层与前馈网络)和语言模型头(概率输出)。关键概念包括自回归生成、上下文长度、KV缓存及位置编码(如RoPE)。近期优化包括高效的注意力机制(如分组查询注意力GQA)和混合专家模型(MoE,稀疏激活以提升效率)。最终揭示了LLM本质是在处理词元ID的数字序列。
下面是分章节内容小结:
1、简介
- 课程目标:介绍改变了语言处理领域的LLM transformer架构的主要组成部分。
- 讲师介绍:Jay Alammar 和 Maarten Grootendorst,他们是《Hands on Large Language Models》的作者。
- Transformer 起源:源自2017年的论文《Attention is All You Need》,最初用于机器翻译。
- 核心架构:原始Transformer包含编码器和解码器。
- 编码器:预处理整个输入文本,提取上下文。是BERT等嵌入模型的基础。
- 解码器:利用编码器的上下文生成文本。是OpenAI、Anthropic等主流生成式LLM的基础。
- 生成过程概览:
- 分词:将文本分解为词元。
- 嵌入:将词元映射为向量。
- Transformer块:嵌入向量通过一堆Transformer块(每个块包含注意力层和前馈网络)进行处理。
- 语言模型头:将输出向量转换为下一个词元的概率分布。
- 核心观点:LLM的魔力不仅来自Transformer架构,还来自其训练的庞大数据。
2、理解语言模型:词袋表示语言
- 语言表示演进:从词袋模型 -> Word2Vec -> Transformer。
- 词袋模型:
- 流程:分词 -> 构建词汇表 -> 对每个输入文本,计算词汇表中每个词的出现次数,形成向量。
- 特点:简单有效,但忽略了词的语义和顺序,是“非上下文”的。
- 模型分类:
- 非Transformer模型:如词袋、Word2Vec,是强大的基线模型。
- 仅编码器模型:擅长创建语言的数值表示(如BERT)。
- 仅解码器模型:生成式,主要用于生成文本(如GPT系列)。
- 编码器-解码器模型:结合两者优点。
3、理解语言模型:(词)向量
- Word2Vec:通过神经网络学习词的语义表示。
- 核心思想:通过词在其上下文(相邻词)中的出现来学习词义。
- 训练:通过预测词是否是邻居来调整词向量的值。
- 词嵌入:一个固定大小的向量,其维度代表词的某些属性(如“动物”、“复数”),但具体含义不可解释。
- 相似性:语义相似的词,其向量在空间中的距离也更近。
- 嵌入类型:可以从词元嵌入生成词嵌入、句子嵌入、文档嵌入等。
- 局限性:Word2Vec生成的是静态嵌入,同一个词在任何上下文中的向量都是相同的。
理解语言模型:基于注意力机制的上下文编码和解码
- 引入上下文:为了解决静态嵌入的问题,引入了循环神经网络(RNN)。
- RNN编码器-解码器架构:
- 编码器:将输入序列处理成一个上下文嵌入。
- 解码器:利用该上下文嵌入,以自回归的方式(逐个词元)生成输出序列。
- 问题:长序列的信息会被压缩到一个单一的上下文嵌入中,容易丢失信息。
- 注意力机制:
- 核心思想:允许模型在生成输出时,关注输入序列中与之最相关的部分。
- 实现:在解码过程中,模型会为输入序列的每个词元计算一个注意力权重,权重高的词元对当前生成步骤影响更大。
- 优势:解决了长序列信息丢失的问题,翻译质量显著提升。
- 劣势:RNN的序列性阻止了训练过程的并行化。
4、理解语言模型:Transformers架构
- Transformer的革新:《Attention is All You Need》提出,完全基于注意力机制,摒弃了RNN,实现了训练的并行化。
- Transformer架构:由堆叠的编码器和解码器块组成。
- 编码器块:自注意力层 + 前馈神经网络。
- 解码器块:掩码自注意力层(防止信息泄露) + 与编码器输出的注意力层 + 前馈神经网络。
- 两种主流变体:
- 仅编码器模型(如BERT):使用掩码语言建模进行预训练,擅长文本表示,可用于分类、嵌入等任务。
- 仅解码器模型(如GPT):使用自回归语言建模进行预训练,是生成式LLM的基础。
- 上下文长度:模型一次能处理的最大词元数量(包括输入和已生成的输出)。
- 模型规模:从GPT-1(1.1亿参数)到GPT-3(1750亿参数),参数量的增长带来了能力的飞跃。
5、分词器Tokenizers
- 分词:将输入文本分解成更小单元(词元)的过程。
- 词元级别:
- 词级:每个词是一个词元。词汇表大,无法处理新词。
- 字符级:每个字符是一个词元。序列过长,计算效率低。
- 子词级:最常用。词元可以是整个词或词的一部分(如 “bards” -> “B” 和 “ards”),在词汇表大小和表示能力间取得平衡。
- 流程:文本 -> 分词 -> 词元ID -> 模型 -> 输出词元ID -> 解码为文本。
- 实践比较:比较了BERT和GPT-4的分词器,GPT-4拥有更大的词汇表,能用更少的词元表示相同文本,但需要学习更多的嵌入。
6、架构概览
- Transformer LLM的三大主要组件:
- 分词器
- Transformer块:核心计算发生地。
- 语言模型头:将最终输出向量转换为整个词表上的概率分布。
- 生成方式:自回归,一次生成一个词元。
- 并行处理:Transformer在处理输入的所有词元时是并行的,这使得它非常高效。
- KV缓存:在生成过程中,可以缓存之前词元的Key和Value向量,加速后续词元的生成。
- 解码策略:
- 贪婪解码:总是选择概率最高的词元(温度=0)。
- 随机采样(如Top-p):从高概率词元中随机选择,使输出更具创造性。
7、Transformer
- Transformer:由两个主要模块组成。
- 自注意力层:让模型在处理当前词元时,能够关注并融入序列中其他相关词元的信息(例如,解决指代消解问题:“the dog chased the llama because it was fast” -> “it"指代"llama”)。
- 前馈神经网络:一个全连接神经网络,可以学习并存储语言统计信息(例如,预测"Shawshank"后面很可能是"Redemption")。
- 残差连接:存在于每个子层周围,有助于训练深度网络。
- 层归一化:用于稳定训练。
8、自注意机制
- 自注意力机制详解:
-
为序列中的每个词元生成一个值向量。
-
用上一步的分数对所有的值向量进行加权求和,得到融入上下文信息的新向量表示。
-
为当前词元生成一个查询向量。
-
为序列中的每个词元生成一个键向量。
-
通过计算查询向量与所有键向量的点积,得到相关性分数。
-
步骤1:相关性评分
-
步骤2:信息聚合
- 多头注意力:并行运行多个自注意力"头",每个头学习在不同表示子空间中的注意力模式,从而捕获更丰富的信息。
- 高效的注意力变体:
- 多查询注意力:所有头共享同一套Key和Value矩阵,减少参数,提高速度。
- 分组查询注意力:折中方案,将头分组,每组共享一套Key和Value矩阵,在效率和效果间取得平衡。
- 稀疏注意力:限制每个词元只能关注部分之前的词元(如最近的一些词元),以处理极长的上下文。
9、模型例子
- 代码实践:使用Hugging Face的
transformers库加载并探索Phi-3-mini模型。 - 演示内容:
- 使用Pipeline进行文本生成。
- 打印模型结构,查看其层次(嵌入层、32个解码器层、语言模型头等)。
- 手动进行分词 -> 模型推理 -> 语言模型头 -> 解码的流程,揭示了模型本质上是处理数字(词元ID)而非直接处理文本。
10、最近的改进
- 最近Transformer的演进:
- 位置编码:从在输入端添加静态位置编码,变为在注意力层内部使用旋转位置编码,能更好地处理打包训练和长上下文。
- 层归一化:位置调整到注意力层和前馈层之前(Pre-LN),有助于稳定训练。
- 注意力机制:采用分组查询注意力等高效方式。
- 混合专家:一种扩展Transformer的新架构。
11、混合专家架构(MoE)
- 核心思想:将Transformer中的前馈网络替换为多个专家网络和一个路由器。
- 专家:多个独立的前馈网络。
- 路由器:一个小型神经网络,为每个输入词元计算应路由到哪个(或哪几个)专家。
- 工作流程:对于每个词元,路由器选择top-k个专家,它们的输出被加权聚合。
- 优势:
- 稀疏激活:虽然模型总参数量巨大(稀疏参数),但每次推理只激活一小部分专家(活跃参数),从而在保持模型能力的同时,大幅提高了推理效率。
- 示例:Mixtral 8x7B模型有8个专家,总参数量约46B,但每次推理只使用2个专家(约13B活跃参数)。
想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2025 年 AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享!
👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势
想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI:
1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势
报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:
- 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
- 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
- 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
- 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。
3. 600+套技术大会 PPT:听行业大咖讲实战
PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

- 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
- 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
- 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
- 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。
二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走
想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位
面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析:

2. 102 道 AI 大模型真题:直击大模型核心考点
针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题
专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:

三、路线必明: AI 大模型学习路线图,1 张图理清核心内容
刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代
L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊
L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计
L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署
L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】

四、资料领取:全套内容免费抱走,学 AI 不用再找第二份
不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:
👇👇扫码免费领取全部内容👇👇

2025 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!
更多推荐
所有评论(0)