5分钟入门:小白也能看懂的 Embedding 及其在大模型与 RAG 中的应用(收藏必备)
▍问题 1:Embedding 是什么?token id 是怎么变成向量的?
Embedding 这个词,直译过来是:嵌入。
听起来有点抽象。
但在大模型的语境里,embedding 就是指:把一个 token id,映射成一个向量。
比如:
token id 165376-> [0.12, -0.08, 0.31, ..., 0.44]
这个向量,就叫:
token embedding。
那这个映射是怎么做的呢?
实际上,大模型内部有一张很大的表,叫:embedding table。
token id 1 -> 一行向量token id 2 -> 一行向量token id 3 -> 一行向量...token id 165376 -> 一行向量
当 token id 进入模型后,第一步就是:查表。
token id 是多少,就去 embedding table 里找到对应那一行向量。
这一步非常关键。
因为从这一刻开始,文字就不再只是文字,它开始变成了一串向量,后面的矩阵乘法、attention、神经网络加工,才能继续发生。
所以,embedding 是大语言模型处理文字的入口,它把离散的 token id,变成连续的向量。
这里的“连续”是指:
向量里的数字不是 1、2、3 这种编号,而是很多可以被调整的小数。
比如:
[0.12, -0.08, 0.31, ..., 0.44]
这些小数,才是模型真正能计算、能调整、能学习的东西。
▍问题 2:Embedding 是怎么学出来的?为什么“猫”和“狗”会更接近
现在最关键的问题来了:
embedding table 里的这些数字,是谁填进去的?
是工程师手工写的吗?
当然不是。
如果人类手工给每个 token 填几千个数字,这件事恐怕要做到天荒地老。
真实情况是:
embedding table 是模型参数的一部分。
也就是说,它和神经网络里的各种 W、b 一样,都是可以被训练更新的参数。
一开始,这张表里的数字可以是随机的。
训练时,模型不断预测下一个 token。
预测错了,就会产生 loss。
loss 通过反向传播往回传。
embedding table 里的向量,也会跟着被更新。
因此,embedding 是在模型训练过程中学出来的。
这里要讲清楚一个很容易混淆的点。
token embedding 是上下文无关的吗?
是。
比如“苹果”这个 token,在模型刚开始查表时,拿到的是同一行基础向量。
不管它出现在:
苹果发布了新手机
还是:
这个苹果很好吃
一开始查表得到的“苹果”向量是一样的。
但这个向量又不是空白的,因为它是在大量历史语料中训练出来的。
所以更准确地说:token embedding 有历史上下文经验,但没有当前句子上下文。
还是拿“苹果”举例。
在训练语料里,它可能出现过很多次:
苹果发布了新手机这个苹果很好吃那棵苹果树开花了苹果公司股价上涨
每一次出现,都会给“苹果”这个 token 的 embedding 带来一点训练信号。
训练久了以后,embedding 就会吸收这些历史上下文里的统计规律。
但当你真正输入一句新话时,它一开始还是同一个基础向量。
至于这次到底是“水果苹果”,还是“苹果公司”,要等后面的 Transformer 层结合当前上下文继续加工,具体 Transformer 层是如何加工向量,使得它吸收上下文信息的,会在后面关于 attention 机制的文章中介绍。
这就引出一个非常深刻的思想:
一个词的含义,由它经常出现的上下文决定。
这就是为什么“猫”和“狗”的 embedding 通常会更接近:不是因为“猫”和“狗”一定经常直接挨在一起,而是因为它们经常出现在相似的上下文位置里。
比如:
我养了一只猫我养了一只狗
“猫”和“狗”都可以出现在:
我养了一只 ___
这个位置上。
再比如:
这只猫在睡觉这只狗在睡觉猫很可爱狗很可爱
它们经常和“养”“只”“睡觉”“可爱”“宠物”这些上下文发生关系。
训练时,如果很多上下文里,“猫”和“狗”都可以作为合理候选出现,那么它们收到的梯度信号就会比较相似。
长期下来,它们的 embedding 就会被推到相近的位置。
而“猫”和“苹果”呢?
它们也可能有一些重合上下文。
比如都可以出现在:
我喜欢 ___
这个位置上。
但大量上下文差异更大。
猫会叫猫在睡觉猫是宠物
和:
苹果很好吃苹果发布手机苹果树结果
这些上下文模式明显不一样。
所以“猫”和“狗”的向量,通常会比“猫”和“苹果”更接近。
You shall know a word by the company it keeps.
意思是:看一个词经常和谁待在一起,就能推测它是什么意思。
这就是 embedding 最迷人的地方。
语义不是工程师塞进去的,语义是从大量上下文关系中“长”出来的。
▍问题 3:Embedding 除了在大模型内部,还有什么用?
到这里,我们讲的是大模型内部的 token embedding。
它负责把 token id 变成 token embedding 向量。
但今天很多 AI 应用里,embedding 还有另一个非常重要的用法:
把一句话、一段文档、一张图片,变成一个向量。
比如你问:“什么是梯度消失?”
一个 embedding 模型可以把这句话变成一个向量。
一篇讲“梯度消失”的文章,也可以被变成一个向量。
如果这两个向量很接近,就说明它们语义相关。
还记得我们在向量那篇文章中讲过的吗?向量之间可以计算相似度。
事实上,今天市面上很多“上传文档给 Agent 用”的知识库,核心基本就是 RAG,RAG 全称叫 Retrieval-Augmented Generation,实际上就是:先从知识库里检索资料,再让大模型结合资料回答。
那么怎么检索意思相近的资料呢?
就是利用 embedding。
RAG 的核心流程大概是:
用户问题 -> 变成向量资料库里的每段文字 -> 也变成向量找最接近的资料向量把相关资料塞给大模型再生成回答
所以 RAG 离不开 embedding,没有 embedding,模型就很难在海量资料里快速找到“意思相近”的内容。
这里要特别讲清楚一个容易混淆的点:
RAG 知识库里的 embedding,通常不是现场训练出来的。
当你创建一个 Agent 知识库时,系统一般会先把文档切成很多小段,然后调用一个已经训练好的 embedding 模型,把每一段文字变成向量,再存进向量数据库。
也就是说:
创建知识库,不是在训练 embedding 模型,而是在计算 embedding。
那这个 embedding 模型是怎么来的?
它通常也是提前训练好的,只是训练目标和大语言模型不完全一样。
大语言模型常见目标是预测下一个 token,而检索用的 embedding 模型更常见的目标是:让相关文本的向量更接近,让不相关文本的向量更远。
比如:
问题:什么是梯度消失?相关资料:梯度消失是深层神经网络训练中的问题……不相关资料:苹果公司发布了新手机……
训练时,模型会学习让“问题”和“相关资料”的向量更接近,让“问题”和“不相关资料”的向量更远。
这些训练数据可能来自搜索点击、问答数据、人工标注,也可能由大模型合成。
AI Agent 也离不开 embedding。
一个 Agent 在执行任务时,可能要查资料、读文档、搜索代码、回忆历史记录,它不可能每次都把所有内容全部塞进上下文。
更常见的做法是:先把外部知识、历史记录、文档片段都变成 embedding 向量,需要的时候再根据当前任务去找最相关的向量。
现在 embedding 的前沿方向也很多。
比如:
更长文本的 embedding,让一整段长文也能被表示成向量。
多语言 embedding,让中文、英文、日文、代码进入同一个向量空间。
多模态 embedding,让文字、图片、声音也能互相对齐。
可压缩 embedding,在效果和成本之间做平衡。
所以,embedding 不只是大模型内部的关键步骤,它也是很多 AI 应用的基础设施。
读到这里,相信你对我们之前在向量那篇文章中讲到的 万事万物皆可表示为向量 有了更深的理解。
▍把整篇串起来
现在你能把这条链路串起来了:
- token id 本身只是编号,没有语义
- embedding 把 token id 映射成向量
- 大模型里有一张 embedding table,token id 进来后,本质上是查表
- embedding table 是模型参数的一部分,会在训练中被更新
- token embedding 有历史上下文经验,但没有当前句子上下文
- “猫”和“狗”更接近,不是因为它们总是挨在一起,而是因为它们经常出现在相似上下文里
- 一个词的含义,由它经常出现的上下文决定
- RAG / Agent 也大量依赖 embedding,因为它们需要在向量空间里查找相似内容
到这里,我们知道:
文字先被切成 token。
token 变成 token id。
token id 通过 embedding 变成向量。
但一句话里有很多 token。
每个 token 都有自己的向量。
那模型在预测下一个 token 时,如何把上下文里的向量信息更好地融合起来?
普通人如何抓住AI大模型的风口?
领取方式在文末
2026年入行AI大模型的黄金窗口!!!
AI产业正迎来前所未有的爆发式增长。 从DeepSeek以百万年薪重金招募顶尖研究员,到百度、阿里、腾讯等头部企业加速推进AI Agent商业化布局,再到国家层面持续出台政策,大力扶持数字经济与AI人才培育体系,多重信号清晰指向一个共识:AI的“黄金十年”已全面开启
在产业浪潮的强劲推动下,AI人才争夺战日趋白热化。技术迭代与场景落地双轮驱动,催生海量高价值岗位。放眼未来,AI领域的职业发展前景广阔无垠,正涌现出大量高潜机遇,堪称一片值得深耕的**“人才蓝海”**。
脉脉数据显示📊:
2026年1-2月,AI岗位数量同比增长约12倍,增速远超新经济行业整体增幅;AI岗位在全部新经济岗位中的占比也从2025年同期的2.29%跃升至26.23%,几乎占据新经济招聘市场的四分之一。
与此同时,AI新发岗位平均月薪高达60738元,较新经济行业整体平均月薪48189元高出约26%。
这一切都说明一件事:2026年,正是入行AI大模型的黄金窗口❗️❗️

最佳学习路线
只要你真心想学习AI大模型技术,这份精心整理的学习资料我愿意无偿分享给你,但是想学技术去乱搞的人别来找我!
在当前这个人工智能高速发展的时代,AI大模型正在深刻改变各行各业。我国对高水平AI人才的需求也日益增长,真正懂技术、能落地的人才依旧紧缺。我也希望通过这份资料,能够帮助更多有志于AI领域的朋友入门并深入学习。
真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】
大模型全套学习资料展示
自我们与MoPaaS魔泊云合作以来,我们不断打磨课程体系与技术内容,在细节上精益求精,同时在技术层面也新增了许多前沿且实用的内容,力求为大家带来更系统、更实战、更落地的大模型学习体验。

希望这份系统、实用的大模型学习路径,能够帮助你从零入门,进阶到实战,真正掌握AI时代的核心技能!
01 教学内容

-
从零到精通完整闭环:【基础理论 →RAG开发 → Agent设计 → 模型微调与私有化部署调→热门技术】5大模块,内容比传统教材更贴近企业实战!
-
大量真实项目案例: 带你亲自上手搞数据清洗、模型调优这些硬核操作,把课本知识变成真本事!
02适学人群
应届毕业生: 无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。
零基础转型: 非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界。
业务赋能突破瓶颈: 传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型。

vx扫描下方二维码即可
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】
本教程比较珍贵,仅限大家自行学习,不要传播!更严禁商用!
03 入门到进阶学习路线图
大模型学习路线图,整体分为5个大的阶段:
04 视频和书籍PDF合集

从0到掌握主流大模型技术视频教程(涵盖模型训练、微调、RAG、LangChain、Agent开发等实战方向)

新手必备的大模型学习PDF书单来了!全是硬核知识,帮你少走弯路(不吹牛,真有用)
05 行业报告+白皮书合集
收集70+报告与白皮书,了解行业最新动态!
06 90+份面试题/经验
AI大模型岗位面试经验总结(谁学技术不是为了赚$呢,找个好的岗位很重要)

07 deepseek部署包+技巧大全

由于篇幅有限
只展示部分资料
并且还在持续更新中…
人工智能大潮已来,不加入就可能被淘汰。如果你是技术人,尤其是互联网从业者,现在就开始学习AI大模型技术,真的是给你的人生一个重要建议!
真诚无偿分享!!!
vx扫描下方二维码即可
加上后会一个个给大家发
【附赠一节免费的直播讲座,技术大佬带你学习大模型的相关知识、学习思路、就业前景以及怎么结合当前的工作发展方向等,欢迎大家~】
更多推荐


所有评论(0)