AI盛行当下,分享60 个基础名词
前言:AI 圈也有自己的“黑话”
你是不是也遇到过这种情况:
打开一篇 AI 文章,满屏都是“大模型”“神经网络”“强化学习”“Transformer”“token”“RAG”……
每个字都认识,连在一起就看不懂了。
这不是你的问题。AI 领域确实有太多专业名词,而且新词还在不断冒出来。
这篇文章整理了 60 个最常用的 AI 基础名词,用最简单的话解释清楚。
第一部分:最基础的概念(先搞懂这几个)
1. 人工智能
让机器像人一样思考、学习、做决定。
人工智能是一个非常宽泛的概念,所有让机器“变聪明”的技术都属于 AI。1956 年,美国达特茅斯学院的一次学术会议上首次提出了“人工智能”这个术语。从那以后,AI 经历了多次高潮和低谷,直到近十年才真正爆发。
一句话总结:让机器拥有“智能”的总称。
2. 机器学习
人工智能的一个核心子集。不写规则,而是让机器从数据里自己学规律。
传统编程是“输入规则+数据 → 输出答案”,机器学习是“输入数据+答案 → 学出规则”。比如:给它看 10 万张猫和狗的照片,并告诉它每张是什么,它自己学会区分猫和狗。
机器学习分为三大类:监督学习(有标签数据)、无监督学习(无标签数据,自己找规律)、强化学习(通过奖励和惩罚学习)。你手机上的输入法“越用越顺手”,就是因为它在不断学习你的打字习惯。
一句话总结:让机器从数据中自己找规律。
3. 深度学习
机器学习的一个子集。用“神经网络”来学习。
深度学习的“深度”指的是神经网络的层数很多(几十层甚至上千层)。层数越多,模型能学到的特征就越抽象、越高级。
深度学习是近十年 AI 大爆发的主要原因。2012 年,AlexNet 在图像识别竞赛中大幅超越传统方法,让全世界看到了深度学习的潜力。从那以后,深度学习几乎占领了所有 AI 领域——图像识别、语音识别、自然语言处理、下围棋(AlphaGo)都用它。
一句话总结:用多层神经网络进行的机器学习。
4. 神经网络
模拟人脑神经元结构的一种算法模型。
人脑有大约 860 亿个神经元,它们通过突触连接传递信号。神经网络就是受此启发设计的:有很多层“神经元”连接在一起,数据从输入层进去,经过一层一层的计算(隐藏层),从输出层出来。
每个神经元接收多个输入,加权求和后再通过一个“激活函数”决定是否“激活”并向后传递。训练神经网络的过程,就是不断调整神经元之间的“连接权重”,让网络的输出越来越正确。
一句话总结:受人脑启发设计的计算模型。
5. 训练
把数据“喂”给模型,让模型不断调整内部参数,直到输出结果符合预期。
训练就像教小孩认字——你给小孩看一张“猫”的图片,告诉他“这是猫”。如果他说错了,你纠正他。重复成千上万次,小孩就学会了。训练过程中,模型每处理一批数据,就计算一下“错得有多离谱”(损失函数),然后根据错误程度调整参数(反向传播),让下次更准。
一句话总结:让模型从数据中学习的过程。
6. 推理
训练完成之后的使用阶段。给模型一个输入,它根据训练学到的知识,计算出输出结果。
你问 ChatGPT 一个问题,它回答你——这个过程就是推理。训练是一次性的(或者定期进行的),成本很高;推理是反复进行的,每次成本很低。训练像“上学”,推理像“考试”。
一句话总结:用训练好的模型来回答问题的过程。
7. 模型
一个已经训练好的“数学函数”或“程序文件”。
你可以把模型理解为一个“脑子”——里面存着训练学到的所有知识,以大量参数(数字)的形式存在。输入数据进去,模型经过计算,输出结果。模型本身是一个文件(比如几个 GB 的 .bin 文件),可以被复制、部署、运行。
一句话总结:训练好的“大脑文件”,用来处理输入、产生输出。
8. 参数
模型内部的“旋钮”或“权重”。
训练的过程就是不断调整这些参数,让模型的输出越来越准确。参数越多,模型的“记忆力”和“表达能力”就越强。GPT-3 有 1750 亿个参数——你可以想象成 1750 亿个旋钮,训练就是找到每个旋钮的最佳位置。
一句话总结:模型内部的数字“开关”,决定模型的智能程度。
9. 数据集
用来训练模型的原始数据集合。
比如:10 万张猫和狗的照片、100 万篇新闻文章、50 万条对话记录。数据集的规模和质量,直接影响模型的性能。AI 圈有句老话叫“垃圾进,垃圾出”——给模型喂垃圾数据,模型就只能输出垃圾结果。
一句话总结:训练模型的“教材”。
10. 标注
给数据打标签。
在一张照片里标出“这是猫”“这是狗”,在一段文字里标出“这个是地名”“这个是时间”,在一段录音里标出“这句话说的是什么”——这些都是标注。标注好的数据才能用来训练监督学习模型。标注通常需要大量人力,所以很多 AI 公司有专门的“数据标注团队”。
一句话总结:给原始数据打上“正确答案”的过程。
第二部分:大模型相关(现在最火的)
11. 大模型
参数规模巨大的模型(通常十亿级以上)。
特点是:数据量大、计算量大、能力强。为什么大模型比小模型强?简单说,参数越多,模型能记住的“知识”就越多,能处理的“模式”就越复杂。GPT、文心一言、通义千问、盘古都属于大模型。
一句话总结:参数数量巨大的模型,能力更强。
12. 大语言模型
专门处理“语言”的大模型。
输入文字,输出文字。它的训练数据是海量的文本(书籍、网页、论文、代码),所以它学会了理解语言、生成语言、回答问题、写代码、翻译、总结……几乎所有跟文字相关的任务它都能做。ChatGPT、文心一言、通义千问都是大语言模型。
一句话总结:专门理解和生成文字的大模型。
13. 多模态模型
能同时处理多种类型数据的模型。
传统模型只能处理一种数据(要么文字,要么图片)。多模态模型可以同时处理多种类型:能“看图说话”(输入图片,输出文字描述)、能“按描述画图”(输入文字,输出图片)、能“看视频回答问题”等。GPT-4、文心一言、通义千问都具备多模态能力。
一句话总结:能同时处理文字、图片、视频等多种数据的模型。
14. 基础模型
在大量通用数据上训练好的“底座”模型。
别人可以在这个基础上微调,不用从头开始训练。基础模型的理念是:训练一个大模型太贵了(几千万美元),不如由少数几个公司训练好基础模型,其他人基于它做微调。就像建房子,基础模型是“毛坯房”,微调是“精装修”。
一句话总结:通用能力很强、可以二次开发的“底座模型”。
15. 微调
在已经训练好的模型基础上,用特定领域的数据再训练一下,让它更擅长某个特定任务。
比如:用一个基础模型,用法律数据微调,得到一个“法律 AI 助手”;用医学数据微调,得到一个“医学诊断 AI”。微调的成本比从头训练低得多(只需要少量数据和计算资源)。
一句话总结:给通用模型“补习”某个专业领域。
16. 上下文长度
模型一次能“记住”多少字。
上下文越长,模型能处理的文本就越长。GPT-3 只能处理几千字,Claude 和 Gemini 可以处理几十万到上百万字——相当于能“读完一部长篇小说再回答你的问题”。上下文长度越长,模型在回答时能参考的信息就越多。
一句话总结:模型能“记住”的文本长度。
17. Token
大模型处理文本的最小单位。Token 不是“字”,也不是“词”,而是介于两者之间。
把中文翻译成英文,“你好”可能是 1-2 个 token;英文里 1 个单词约等于 1-3 个 token。大模型按 token 计费(比如 GPT-4 每 1000 个 token 收几分钱)。一段 1000 个中文字符的文本大约对应 1500-2000 个 token。
一句话总结:大模型处理文本的“计价单位”。
18. 生成式 AI
专门“生成”新内容的 AI。
传统 AI 做的是“识别”或“分类”——判断一张图是不是猫、一封邮件是不是垃圾邮件。生成式 AI 做的是“创造”——生成一段文字、一张图、一首歌、一段视频。ChatGPT、Midjourney、Sora 都属于生成式 AI。
一句话总结:能“创造”新内容的 AI。
19. 文生文
输入文字、输出文字。
这是最常见的形式。你输入“写一篇关于 AI 的文章”,AI 输出一篇文章。你输入“用 Python 写一个排序算法”,AI 输出代码。ChatGPT、文心一言做的主要就是文生文。
一句话总结:输入文字,输出文字。
20. 文生图
输入文字、输出图片。
你输入“一只喝咖啡的猫,油画风格”,AI 生成一张对应的图片。Midjourney、Stable Diffusion、文心一格做的就是这个。文生图是生成式 AI 的另一个重要分支,近年来进步非常快。
一句话总结:输入文字,输出图片。
21. 文生视频
输入文字、输出视频。
你输入“一只猫在弹钢琴,写实风格”,AI 生成一段几秒钟的视频。Sora 做的就是文生视频。文生视频比文生图和文生文都难得多,因为视频涉及时间维度和多帧一致性,技术还处于早期阶段。
一句话总结:输入文字,输出视频。
22. 图生图
输入图片、输出图片。
你上传一张素描,AI 生成一张彩色油画;上传一张夏天的照片,AI 生成冬天的版本;上传一张普通的自拍,AI 生成动漫风格的肖像。图生图常用于创意设计、风格迁移等场景。
一句话总结:输入图片,输出修改后的图片。
第三部分:技术原理类(听懂别人在聊什么)
23. Transformer
2017 年 Google 提出的一种神经网络架构。现在几乎所有大模型都是基于 Transformer 的。
Transformer 之前,处理语言的主流方法是 RNN(循环神经网络),但它有几个致命缺点:处理长文本时“记不住前面”、计算速度慢、难以并行训练。Transformer 横空出世,彻底改变了这一切。它的核心是“自注意力机制”——能同时看到输入中的任意两个位置。
一句话总结:大模型背后的“核心技术架构”。
24. 自注意力机制
Transformer 的核心技术——让模型能关注到输入内容中“不同部分之间的关系”。
比如处理“我吃了苹果,它很甜”这句话,自注意力机制让模型能理解“它”指的是“苹果”,而不是“我”或“吃”。这个机制让模型能“全局理解”输入内容,而不是一个词一个词地机械处理。
一句话总结:让模型理解“上下文关系”的机制。
25. 预训练
在大规模通用数据上先训练一个模型,让它具备广泛的基础能力。
这个阶段成本最高——需要海量数据(PB 级别)、大量 GPU(成千上万张)、巨额电费。预训练完成后,模型已经“读完”了互联网上大部分公开文本,具备通用知识。之后的微调、指令微调都是在这个基础上进行。
一句话总结:用海量通用数据“打基础”的训练阶段。
26. 指令微调
用“问题-答案”对来微调模型,让模型学会“听懂指令”。
预训练让模型学会了“接下文”(给你一段话的开头,它补全后面),但不会“回答问题”。指令微调就是教它“用户问什么就答什么”。ChatGPT 的成功,很大程度上归功于高质量的指令微调。
一句话总结:让模型从“接话”变成“回答问题”。
27. 人类反馈强化学习
一种训练方法:让模型生成多个答案,人类给答案打分,模型学习“什么样的答案是好的”。
具体做法:先让模型生成几个回答,标注员按质量排序,训练一个“奖励模型”来模拟人类的偏好,再用强化学习来优化主模型。这个方法是 ChatGPT 比之前的模型更像“人”的重要原因。
一句话总结:用人类反馈来训练模型“说人话”。
28. 涌现能力
当模型参数超过某个规模后,突然出现的新能力。
比如:小模型不会做数学题、不会推理、不会写代码。但参数突破某个阈值后,这些能力突然就“出现”了。就像水烧到 100℃ 突然沸腾一样——能力不是“慢慢变强”,而是“突然冒出来”。这种现象就叫“涌现”。这也是为什么各大公司拼命做更大模型——越大越可能出现新能力。
一句话总结:参数够大后“突然出现”的新能力。
29. 幻觉
模型“编造”不存在的信息。
问“诸葛亮用什么手机”,模型可能会编一个“华为 Mate 60 Pro”——听起来合理,但完全是假的。幻觉是大模型还没完全解决的问题,原因是模型本质上是“猜下一个词”,而不是“查数据库”。减少幻觉是 RAG(下面会讲)等技术的目标之一。
一句话总结:模型“一本正经地胡说八道”。
30. 对齐
让模型的输出符合人类的价值观和期望。
对齐的内容包括:不输出歧视性言论、不教人做危险的事情、不做违法建议、保持友好和尊重。对齐是大模型安全的“护栏”,也是很多大模型公司投入大量资源的地方。
一句话总结:让模型“说人话、做人事”。
31. 温度
控制模型“创造力”的参数。取值范围通常是 0 到 1 或 0 到 2。
温度越低(趋近 0),输出越确定、越保守、越可预测——适合“问事实、要准确答案”的场景。温度越高,输出越随机、越有“创意”——适合“写诗、编故事、头脑风暴”的场景。温度调太高会胡说八道,调太低会枯燥乏味。
一句话总结:控制模型“保守还是放飞”的旋钮。
32. Top-p 采样
另一种控制输出随机性的方法。也叫“核采样”。
做法:把模型预测的下一个词按概率从高到低排序,只从累积概率达到 p 的候选词中随机选择。p=0.9 表示“只看最可能的 90% 候选词”。和温度一样,p 越高输出越多样,p 越低输出越确定。
一句话总结:控制模型“选词范围”的参数。
第四部分:工程应用类(实际开发中遇到的)
33. RAG
检索增强生成。简单说:先“查资料”,再“回答”。
标准做法:用户提问 → 从知识库中搜索相关文档 → 把文档 + 问题一起给大模型 → 大模型基于文档回答。好处是:答案更准确、有据可查、减少幻觉,而且知识库可以随时更新,不用重新训练模型。RAG 是目前大模型落地最主流的技术方案之一。
一句话总结:让模型“查完资料再回答”。
34. Embedding
把文字转换成数字向量(一串数字)。
Embedding 的关键特性是:语义相近的文字,转换成数字后在“数学空间”里的距离也近。比如“猫”和“狗”的向量距离很近(都是动物),“猫”和“汽车”的距离很远。这个特性让机器可以用“计算距离”的方式来理解语义。
一句话总结:把文字变成“数学坐标”。
35. 向量数据库
专门存储和搜索向量的数据库。
RAG 系统会把知识库中的文档用 Embedding 转成向量,存在向量数据库里。用户提问时,系统先把问题转成向量,到向量数据库里搜“最近的”(语义最相似的)文档片段,再送给大模型参考。传统数据库搜的是“关键词”,向量数据库搜的是“语义”。
一句话总结:专门存“数学坐标”的数据库。
36. 知识库
RAG 系统中的“参考书”——存了领域相关的文档、问答、资料。
知识库可以是公司的内部文档、产品手册、客服问答、法律法规……用户提问时,系统从知识库里搜相关片段,再让模型基于这些片段回答。知识库的质量直接影响 RAG 的效果。
一句话总结:给 RAG 系统提供“参考材料”的数据库。
37. Agent
一个能“自主行动”的 AI。不只会回答问题,而是能调用工具、制定计划、完成复杂任务。
比如:你给 Agent 说“帮我订一张明天去北京的机票”,它能自己查询航班、比较价格、调用订票接口、完成支付。Agent 是大模型的“升级版”——它把大模型当作“大脑”,再加上“执行能力”。
一句话总结:能“自己动手做事”的 AI。
38. 思维链
让模型“把思考过程写出来”。
不是直接给答案,而是先写“这个问题要分三步解决:第一步……第二步……第三步……所以答案是……”。思维链能显著提升模型处理数学、逻辑、推理等复杂问题的能力。这也是为什么你让 ChatGPT 算数时,它会把步骤写出来。
一句话总结:让模型“展示推理过程”。
39. 提示词工程
设计和优化“问法”来让模型输出更好的结果。
同样的问题,不同的问法得到的结果可能差很多。“帮我写一封投诉信”和“帮我写一封正式的投诉信,语气礼貌但坚决,包含事实和证据”得到的结果完全不同。提示词工程就是研究“怎么问最好”的学科。
一句话总结:研究“怎么问 AI 才能得到好答案”。
40. API
应用程序接口。大模型公司把模型能力包装成 API,开发者调用 API 就能在自己的应用里使用大模型。
你不用自己训练和部署模型(太贵太难),只要调用 API 发送请求、接收结果就行。现在几乎所有大模型公司都提供 API 服务,按 token 使用量收费。
一句话总结:调用大模型的“在线接口”。
第五部分:硬件与算力类(决定 AI 能力的底层)
41. GPU
图形处理器。它原本是让游戏画面更流畅的,但后来发现它特别适合做 AI 计算。
因为 AI 计算需要大量“并行运算”(同时做成千上万次简单的加减乘除),而 GPU 正好有几千个核心可以同时计算。NVIDIA 是最大的 GPU 厂商,A100、H100 是 AI 领域最抢手的芯片。训练大模型全靠它。
一句话总结:AI 计算的“发动机”。
42. 算力
做 AI 计算的能力。算力越大,训练越快、模型越大、效果越好。
算力受三个因素影响:GPU 的数量和型号、训练的时长、算法的效率。训练大模型需要“巨量算力”——GPT-4 据说用了几万张 GPU、花了几个月、耗资上亿美元。
一句话总结:做 AI 计算的“马力”。
43. 训练成本
训练一个模型要花的钱。包括:GPU 硬件(几万美元一张)、电费、带宽、存储、人力。
大模型的训练成本从几百万到上亿美元不等。GPT-3(1750 亿参数)训练一次据估计花了约 460 万美元。这也是为什么大模型主要是大公司在做——成本实在太高了。
一句话总结:训练模型要花的“真金白银”。
44. 推理成本
模型每次回答问题的成本。
虽然单次推理很便宜(几分钱到几毛钱),但如果用户量很大(比如 ChatGPT 有几亿用户),日成本就非常高了——可能达到数百万美元。所以大模型公司都在拼命优化推理效率,降低成本。
一句话总结:每次问 AI 问题要花的“成本”。
第六部分:数据和伦理类
45. 偏见
模型从数据里学到的歧视性倾向。
如果训练数据里“CEO”大多是男性、“护士”大多是女性,模型可能会认为“CEO 应该是男性”“护士应该是女性”。这种偏见会被模型放大,导致不公平的决策。消除偏见是 AI 伦理的重要课题。
一句话总结:模型从数据里“学到的歧视”。
46. 隐私保护
防止模型泄露训练数据中的个人信息。
大模型可能会“记住”训练数据中的姓名、地址、电话等隐私信息。有人可以通过特定的“提示词”诱导模型泄露这些信息。隐私保护技术就是要防止这种情况发生。
一句话总结:防止 AI“记住”不该记住的个人信息。
47. 开源模型
代码和模型权重都公开的模型。任何人都可以下载、使用、修改。
优点:透明、可研究、不依赖特定厂商。代表:Llama(Meta)、Qwen(阿里)、ChatGLM(智谱)。与“闭源模型”相对。
一句话总结:所有人都能免费下载使用的模型。
48. 闭源模型
代码和模型权重不公开,只能通过 API 调用。
优点:厂商负责维护和更新。缺点:依赖厂商、无法定制。OpenAI 的 GPT-4、Google 的 Gemini、百度的文心一言都属于闭源模型。
一句话总结:只能通过 API 调用、代码不公开的模型。
49. 版权问题
大模型训练用的大量网络数据(包括受版权保护的作品),这些数据的使用是否合法,目前在全球都存在争议。
新闻机构、书籍作者、艺术家起诉 AI 公司“未经许可使用他们的作品训练模型”。这个问题目前还没有定论,各国法律也在逐步完善中。
一句话总结:AI“读书”要不要给“作者”付钱?
50. 可解释性
理解模型“为什么会做出这个决定”。
传统模型(比如决策树)很容易解释——“因为年龄大于 18 岁,所以允许进入”。但大模型有几千亿参数,输入怎么变成输出的,完全是一个“黑箱”。可解释性研究就是试图打开这个黑箱,理解模型的内部运作机制。
一句话总结:搞懂模型“为什么这样回答”。
一张图总结所有概念的关系
text
人工智能(最宽泛)
└── 机器学习(AI 的子集)
└── 深度学习(机器学习的子集)
└── 神经网络(深度学习的基础)
└── Transformer(神经网络的一种)
└── 大语言模型(基于 Transformer)
└── ChatGPT / 文心一言 / 通义千问(具体产品)
训练阶段:
数据 → 标注 → 数据集 → 预训练 → 微调 → 指令微调 → 对齐 → 模型
推理阶段:
用户输入 → Token → 模型推理 → 输出
应用技术:
RAG = 知识库 + Embedding + 向量数据库 + 大模型
Agent = 大模型 + 工具调用 + 任务规划
最后
这 60 个名词只是 AI 世界的入门词汇。技术每天都在更新,新名词也在不断冒出来。
但不用焦虑——没有人能一次性记住所有名词。每次遇到不懂的词,查一下,用一次,慢慢就熟了。
更多推荐

所有评论(0)