这是这个系列的第三篇,想看前面两篇的可以通过下面两个链接跳转:
ChatGPT在做什么,以及它为什么能起作用(一)
ChatGPT 在做什么,以及它为什么能起作用(二)

核心主旨:ChatGPT 的成功暗示了一个重要的科学事实——人类语言和思维的底层规律,可能比我们想象的要简单得多。


引言:从符号到空间

在前两部分中,我们揭开了两个真相:

  1. ChatGPT 只是在做"概率接龙"——逐词预测下一个词
  2. 这个概率计算来自一个 1750 亿参数的神经网络

但这引出一个更深刻的问题:

"意义"从何而来?

为什么一堆数字运算会产生"有意义的"回答?词与词之间的"相似性"是如何被数学捕捉的?

答案藏在一种被称为嵌入(Embedding) 的技术中——它创造了一个 “意义空间”,在这个空间里,所有的词都是点,所有的意义都是距离。

正如沃尔弗拉姆所言:

“ChatGPT 的成功暗示了一个重要的科学事实:人类语言和思维的底层规律,可能比我们想象的要简单得多。”


一、嵌入:将词转化为数字坐标

1.1 从符号到向量的转变

神经网络其实也是通过计算机来认识世界的,所以他只认识数字,不认识文字,神经网络无法直接理解"cat"、"dog"这些词。
所以我们必须把词 → 向量,也就是一串数字。
在这里插入图片描述

最简单的转换方法是独热编码(One-Hot Encoding)
也就是给每一个词分配一个位置,只有这个位置是1,其他都是0
就像下面这个这样:

"cat"  → [0, 0, 1, 0, 0, ...]
"dog"  → [0, 1, 0, 0, 0, ...]
"fish" → [1, 0, 0, 0, 0, ...]

用这种办法虽然可以给他们安排位置,但与之响应的也出现一个新的问题:每个词之间是"正交"的,没有相似性。

比如说,cat和dog在人的大脑里会觉得,这两个都是动物,也是常见的家庭宠物,但是在独热编码里面,它们之间完全没有关系,距离还是还远,也就是说模型根本不知道它们相似。

所以我们需要更好的办法词嵌入(Word Embedding)
简单来说就是,让模型自己学出来的向量。

在训练过程中,模型会自动调整向量:意思相近的词,向量之间就靠的更近;反之。比如下面这个:

"cat"  → [0.2, -0.5, 0.8, 0.1, ...]
"dog"  → [0.3, -0.4, 0.7, 0.2, ...]
"fish" → [0.9,  0.3, -0.2, 0.5, ...]

可以看到的是,cat和dog之间的距离相近多了,fish还是很远

现在每个词被映射到一个高维空间中的点

1.2 意义空间

词嵌入真正厉害的地方,在于它把语言里的 “意义” 变成了数学空间里的 “位置”,我们把这个空间称之为:意义空间(Semantic Space)

在这个空间里,意思越像的词,坐标靠得越近;反之,越远。
如下图,可以大概看到动物在一边,水果另在一边。
在这里插入图片描述

词嵌入的关键特性

  • 语义相近,空间距离就越近。
  • 词语之间的关系,会被抽象成几何关系,这些关系在空间里都是有方向、有距离的。
  • 可以在空间中进行"意义的计算",在计算机中,或许人类所谓的常识被计算机抽象成King - Man + Woman ≈ Queen这类的向量加减

1.3 嵌入维度的演进

原文只停留在GPT-3的阶段,而在这几年的发展,模型已经又有了质的飞跃,我将变化也添加进文章里。
从 GPT-3 的 12288 维开始,嵌入维度不再是简单 “越高越好”,而是走向分层、可伸缩、专用化。下面是 2020–2026 年的关键变化与最新数据(截至 2026 年 2 月):

模型系列 代表模型 嵌入维度(d_model) 发布年份 特点
Word2Vec - 300 2013 初代词嵌入
BERT base 768 2018 Transformer 基线
GPT-3 175B 12288 2020 超大维度,语义爆炸
Llama 2 70B 8192 2023 开源旗舰标准
Llama 3 / 3.1 70B / 405B 8192 2024–2025 开源主流配置
Qwen 2 / 3 72B 8192 2024–2025 中文开源旗舰
GPT-4 / 4o - 未公开 2023–2025 主模型维度远高于 12288
Claude 3 / 4 Opus 未公开 2024–2026 闭源旗舰
专用嵌入模型 text-embedding-3-large 3072 2025 可伸缩(256–3072)
gemini-embedding-001 3072 2025 可调至 768
Qwen3-Embedding 2560 2025 支持 32–2560 动态切换

二、语义运动定律:语言可能有"物理定律"

ChatGPT的成功,不仅是技术的成功,更揭示了一个深刻的可能:

人类语言和思维,或许遵循一套像物理定律一样简洁、可量化的底层规律,姑且称之为“语义运动定律”

2.1 语言从不随机,而是有迹可循

很多觉得语言复杂多变,但是ChatGPT用“概率预测”就能生成连贯文本,本质是因为语言不是随机的符号,而是有固定语法的结构
简单来说来解释就是,为什么有些人学会一两种语言之后,再继续学习别的语言也很快,其实是因为他们掌握了语言的规律,也就是掌握了语法的结构规律,这也是“语义运动规律”能存在的前提。

2.2 意义空间中的"轨迹"

当ChatGPT逐词生成文本时,它的本质上在“意义空间”里沿着固定的轨迹移动的,也就是沿着固定的语言结构来分析

比如他要生成句子

"The" → "The cat" → "The cat sat" → "The cat sat on the mat"

这就像在 “意义地形” 中行走:
你不能从 “猫” 的区域突然跳到 “黑洞” 的区域(除非有特殊语境)。
每一步都要符合常理认知,这就是语义的 “运动规律”。

2.3 语义运动定律?

物理学用 “位置、速度、力” 解释物体运动,我们或许也能用类似的框架解释语言的 “语义运动”。沃尔弗拉姆的推测,正是基于这个逻辑:

物理概念 语义世界的对应关系 通俗解释
位置 词 / 句子在嵌入空间中的坐标 一句话当前的 “语义落点”(比如 “猫” 在 “动物区”)
速度 意义变化的方向和速率 下一个词的选择倾向(比如 “猫” 之后,“跑” 的概率比 “编程” 高 1000 倍)
语境对意义的约束 前文、语法、常识对后续语义的 “拉力”(比如 “在太空” 这个语境,会把 “猫” 的后续轨迹拉向 “漂浮”,而非 “坐”)
运动定律 语义运动定律(尚未完全发现) 一套能量化 “语境如何约束语义轨迹” 的数学规则 —— 比如 “语境越具体,语义轨迹越固定”

2.4 压缩即智能

为什么ChatGPT能掌握这套“语义运动规律”? 答案是“压缩”,也就是他把这个世界的规律高效压缩
ChatGPT 有效地"压缩"了人类知识,整个过程有点像:

海量人类文本(含语言规律) 
→ 神经网络权重(压缩后的规律) 
→ 生成文本(按规律解压+泛化)
  • 训练数据里藏着所有语言的规律,包括语法、逻辑,还有一些人类的常识。模型通过调整权重,把这些规律压缩成一套“通用算法”。生成的时候,再解压这套算法,按规律生成新文本,甚至在文本上有一些他自己的理解,也就是泛化。

总结上面一大堆就是下面这段:

人类语言和思维的底层,是一套可量化的 “语义运动规律“
生成文本就是在意义空间按规律行走
而智能的本质,就是对这套规律的高效压缩与运用。


三、计算语言:超越模糊性

3.1 自然语言的局限性

人类的自然语言是模糊的,有些语境下他甚至是难以解释的,因为这个有点像是人类长久依赖的习惯说法。

比如我们会说 “吃一碗饭”,但不会说 “吃一碗水”,这不是语法规定,只是大家都这么用。
你突然去问,为什么这句话后面要跟这个固定搭配,说实话,没多少人能解释,因为这有点像是人类长久以来的习惯,大家都这么说了。

比如你问 ChatGPT:

  • “大象能去月球吗?”
    它可以跟你聊一堆道理,但它算不出来
    • 大象需要多少氧气
    • 要带多少水
    • 火箭推力够不够

自然语言能讲故事、讲道理,但不能精确计算
这是它天生的短板。

3.2 AI 的局限性:浅层 vs 深层计算

AI真正的局限性是,他只会模仿,不会硬计算

能力类型 描述 AI 表现
浅层计算 感性表达、文本生成 擅长
不可约计算 复杂数学、逻辑证明 不擅长

这就是为什么 ChatGPT 需要连接外部工具(如 Wolfram Language)。
ChatGPT本质就是语言模型,他的文科很好,但是理科一塌糊涂。所以他必须需要靠外部力量,才能做真正的计算。

特性 自然语言 计算语言(如 Wolfram)
含义 模糊、多义 精确、无二义
能否执行 不能 能直接运行
能否计算 很弱 极强

3.3 符号话语

未来的智能,不能只靠纯语言,也不能只靠计算,而是要把这两者结合起来,打造一个六边形战士。

自然语言 ←→ 计算语言
      ↕
   符号话语(桥梁)

我写到这里的时候在想,这会不会就是现在的智能体。但是现在的智能体好像并没有完全实现,它们只会调用工具、规划步骤,还没有真正让自然语言和计算语言无缝融合,他还没有完美到这种程度,不过说不定这就是未来AI形态。

自然语言太虚太模糊,而纯计算太生硬死板
未来真正的智能,是用符号话语把两者打通,
让AI既能像人一样聊天,又能像计算机一样精确计算


四、核心总结:ChatGPT 到底在做什么?

4.1 基本过程

ChatGPT做的事情很简单:

  • 看人类学过的所有文字
  • 学习语言规律
  • 你给一句提示,他就顺着规律继续往下编,生成相似的内容。

就像第一篇里说的,它就是一个概率接龙机器

这个过程会让它足够像人类的文本,但是它并不完美。

它只是个模仿精,它的目标只是 “学得像”,而不是 “学得对”。而且他还有短板,理科不怎么样。也不知道现实世界的因果,只知道文字的规则,知道怎么用。

说到底,它只是一个顶级模仿者,擅长照猫画虎,却未必真懂虎。

4.2 与大脑的比较

ChatGPT 之所以看起来像大脑,是因为它的神经网络结构,本身就是受人类大脑启发而来。

但是就像前面说的,大脑会反复思考、回忆。

而且最重要的区分是,人类有自我意识,有情感。但ChatGPT只是向前冲,不会回头思考。

4.3 未来方向

现在ChatGPT还少的技能

  1. 不会用工具(必须外接计算器、知识库、Wolfram 这类精确计算)
  2. 不会反思、不会回头改(只会一路往下写,不能循环验算)
  3. 不懂真实世界(没有物理、因果、常识模型)

这些能力什么时候会实现?没人能给出准确时间,但我觉得敢想就会有。

像这么多科幻电影,像是最经典的《人工智能》,这些电影里都能描述的这么真,那怎么会不敢想。未来的 AI 会长成什么样子,其实也是很让人期待的。

至于“AI 会不会取代人类”,至少现在我们知道,他所有的自我意识都是通过人类的数据模仿的来的,只要人类还在不断进步,他就得一直学。
在我的观念里,它们没办法顶替始终进步人类,但是必然也会淘汰掉一些停滞不前的,安于现状的人。

而且我觉得,人总是会排斥一些自己不了解的东西,但是实际上会发现AI也就这样,它只是工具,只是一段逻辑,一种可能。

我们最终会跟他共存,我还依旧期待未来的世界,这也是我会写关于AI文章的原因。

这篇《What Is ChatGPT Doing and Why Does It Work》的解析,写到这里也是第三篇了,感谢你看到这里,希望我的文章对你能有点收获。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐