SpaceX为什么不去训“航天大模型”?聊聊那些在立项评审里被绕开的账本
过去几个月,SpaceX 内部的 AI 工具 Spok 被多家媒体陆续披露,名字取自 Star Trek 那位以逻辑著称的瓦肯人。据报道,它被 SpaceX 工程师用在轨道力学和工程查询场景里,多家媒体在描述它时统一用了一个说法——“Grok 的 SpaceX 定制版”。
近年来,大型科技企业在AI应用上呈现出两种不同的技术路线:一种是基于通用大模型进行企业级部署和工程化改造,另一种是投入资源训练专门的行业大模型。这两种路径在技术实现、成本效益和长期价值上存在显著差异。
以航空航天领域为例,SpaceX内部部署的AI工具Spok引发了业界对这两种技术路线的讨论。多家媒体报道将其描述为"Grok的定制版",但这个"定制"的具体含义存在不同解读——可以指企业拿独家数据重新训练模型,也可以只是通过工程方式将数据接入通用模型。截至2026年5月,公开信息更倾向于后一种解读。
一、谁是最有条件训练行业大模型的人
是埃隆马斯克,他拥有所有的条件:
- 算力:xAI 的 Colossus 集群一度做到 20 万张 H100,是目前公开过的训练集群里规模数得上的几家之一。
- 基座:Grok 4.3 今年 5 月发布,xAI 自称"史上最快、最聪明的模型";Grok 5 押注 6 万亿参数。
- 数据:Falcon 9 和 Starship 每一次飞行的遥测、Raptor 引擎每一次试验的数据、数十年级别的失效分析、轨道力学计算、材料学研究——比任何一家航空航天企业都全。
- 人才:xAI 顶级研究员,加上 Tesla AI 团队(那批用端到端神经网络替换了 30 万行 C++ 代码的人),再加上千名 SpaceX 一线工程师。
- 资金:2026 年 2 月 SpaceX 以 2500 亿美元全资收购 xAI,合并估值 1.25 万亿;xAI 一年敢烧 140 亿美元现金做基座迭代;本周即将公开的 SpaceX S-1 招股书目标募资 750 亿美元,约是 2019 年沙特阿美历史纪录的 2.5 倍。
把这五项条件同时凑齐的,全球目前只有马斯克一个人。如果"最强算力加最稀缺的行业数据加最强基座加最顶级团队 = 一个最强行业大模型"这条等式真的成立,他就是最有理由动手的人。
他没干。
二、Spok 是什么,不是什么?
几家可信源——吴恩达的 The Batch、Wikipedia、CNN、CNBC、Bloomberg——在描述 Spok 时用的都是同一类词:“custom version of Grok”、“tailored version”、“a space-focused version of Grok”。没有一家确认 Spok 做过 continued pretraining、SFT 或任何形式的训练改造。
至于网上少数自媒体声称的"Spok 用 SpaceX 历史飞行遥测做了完整 CPT 训练",可以追到的源头都是 SEO 内容农场之间转来转去的二手转述,没有一手引用,也没有技术文档支撑。换句话说,到目前为止,没有任何公开信息能说明 Spok 在模型权重层面被改造过。
这不符合马斯克一贯高调做事的风格。Optimus、Cybertruck、Robotaxi、Starlink,每一项他都亲自炒到全球头条;唯独对 Spok,他在 X 上的全部公开评价是一条帖子:“Great name 🚀”。五个字一个 emoji,没了。没有发布会,没有 Benchmark,没有"我们训出了航天大模型"的演讲。
xAI 公司层面同一时期的动作也都指向同一个方向:
- 5 月推出 Grok Connectors,原生集成 SharePoint、Outlook、OneDrive、Notion、GitHub、Linear——这是 xAI 给"企业接入"出的标准答案,走 RAG 加工具调用,不是训垂类。
- 5 月 14 日推 Grok Build 公测,编码 Agent,对标 Claude Code。同一天 Japan Times 报道,Apollo Global Management 和 Morgan Stanley 已经在内部部署 Grok——金融场景同样是部署,不是训练。
- 5 月 15 日 xAI 把几个旧版 API 主动退役,基座迭代速度快到自我淘汰。
到目前为止能拼出来的事实,是 Spok 在 SpaceX 内部以企业级部署的形态运行。
三、SpaceX 为什么不去训一个行业大模型
公开能拼出来的原因有几个。
最关键的一条:通用前沿基座的能力天花板,远高于私有数据带来的边际收益。这件事彭博社替全球行业试过一遍。2023 年彭博烧 1000 万美元,用 711B 私有金融语料(其中 369B 来自他们 2007 年起独家积累的财报、市场分析、SEC 文件、内部通讯),训出 50B 参数的 BloombergGPT。结果是 Queen’s University 的独立研究发现,OpenAI 的 GPT-4 在完全没读过任何 Bloomberg 数据的情况下,在 FinQA 金融问答数据集上 zero-shot 准确率 68.79%,反超了 BloombergGPT。最聪明的通用前沿模型,在专业领域里反而比专门训出来的模型更强。马斯克押的就是这一条——他相信下一代 Grok 在不接 SpaceX 数据的情况下,做轨道力学推理仍然会比一个 CPT 过的 Spok 更强。
往下一层是关于稀缺资产的判断:企业真正稀缺的资产是把数据接入基座的工程能力,不是数据本身。Spok 干的事情,大概率是把 SpaceX 几十年的设计文档、试验数据、失效分析、维修工单,通过 RAG、内部数据库接入、系统提示词、工具调用接入 Grok,让 Grok 在每一次回答时检索得到这些独家数据,而不是让模型权重吃掉这些数据。同一份私有数据训进模型权重 vs 作为外部上下文加载,幻觉风险不是同一个量级——Google Research 2024 年的论文《Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?》用受控实验发现:fine-tuning 阶段引入新知识的样本,会线性增加模型推理时的幻觉倾向。机理是这些新事实进了权重之后没有 attribution metadata,模型把它当作 prior knowledge 直接输出,用户无从判断它来自哪条训练样本,也无法事后审计。RAG 这条路反过来:每一次回答都能挂一条具体的 source passage 在后面,事实即便出错也能被回溯。落到企业里,对应的工程命题是把数据治理、检索、Agent、工具调用、评估体系做扎实,而不是训一个能写设计文档的微调模型。
还有一个原因马斯克本人最清楚:垂直 CPT 会把模型推下能力悬崖。把通用基座拿来用几亿到几百亿 token 的行业语料做 continued pretraining,模型大概率会在通用推理能力上发生 Catastrophic Forgetting——你以为它更懂航天了,结果它写代码、做数学、查文献、做长链推理的能力一起退化。彭博之外,IBM Watson 在 MD 安德森癌症中心烧了 5 年、6200 万美金、0 个真实患者获益,2017 年项目终止;Babylon Health 估值峰值 42 亿美元,2023 年破产被 eMed 以 50 万英镑收购,估值蒸发 99.99%。三个跨 11 年的标杆案例同方向印证。烧 20 万张 H100 训 Grok 5 的人不可能不知道这三个案例。
很大概率不是没有人在 SpaceX 内部提过要训行业大模型,只是没过马斯克这一关。
四、企业觉得自己可以训行业大模型的几个理由
从 2023 年大模型爆火以来,“行业大模型”、"企业大模型"这两个词在传统产业 AI 项目里出现得越来越多。航空航天、能源、钢铁、电力、石化、金融、医疗、教育,这些行业里说服自己上马这条路的理由,归纳起来差不多是几句:我们有几十年的行业数据积累,我们最懂这个行业,我们应该有自己的行业大模型。落到工程上,普遍是开源 7B 到 70B 底座(LLaMA、Qwen、DeepSeek、Mistral 这一档),加几亿到几百亿 token 的 continued pretraining,再加几万到几百万示例的 SFT 和一定程度的 RLHF。
这几句话背后默认了几个没被点破的假设。
一个是"数据稀缺等于训练价值"。前文那几个失败案例已经从行业里最稀缺的金融、医疗数据上印证过同一件事——数据稀缺只决定了它"难拿",不决定它"训出来强"。
另一个是"懂行业等于训出来的模型懂行业"。集团里 1000 个型号总师、工艺工程师、数字化老兵能帮你做评估集、做 Agent 流程、做 RAG 知识库的目录,但做评估、做流程、做知识库目录是一回事;训出一个能跑赢"Grok 5 + 良好 RAG"的航天模型是另一回事。
还有一个埋得更深的假设——“数据数量等于训练可用语料数量”。做过这种项目的人都见过:几十年纸质设计文档、半吊子信息化系统、扫描件、维修工单,清洗成可训练的高质量语料的代价,经常超过项目预算本身。更常见的情况是,立项时这笔成本被严重低估,等到交付节点被卡住,要么硬着头皮喂噪声进去,要么把"数据准备"这一项继续往后拖,最后训出来的模型和当初立项书里承诺的不是一个东西。垃圾进,垃圾出。
预算量级也站不到一条水平线上。SpaceX 那边花 2500 亿美元全资买下整个 xAI,拿到的是基座研发能力、20 万张 H100、6 万亿参数级前沿模型,xAI 自己一年还要再烧 140 亿美元现金做基座迭代;走"开源底座 + CPT"路线的项目,绝大多数预算停留在几百万到几千万级别,拿开源 7B 到 70B 加几亿 token CPT,训完上线那天,对标的通用基座已经过了两到三代。
五、企业开训行业大模型之前的需要弄清楚什么
任何一个走"开源底座 + CPT = 行业大模型"路线的项目,动手前的几个问题需要先有答案。
沉没成本:项目上线那一天,如果就被下一代通用基座加 RAG 跑赢,算力沉没成本怎么交代?通用基座半年就出一代,领先期跑得过它的发布周期吗?
边际效用:同一份独家行业数据,至少有两条用法——拿去 fine-tune/CPT 训出"我们的行业大模型",或者接入一个最强通用基座,再叠加 RAG、OAG、Agent、工具调用、领域 Skill 等工程组合。两种做法在你的核心场景上效果差距有多大?值不值得独立训一个?如果差距是 5%,但通用基座下一代自身迭代就能带来 15% 提升,独立训的意义在哪里?参加过几次这种立项评审的人会注意到一件事——边际效用这道题在立项书里很少被严肃算过,因为认真算出来的结果往往不利于项目立得起来。
哪怕走"自训"那条路,还有一笔账容易被绕过去:RAG、OAG、Agent、工具调用这一层工程栈一个都不能省。训进权重的知识会过期,新数据要接入,工具要调用,Agent 要编排,多模态数据要喂——自训不是这层工程栈的替代品,是在它之上再叠一笔训练投入。算边际效用的时候,这笔额外投入换回来的 5%(甚至更少)必须放在一起看。
差异化论据:连马斯克都选了"花 2500 亿买基座 + Spok 式部署"的路线,一个"行业大模型"项目除了"我们行业不一样"之外,还有什么理由?这个理由在下一代通用基座放出来之后还成立吗?在第三方独立 Benchmark 上跑得出明显的优势分吗?
这三个问题里,哪怕只有一个没答案,往下推都会很困难。
六、拥抱大模型的时候,企业的钱和人应该砸向哪里
不该砸的方向,前文 SpaceX 已经替全球行业证完了——开源 7B 到 70B 底座加几亿到几百亿 token 的 continued pretraining+SFT,试图训出"我们的行业大模型"。
反过来,目前看上去走得通的几条路:
- 最强通用前沿基座的稳定调用或私有化部署——核心场景按 token 量算账,对应的开销是 API 订阅费、私有部署运维费或合规通道费,按月按年付,而不是把这笔钱以一次性算力的形式埋进自己训出来的模型权重里。对数据敏感性高、不能走外网商用 API 的场景,把最强开源前沿模型(DeepSeek、Qwen、Llama 这一档)做私有化部署,在内网或专有云里跑起来——和调用商业 API 本质上是同一个思路,区别只在数据出不出企业网络。基座迭代谁来都接得上。
- 私有数据接入基座的工程栈——RAG/OAG 检索、Agent 编排、工具调用、领域 Skill 库、内部知识库治理、Embedding 模型选型、向量数据库运维。这一层做扎实之后,基座迭代再快也不影响它,是企业自己能攒下来的护城河。
- 评估和治理体系——核心场景的评估集、回归测试、幻觉检测、可追溯审计、权限和合规边界。基座一迭代,企业要能在一个工作日内重新测出新基座在自己业务场景里的真实表现,而不是等半年。
人力上对应的,是数据治理工程师、检索/RAG 工程师、Agent 开发、评估工程师、领域 Skill 设计师、合规 AI 架构师这些角色,而不是再招一个 200 人的训练团队去 fine-tune 一个追不上基座的小模型。每一个角色解决的问题,基座升级之后依然成立。
这条路眼下不是大多数传统产业 AI 项目的默认答案。SpaceX 内部已经按这套思路跑了一版,叫 Spok。剩下的,是每一家企业自己的事。
事实来源:CNBC、CNN、Bloomberg、DeepLearning.AI The Batch、Wikipedia、Japan Times、Engadget、TechTimes、SatNews、xAI 官方 release notes 等公开报道,截至 2026 年 5 月 19 日。BloombergGPT 数据引自 Queen’s University 独立研究;IBM Watson MDACC、Babylon Health 案例引自 IEEE Spectrum、STAT News、FT、The Guardian 等公开报道。
更多推荐


所有评论(0)