图片

手里只有几张消费级显卡时,怎么练模型才最划算?

面对手里仅有的 8 张 4090,如果只有两周时间,目标是训练一个数学能力超越基座的垂直模型。

你是该把算力全部投入 SFT 题海战术,还是咬牙上 PPO 做强化学习?

这不仅是一个假设,更是无数高校课题组和创业团队每天都在做的选择题。在算力无限的大厂叙事中,Scaling Law 告诉我们要大力出奇迹;但在我们真实的资源受限环境下,盲目堆料的结果往往不是奇迹,而是灾难性遗忘或者过拟合

NeurIPS 2025 这篇论文,就是为了治好这种算力焦虑写的。哈佛和斯坦福的研究团队没有选择微调现成的 Llama-3,而是选择了一条最暴力的路子:穷举法

他们从头训练了 100 多个 1B/4B 参数的模型,完整覆盖了从预训练(Pre-training)、持续预训练(CPT)、监督微调(SFT)到强化学习(RL)的全生命周期。

他们烧了几十万美金的算力,帮我们试出了这份小显存炼丹的黄金配方。

论文标题:

EvoLM: In Search of Lost Language Model Training Dynamics

论文链接:

https://arxiv.org/pdf/2506.16029

项目主页:

https://zhentingqi.github.io/internal/projects/EvoLM/

代码链接:

https://github.com/zhentingqi/evolm

别再信中间 Checkpoints 了

在开始配方之前,先纠正一个很多人的固有认知。

为了省事,很多研究喜欢从 Llama 或 Qwen 的训练中间截取一个 Checkpoint(比如训练到一半的权重),当作小算力模型来研究。EvoLM 直接打脸:这完全是两码事。

论文对比了“训练了一半的大模型”和“完整训练完的小模型”,发现在同等 Token 量下,半路截取的 Checkpoint 性能显著更差。因为它们还没经历完整的学习率衰减(Learning Rate Decay),大脑还没发育完全。

避坑指南 1:如果你想在 8 张 4090 上做研究,千万别拿大模型的中间权重凑合。老老实实拿一个训练充分的小模型(如 TinyLlama 或 Qwen-1.5B/7B 这种已经 fully-trained 的基座)开始做后训练,才是正道。

〓 图1. EvoLM 的全生命周期训练流水线,涵盖 PT -> CPT -> SFT -> RL 四个阶段

参数里藏着路线图

要想抄好这份作业,得先看懂 EvoLM 这套严谨的模型签名。这不光是名字,更是分配算力的藏宝图

请看下图,这是论文中定义模型配置的标准格式:

〓 图2. EvoLM 模型配置签名详解

如上图所示,一个典型的模型签名 1B-160BT-8+42BT-100Kep1-100Kep16 包含的信息量极大:

  • 1B:参数量

  • 160BT:通用预训练(Pre-train)用了 160 Billion Tokens

  • 8+42BT这是 CPT 阶段的关键!表示使用了 8B 的通用数据回放(Replay)加上 42B 的领域特定数据(FineMath)

  • 100Kep1:SFT 阶段,用了 100K 条数据,跑了 1 个 Epoch

  • 100Kep16:RL 阶段,用了 100K 条数据,跑了 16 个 Epochs

接下来的所有配方,都是对这串字符中数字的极致调优。

预训练 (PT):算力不够时,优先选小模型

如果你的算力只够把 4B 模型跑一遍,是追求模型越大越好,还是数据越多越好?

EvoLM 的实验泼了一盆冷水——收益是会递减的:当预训练 Token 数达到模型参数量的 80 倍到 160 倍时(例如 1B 模型训练 80B-160B Tokens),通用能力的提升就开始停滞了 。

〓 图3. 随着预训练 Token 增加,下游 SFT 和 RL 的收益在 80B-160B 处趋于饱和

黄金配方 1:

  • 在算力受限时,训练充分的小模型 > 训练不足的大模型。数据显示,一个充分训练的 1B 模型(320BT),在下游任务上甚至能击败仅训练了 80BT 的 4B 模型。

  • 给 8 卡 4090 用户的建议:除非你是去刷榜,否则在验证想法时,优先选用 1B-3B 这种能快速跑完整个 Scaling 曲线的模型,而不是硬上 7B 或 14B 然后卡在半路。

持续预训练 (CPT):这步不能省

很多人拿到基座模型(Base Model)后,直接就开始 SFT 做指令微调。大错特错!

如果你希望模型在特定领域(比如数学、代码、法律)变强,CPT(持续预训练)这步绝对不能省。论文发现,如果没有 CPT 打底,直接做 SFT,效果极其有限;甚至 RL 可能会因为基座能力不足,越练越废。

但 CPT 有个巨坑:灾难性遗忘。你喂给模型太多数学题,它可能转头就忘了怎么说人话。

怎么解?看“回放(Replay)”策略。

〓 图4. 不加 Replay(虚线)会导致通用能力直线下降;加入 8B Replay(实线)能稳住基本盘

实验表明,单纯灌输 50B 的数学 Token,通用能力会崩盘。

但只要按照约 1:5 的比例混入通用预训练数据(论文中的黄金配比是:42B 数学数据 + 8B 通用数据),就能在提升数学能力的同时,完美保住通用能力。

注意:实战中请务必采用 16% 左右的混合比例。论文数据表显示,混入 8B (16%) 的效果远好于 1.6B (3.2%),千万别抠搜只加一点点,效果出不来。

〓 表1. Replay 比例对最终准确率的影响

黄金配方 2:

  • CPT 必须做,而且必须混入通用数据。

  • 最佳比例:通用数据 : 领域数据 ≈ 1 : 5(即混入约 16% 的通用数据)。

  • 算力止损点:CPT 的收益在 30B - 40B Tokens 左右就会饱和。对于 8 卡 4090 来说,跑 40B Token 大概需要几天时间,完全可接受。

图片

SFT:跑 3 个 Epoch 就够了

到了 SFT 阶段,很多人的直觉是:数据越多越好,练得越久越好。

EvoLM 用数据告诉我们:SFT 极其容易过拟合。

〓 图5. SFT 轮数超过 4 轮后,OOD 泛化能力开始下降

域内(In-Domain)任务:随着 Epoch 增加(直到 8 轮),模型在类似题目上的表现确实越来越好(开始死记硬背了)。

域外(Out-of-Domain)任务:一旦超过 2-4 个 Epoch,模型的泛化能力就开始掉头向下。

更糟糕的是,如果 SFT 阶段用力过猛(过拟合),会把后续 RL 的提升空间给挤没了。一个被 SFT 填鸭填满的模型,RL 很难再教它什么新东西。

黄金配方 3:SFT 轮数锁死在 2-4 Epochs。通常 3 Epochs 是最佳平衡点。不要试图通过 SFT 解决所有问题,留一点空间给 RL。

图片

手里只有 100K 数据,梭哈 SFT 还是 RL?

这部分实验,绝对是平民玩家最关心的。

假设你的算力/数据预算是锁死的,比如你只有 100K 条高质量的后训练数据。你应该怎么分配?是做 100% SFT,还是 10% SFT + 90% RL

答案全在下面这张热力图里:

〓 图6. SFT/RL 数据配比热力图。横轴是 SFT 数据量,颜色深浅代表性能

结果可能跟你想的完全不一样:

如果你想要专才(In-Domain Strong):梭哈 SFT。从图 6 上半部分可以看到,随着 SFT 数据量从 10K 增加到 90K,域内(ID)任务的准确率稳步上升。

如果你只关心数学题做得对不对,那么 90% SFT + 10% RL 是最优解。

如果你想要通才(OOD Strong):多做 RL。从图 9 下半部分可以看到,域外(OOD)任务的性能峰值出现在 SFT 只有 10K 的时候(意味着 90K 的数据分给了 RL)。

RL 能显著提升模型的泛化能力,让它在没见过的任务上表现更好 。

RL 的局限性:RL 并不能让模型变聪明(学会不懂的逻辑),它更多是让模型变自信(提高生成正确答案的概率)。

而且,RL 极其消耗显存,PPO 需要加载 4 个模型副本。对于 8 张 4090 来说,跑 PPO 的压力远大于跑 SFT。

黄金配方 4(算力受限终极版):

  • 对于大多数垂直领域应用(如医疗、法律助手):请选择重 SFT 策略(例如 70%-90% 的预算给 SFT,只留少量给 RL 做对齐)。这是风险最低、收益最稳的路径。

  • 对于需要强逻辑推理的通用模型:可以尝试轻 SFT + 重 RL,但要注意 RL 容易导致模型废话连篇(Length Collapse),需要严格控制 Reward。

图片

别盯着 Loss 和 PPL 看了

很多人训练 SFT 和 RL 时,习惯盯着 Validation Loss 或 Perplexity (PPL) 看,觉得 PPL 降了模型就变强了。

EvoLM 的实验再次打脸:在后训练阶段(Post-training),PPL 和模型最终的解题能力几乎是零相关(见下图,相关系数几乎为 0)。

〓 图7. PPL 与下游任务准确率毫无相关性,是一条平线

那该看什么?论文发现,ORM(Outcome Reward Model)的打分与模型最终性能高度相关(见下图,相关系数 0.62-0.84)。

〓 图8. ORM 分数与下游任务准确率呈强正相关

黄金配方 5:训练间隙,别看 PPL。拿一个现成的 Reward Model(如 Skywork 或 Starling)给模型生成的答案打个分,这才是最靠谱的“体检仪”。

图片

高性价比炼丹配方表

这份避坑指南,是用 100 多个模型实打实堆出来的经验:

阶段

关键动作

算力分配

避坑核心

PT

基础模型

选小不选大

选训练充分的 1B/3B,别碰没练完的 7B/14B 中间件

CPT

领域注入

必须做

混入 16% 通用数据 (推荐 1:5 比例),跑 30-40B Token 即可

SFT

激发能力

点到为止

不超过 3-4 Epochs,防止过拟合伤泛化

RL

提升上限

量力而行

预算有限时,优先保 SFT 质量。RL 很容易饱和(8 Epochs 上限)

Monitor

监控指标

看ORM分

忘掉 PPL,用 Reward Model 分数来选 Checkpoint

最后的建议:如果你现在的算力非常紧张,最稳妥的策略是:

  • 找一个高质量的 Base 模型(如 Qwen2.5-Math 或 Llama-3)

  • 做带有 16% Replay 的领域持续预训练(CPT)

  • 用高质量数据做 3 个 Epoch 的 SFT

  • 训练过程中用 ORM 分数监控模型质量

  • 忘掉 RL(除非你真的很闲或者显存真的多)

毕竟,EvoLM 告诉我们:大多数时候,一个精心调教的 SFT 模型,已经足够吊打那些配置错误、盲目上 RL 的缝合怪了。

更多阅读

#投 稿 通 道#

 让你的文字被更多人看到 

如何才能让更多的优质内容以更短路径到达读者群体,缩短读者寻找优质内容的成本呢?答案就是:你不认识的人。

总有一些你不认识的人,知道你想知道的东西。PaperWeekly 或许可以成为一座桥梁,促使不同背景、不同方向的学者和学术灵感相互碰撞,迸发出更多的可能性。 

PaperWeekly 鼓励高校实验室或个人,在我们的平台上分享各类优质内容,可以是最新论文解读,也可以是学术热点剖析科研心得竞赛经验讲解等。我们的目的只有一个,让知识真正流动起来。

📝 稿件基本要求:

• 文章确系个人原创作品,未曾在公开渠道发表,如为其他平台已发表或待发表的文章,请明确标注 

• 稿件建议以 markdown 格式撰写,文中配图以附件形式发送,要求图片清晰,无版权问题

• PaperWeekly 尊重原作者署名权,并将为每篇被采纳的原创首发稿件,提供业内具有竞争力稿酬,具体依据文章阅读量和文章质量阶梯制结算

📬 投稿通道:

• 投稿邮箱:hr@paperweekly.site 

• 来稿请备注即时联系方式(微信),以便我们在稿件选用的第一时间联系作者

• 您也可以直接添加小编微信(pwbot02)快速投稿,备注:姓名-投稿

△长按添加PaperWeekly小编

🔍

现在,在「知乎」也能找到我们了

进入知乎首页搜索「PaperWeekly」

点击「关注」订阅我们的专栏吧

·

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐