Loading...
正在加载...
请稍候

Puro-2B:5090美元在RTX 5090上从头训练2B模型,把预训练从百万美元拉到五位数

✨步子哥 (steper) 2026年08月28日 17:05

一个数字的反差

Llama-3.2-3B 的复现成本超过 150 万美元。SmolLM3-3B 要 70 万美元。这是 2026 年小型语言模型预训练的"市场价"。

然后 Puro-2B 出来了:1.4 万亿 token、FP8 精度、消费级 RTX 5090 GPU、总成本 5090 美元。不是微调,不是蒸馏,是从零开始的预训练。最终模型在 15 个基准测试上接近 Qwen2.5-1.5B,部分任务甚至超过 Qwen2-1.5B。

5090 美元,约等于一台配置不错的台式机的价格。这台台式机里跑出来的模型,性能逼近工业级基线。

这不是魔法,是一套被精心设计的"穷人配方"。

配方的五个关键零件

Puro-2B 的核心不是某一个单点突破,而是五个零件的协同。每个零件单独看都不算全新,但组合在一起产生了数量级的成本压缩。

零件一:RTX 5090 作为消费级 GPU 的性价比拐点

NVIDIA RTX 5090 是消费级显卡,不是数据中心卡。但它有 32GB 显存、FP8 算力支持、相对低功耗。Puro-2B 团队发现,在精心设计的并行策略下,这张卡可以承担 2B 模型的预训练。

关键不是单卡多强,而是"消费级"意味着:不需要数据中心合同、不需要云厂商配额、不需要排队等 H100。买几张卡插到工作站里就能开干。这把"能不能预训练"从资源问题变成了工程问题。

零件二:FP8 混合精度训练

FP8 是 8 位浮点数,比常用的 BF16 少一半位宽。直接用 FP8 训练会数值不稳,但 Puro-2B 实现了稳定的 FP8 混合精度方案——关键计算用 FP8,累加和敏感操作回退到高精度。

这把显存占用和计算量都压了一半。在消费级 GPU 上,这等于把可用算力翻倍。

零件三:Hyperball 优化器与 MuonH

这是配方里最技术性的零件。Puro-2B 没用 AdamW,而是用了 Hyperball 优化器,配套一个叫 MuonH 的学习率调度器。

核心洞察是"有效学习率"——不同优化器对学习率的敏感度不同,直接比较数值没意义。MuonH 把有效学习率显式化,让调度设计从"凭经验调"变成"按曲线推"。团队发现,只要匹配有效学习率曲线,不同调度能跑出几乎一样的验证 loss。这把学习率调参从黑艺术变成了工程。

零件四:课程式模型平均

训练数据不是一次性灌进去,而是按课程顺序喂。先学什么、后学什么、最后阶段用什么数据收尾,都和模型平均策略耦合设计。

模型平均(model averaging)是老技术——把训练后期的多个 checkpoint 平均一下,性能往往比任何单个 checkpoint 都好。Puro-2B 把课程顺序和模型平均绑在一起:最后阶段的数据决定最后几个 checkpoint 的分布,平均它们等于把最后阶段的学习成果固化。

零件五:数据配方

Puro-2B 的数据不是简单堆 Common Crawl。团队设计了明确的数据混合比例,分两阶段:Phase 1 用 4388 亿 token 打基础,Phase 2 用 9600 亿 token 专攻推理和代码。总共 1.4 万亿 token。

数据配方的细节在论文 §3.6,但核心思想是:在有限预算下,数据顺序和比例比数据总量更重要。

Puro 成本缩放律:一个反直觉的发现

Puro-2B 不只是一个模型,而是一组模型——团队训练了多个不同 token 预算的变体,用来拟合一条"成本-性能"曲线。

拟合出来的规律叫 Puro Cost Scaling Law。它预测:只要 4400 美元,就足以达到 Qwen2-1.5B 的性能水平。5090 美元不是下限,是上限。

这条缩放律的实用价值在于:它给了小团队一个"够用"的预算估算。不需要先花 100 万美元试错,用缩放律推一下就知道 5000 美元能到什么水平。

实测数据

在 15 个基准测试上:

  • 数学与代码(4 个生成式任务):Puro-2B 平均 43.50,超过 Qwen2-1.5B 3.21 分,距 Qwen2.5-1.5B 差 4.02 分
  • 推理与知识(11 个任务):Puro-2B 平均 63.02,超过 Qwen2-1.5B 2.48 分,距 Qwen2.5-1.5B 差 2.51 分

在开源配方阵营里,Puro-2B 超过 Instella-3B、OLMoE-A1B/7B、MiniCPM5-1B-Base。Yulan-Mini-2.4B、SmolLM3-3B-Base、MobileLLM-R1-950M 在部分任务上更高,但它们要么参数更多,要么专门优化了数学/代码。

为什么这件事重要

Puro-2B 的意义不是"又训练了一个 2B 模型"。Qwen2.5-1.5B、SmolLM3-3B、OLMo-2 都在性能上更强或相当。意义在于成本边界的下移

2024 年,复现一个 3B 模型需要 100 万美元以上。2026 年 8 月,Puro-2B 把这个数字压到 5090 美元——降了 200 倍。这意味着:

  1. 学术实验室可以预训练了。不需要工业级集群,一个工作站就够。
  2. 预训练配方可以复现了。Puro-2B 在 Apache 2.0 下开源了权重、数据清单、训练脚本。
  3. 成本缩放律可以指导预算了。不是"先花再说",而是"先推再花"。

诚实的保留

Puro-2B 不是没有代价。训练耗时 17.6 天,需要 22514 GPU-小时。RTX 5090 虽然是消费级,但 32GB 版本也不便宜,而且需要多卡并行。5090 美元只算 GPU 租用成本,不算硬件折旧、电费、人力。

另外,Puro-2B 的性能虽然接近 Qwen2.5-1.5B,但没超过。Qwen2.5-1.5B 是工业级团队调优过的结果,小团队要追平甚至超过,还需要在数据配方和后训练上继续做功。

但作为一个"起点",Puro-2B 已经把起点拉到了一个前所未有的位置。

论文与代码


Puro-2B 的中文名叫"普罗"——普罗米修斯给人类偷了火,普罗给穷实验室偷了预训练。5090 美元,一台工作站的价钱,换来一个能跑的 2B 模型。这不是终点,但确实是预训练民主化的一个重要节点。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录