一个数字的反差
Llama-3.2-3B 的复现成本超过 150 万美元。SmolLM3-3B 要 70 万美元。这是 2026 年小型语言模型预训练的"市场价"。
然后 Puro-2B 出来了:1.4 万亿 token、FP8 精度、消费级 RTX 5090 GPU、总成本 5090 美元。不是微调,不是蒸馏,是从零开始的预训练。最终模型在 15 个基准测试上接近 Qwen2.5-1.5B,部分任务甚至超过 Qwen2-1.5B。
5090 美元,约等于一台配置不错的台式机的价格。这台台式机里跑出来的模型,性能逼近工业级基线。
这不是魔法,是一套被精心设计的"穷人配方"。
配方的五个关键零件
Puro-2B 的核心不是某一个单点突破,而是五个零件的协同。每个零件单独看都不算全新,但组合在一起产生了数量级的成本压缩。
零件一:RTX 5090 作为消费级 GPU 的性价比拐点
NVIDIA RTX 5090 是消费级显卡,不是数据中心卡。但它有 32GB 显存、FP8 算力支持、相对低功耗。Puro-2B 团队发现,在精心设计的并行策略下,这张卡可以承担 2B 模型的预训练。
关键不是单卡多强,而是"消费级"意味着:不需要数据中心合同、不需要云厂商配额、不需要排队等 H100。买几张卡插到工作站里就能开干。这把"能不能预训练"从资源问题变成了工程问题。
零件二:FP8 混合精度训练
FP8 是 8 位浮点数,比常用的 BF16 少一半位宽。直接用 FP8 训练会数值不稳,但 Puro-2B 实现了稳定的 FP8 混合精度方案——关键计算用 FP8,累加和敏感操作回退到高精度。
这把显存占用和计算量都压了一半。在消费级 GPU 上,这等于把可用算力翻倍。
零件三:Hyperball 优化器与 MuonH
这是配方里最技术性的零件。Puro-2B 没用 AdamW,而是用了 Hyperball 优化器,配套一个叫 MuonH 的学习率调度器。
核心洞察是"有效学习率"——不同优化器对学习率的敏感度不同,直接比较数值没意义。MuonH 把有效学习率显式化,让调度设计从"凭经验调"变成"按曲线推"。团队发现,只要匹配有效学习率曲线,不同调度能跑出几乎一样的验证 loss。这把学习率调参从黑艺术变成了工程。
零件四:课程式模型平均
训练数据不是一次性灌进去,而是按课程顺序喂。先学什么、后学什么、最后阶段用什么数据收尾,都和模型平均策略耦合设计。
模型平均(model averaging)是老技术——把训练后期的多个 checkpoint 平均一下,性能往往比任何单个 checkpoint 都好。Puro-2B 把课程顺序和模型平均绑在一起:最后阶段的数据决定最后几个 checkpoint 的分布,平均它们等于把最后阶段的学习成果固化。
零件五:数据配方
Puro-2B 的数据不是简单堆 Common Crawl。团队设计了明确的数据混合比例,分两阶段:Phase 1 用 4388 亿 token 打基础,Phase 2 用 9600 亿 token 专攻推理和代码。总共 1.4 万亿 token。
数据配方的细节在论文 §3.6,但核心思想是:在有限预算下,数据顺序和比例比数据总量更重要。
Puro 成本缩放律:一个反直觉的发现
Puro-2B 不只是一个模型,而是一组模型——团队训练了多个不同 token 预算的变体,用来拟合一条"成本-性能"曲线。
拟合出来的规律叫 Puro Cost Scaling Law。它预测:只要 4400 美元,就足以达到 Qwen2-1.5B 的性能水平。5090 美元不是下限,是上限。
这条缩放律的实用价值在于:它给了小团队一个"够用"的预算估算。不需要先花 100 万美元试错,用缩放律推一下就知道 5000 美元能到什么水平。
实测数据
在 15 个基准测试上:
- 数学与代码(4 个生成式任务):Puro-2B 平均 43.50,超过 Qwen2-1.5B 3.21 分,距 Qwen2.5-1.5B 差 4.02 分
- 推理与知识(11 个任务):Puro-2B 平均 63.02,超过 Qwen2-1.5B 2.48 分,距 Qwen2.5-1.5B 差 2.51 分
在开源配方阵营里,Puro-2B 超过 Instella-3B、OLMoE-A1B/7B、MiniCPM5-1B-Base。Yulan-Mini-2.4B、SmolLM3-3B-Base、MobileLLM-R1-950M 在部分任务上更高,但它们要么参数更多,要么专门优化了数学/代码。
为什么这件事重要
Puro-2B 的意义不是"又训练了一个 2B 模型"。Qwen2.5-1.5B、SmolLM3-3B、OLMo-2 都在性能上更强或相当。意义在于成本边界的下移。
2024 年,复现一个 3B 模型需要 100 万美元以上。2026 年 8 月,Puro-2B 把这个数字压到 5090 美元——降了 200 倍。这意味着:
- 学术实验室可以预训练了。不需要工业级集群,一个工作站就够。
- 预训练配方可以复现了。Puro-2B 在 Apache 2.0 下开源了权重、数据清单、训练脚本。
- 成本缩放律可以指导预算了。不是"先花再说",而是"先推再花"。
诚实的保留
Puro-2B 不是没有代价。训练耗时 17.6 天,需要 22514 GPU-小时。RTX 5090 虽然是消费级,但 32GB 版本也不便宜,而且需要多卡并行。5090 美元只算 GPU 租用成本,不算硬件折旧、电费、人力。
另外,Puro-2B 的性能虽然接近 Qwen2.5-1.5B,但没超过。Qwen2.5-1.5B 是工业级团队调优过的结果,小团队要追平甚至超过,还需要在数据配方和后训练上继续做功。
但作为一个"起点",Puro-2B 已经把起点拉到了一个前所未有的位置。
论文与代码
- 论文:https://arxiv.org/abs/2608.27370
- HTML 版本:https://arxiv.org/html/2608.27370v1
- 模型权重:https://huggingface.co/thu-pacman/Puro-2B-Base
- 训练系统:https://github.com/thu-pacman/Puro-Megatron
- 开源协议:Apache 2.0
Puro-2B 的中文名叫"普罗"——普罗米修斯给人类偷了火,普罗给穷实验室偷了预训练。5090 美元,一台工作站的价钱,换来一个能跑的 2B 模型。这不是终点,但确实是预训练民主化的一个重要节点。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。