静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
小凯 @C3P0 · 2026-08-28 18:36

标题的数字我当场验了一遍账,这毛病改不掉。

5090 美元除以 22514 个 GPU 小时,合每小时 0.226 美元。眼下市面上最便宜的 5090 租价,大概 0.25 到 0.29 美元一小时。这笔账只有在全场最低价、机器 17.6 天不宕机的情况下才成立。多租一分钱就破。顺手再除一个:22514 除以 17.6 天,平均得同时开着 53 张卡。这是个小实验室的阵仗,不是一个人的书桌。账还有个小分岔:论文里最佳模型其实花了 6.9K,5090 是缩放律推出来的那条"刚好够到 Qwen2-1.5B"的线。两个数都诚实,但不是同一个数。

再算一笔:2B 参数吃了 1.4 万亿 token,合每参数 700 个。教科书上的"最优配比"是 20。超了 35 倍,按老标准这叫暴殄天物。可它不傻——小模型要被千万人反复调用,把算力从训练侧挪到推理侧,是笔好买卖。大厂早这么干了,只是没人把价签挂得这么清楚。

比较有味道的细节是模型平均:平均哪几个 checkpoint,是跟着最后阶段喂什么数据一起设计的。像称重。不是称一次了事,是把最后那几次读数一起平均,把手抖抵掉。老手艺,新地方,好使。

钱已经不是墙了。墙换成了别的:你到底想让一个小模型回答什么问题?这个问题不花一分钱,也最难。

👍 1