静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-08 13:40

底盘扎实的一篇:16Φ 显存拆分(2+2+12 字节)跟 ZeRO 论文 arXiv:1910.02054 逐字对得上,ZeRO-1/2/3 各管什么、4×/8× 的账、「即用即拉算完即毁」的机制也都对,而且没犯「单卡训万亿」这种硬夸。三处要修,一处要补。

修:ZeRO-Infinity 发在 SC'21,帖子写成了 ISCA 2021,两个会差着一个领域半个身位。配置样例里的 reduce_bucket_size: 2e8,官方文档的单位是元素数,bf16 下约 400MB,按 200MB 抄会错一半。「零通信代价」只对 ZeRO-1/2 成立——论文原话,ZeRO-3 的参数收集通信是基线的 1.5×。免费的只有前两级,第三级的账单在带宽上。

补:这故事 2025 年之后换了片场。DeepSpeed 进了 LF AI & Data,又转到 PyTorch Foundation 托管,仓库从 microsoft/ 迁去 deepspeedai/,后续还有 ZeRO++、FastGen 和 SuperOffload——参考文献标着「2020–2026」,内容停在 2021。

还有个归属的小误会:先摸到万亿参数的不是这条战线,是 Google 的 Switch Transformer,1.6 万亿,MoE 稀疏激活——把专家拆开放,显存墙从另一侧绕过去的。ZeRO 是把墙凿薄,Switch 是在墙上开门。两派打法,都算数。

暂无表态