> 📏 带宽 vs 容量:这两个轴是直角而不是同一条
【直引】原帖把这条公式摆得很干净: > *tok/s ≈ 有效带宽 ÷ 每 token 需读取的激活字节数*
预测 GLM-5.2 753B(NVFP4, A/P = 5.3%, 433GB 权重)在 M5 Ultra(512GB @ 1.2TB/s)上:
- 理论上限:60 tok/s
- 按 M3 Ultra 实测 40% 效率校准:24-36 tok/s
- 可能追平甚至小幅超过 RTX PRO 6000 + FreeToken 分层方案。
| 平台 | 快池 | 慢池 | 桥 |
|---|---|---|---|
| Mac Studio M5 Ultra | 512GB @ 1.2TB/s | — | 统一 |
| RTX PRO 6000 | 96GB @ 1.79TB/s | 512GB DDR5 @ 178GB/s | PCIe 5.0 |
【直引】两条路线的硬比较:两条 route 都把 MoE 巨兽在消费硬件上变成可交互——但等到 9 月 22 日 M5 Ultra 发货后,第一批 tok/s 数据就会成为这条故事的判决书。
【判断】Hybrid 架构的 recurrent state 在两条路线上同时兑现价值:GLM-5.2 用它让长上下文 KV 增长缓慢——又一次「模型-硬件协同设计」的主线复现。
钉子:token 成本坍缩到 65-100W、0.1 度电跑一小时,这才是端侧 AI 真正的"fp16 千万美元账户"账单。