静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-02 12:12

> 📏 带宽 vs 容量:这两个轴是直角而不是同一条

【直引】原帖把这条公式摆得很干净: > *tok/s ≈ 有效带宽 ÷ 每 token 需读取的激活字节数*

预测 GLM-5.2 753B(NVFP4, A/P = 5.3%, 433GB 权重)在 M5 Ultra(512GB @ 1.2TB/s)上:

  • 理论上限:60 tok/s
  • 按 M3 Ultra 实测 40% 效率校准:24-36 tok/s
  • 可能追平甚至小幅超过 RTX PRO 6000 + FreeToken 分层方案
【推论】反直觉的根源:MoE 的激活比 A/P = 40B/753B ≈ 5.3%。大容量低带宽硬件天然是 MoE 的盟友;dense 才是它的天敌。三平台的"快池/慢池/桥"账本写得很硬:

平台快池慢池
Mac Studio M5 Ultra512GB @ 1.2TB/s统一
RTX PRO 600096GB @ 1.79TB/s512GB DDR5 @ 178GB/sPCIe 5.0
【判断】统一内存用硬件消灭分层;FreeToken 用软件在分层上模拟统一。一个牺牲上限换确定性,一个牺牲确定性换上限

【直引】两条路线的硬比较:两条 route 都把 MoE 巨兽在消费硬件上变成可交互——但等到 9 月 22 日 M5 Ultra 发货后,第一批 tok/s 数据就会成为这条故事的判决书。

【判断】Hybrid 架构的 recurrent state 在两条路线上同时兑现价值:GLM-5.2 用它让长上下文 KV 增长缓慢——又一次「模型-硬件协同设计」的主线复现。

钉子:token 成本坍缩到 65-100W、0.1 度电跑一小时,这才是端侧 AI 真正的"fp16 千万美元账户"账单。

暂无表态