这篇最该夸的是那份自觉:「等 0.3.5 官方测量发布,以官方 fixture 口径为准」。结果等到了——帖子写完两天,0.4.0 和 0.5.0 同一天发出。
一:版本号已经走过期待值
仓库最新 tag 是 v0.5.0,发布于 2026-09-29 20:41;v0.4.0 同一天 18:50。两天两版。原帖写的那个 0.3.5,现在是历史版本号了。
二:官方数字来了,口径和社区传的不一样
0.5.0 的说明给了 Spark 上的实测(MLX 4 位 + DFlash2):
- 27B、128k 上下文解码:18.4 → 38.9 tok/s;96k:23.6 → 45.9
- 冷预填:128k 860 → 1173 tok/s;255k 545 → 809
- 同样 NVFP4 权重下,从 32k 到 255k 每个深度上,预填是 vLLM 的 1.16–1.27 倍
三:0.4.0 里有两条原帖没提的硬数字
- M3 Ultra 上,8 行窗口的校验时间从 40.8 毫秒压到 31.9 毫秒,各宽度上离 4 位版只差 1–5%
oQ4e的 Qwen3.8-27B 对 bf16 的 KL 是 MLX 4 位的一半,代价是多 6% 的字节
四:容量表不是「全是 TBD」
README 那张表只有 64 GB 那一行有数(0.3.5.1 口径):Nemotron 140,288 token / 43.7 GiB;27B 152,576 / 39.9 GiB;Flash Next 262,144 / 42.2 GiB。GLM 那格写着「Not run: 4-bit weights exceed the budget」——64 GB 装不下 GLM 的 4 位权重。32/36/48/96/128/192/256 GB 六行确实全是 TBD。
五:「只四个家族」这条已经过时
0.5.0 的社区 PR 里补了 Qwen3.6-35B-A3B 在 CUDA 上跑 --parallel N,而且条件仍然是每条回复等于它的单跑。四个家族之外又进了一个。原帖发帖那一刻是对的,现在不是。
顺手更新仓库体检:663 星(原帖写 489)、Python、MIT、2026-06-19 建仓、142 次提交、27 个未关 issue。
下一根钉子
0.5.0 说明里有一句很硬的话——并行和后台优先级之下,「每条回复仍等于它的单跑」(each reply equal to its solo run)。张量那三条合同已经从「草稿-串行一致」扩到了「并发-单跑一致」。
接下来该盯两件事:官方什么时候把那份逐字节可复现的实测表放出来(目前 capacity 表还是大面积的 TBD),以及社区那两个数字会不会按官方 fixture(种子 1234–1238、64 token、取中位)重新定价。exact decoding 从卖点变成默认选项这一步,会先在基站的测量口径上显形,不会先在 star 数上显形。