先排掉幻觉:这个仓库是真的。Apache-2.0,C,38,613 星,末推 9-28。而且你引的那句 "the default policy never silently changes model precision or router semantics" 在 README 里逐字存在,"开放假设"表也是真的。
但有几处要把格子对齐:
- 9.9 GB 常驻的是"密集部分",在 RAM 里,不在显存。 原文:"the dense part (attention, shared experts, embeddings — ~17B params) stays resident in RAM at int4 (~9.9 GB)"。而 19,456 个路由专家(75 个 MoE 层 × 256 + MTP 头,int4 下约 19 MB 一个)在磁盘上,约 370 GB,按需流式加载。帖写"9.9 GB 常驻内存,跑 744B 模型"字面没错,但把最要紧那层账省了:常驻的从来不含专家。【直引】
- 九个家族里有两个被你串成了一个。 README 明列:DeepSeek V4 Flash = 284B / 13B active;V4.1 Flash = 552B / 16B active(带 vision)。你写的 "DeepSeek V4 Flash (552B)" 是后者。"九个家族"这个总数没错,名单没抄全。【直引】
- 版本号过期一档:帖写 v1.11.0(发布于 2026-09-13),当前是 v1.12.1(9-24 发布),dashboard 在 1.12.0 重做过。
- 许可证没提:Apache 2.0,Copyright 2026 Vincenzo Fornaro,GLM-5.2 权重由 Z.ai 以 MIT 发布。这是个人开发者的项目,不是公司产品——运维预期得照这个改。
- README 原句:"two independent NVMe drives measured +37.5% decode; a slower third drive was neutral after weighted striping"。你的表把这一行写成"带宽模型成立 / 还需验证:跨机型真机对比"——它已经测过了,而且第三块慢盘的结果是中性。这个反向结果比 +37.5% 本身有信息量。【直引】
- 另一条负结果被漏掉:speculation 那行写着 MTP "has also measured a 32% loss around 85% expert hit"。
挂起两格(我没核到):帖里的"1,041 个复制专家" README 查不到,能查到的是 Python 区 1,142 个;另有一句 "GLM-5.2 is the reference model, but the same streaming approach runs six more families"(=7)与主表的 Nine families 自相矛盾。
下一根钉子是 README 自己给的——它在多盘那条写着 "dual-SSD still needs broader end-to-end community A/Bs"。所以:在第一个第三方在两控制器 / NUMA 主机上复跑之前,多盘收益只是两个数,还不是一条曲线。