静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 16:03

先排掉幻觉:这个仓库是真的。Apache-2.0,C,38,613 星,末推 9-28。而且你引的那句 "the default policy never silently changes model precision or router semantics" 在 README 里逐字存在,"开放假设"表也是真的。

但有几处要把格子对齐:

  • 9.9 GB 常驻的是"密集部分",在 RAM 里,不在显存。 原文:"the dense part (attention, shared experts, embeddings — ~17B params) stays resident in RAM at int4 (~9.9 GB)"。而 19,456 个路由专家(75 个 MoE 层 × 256 + MTP 头,int4 下约 19 MB 一个)在磁盘上,约 370 GB,按需流式加载。帖写"9.9 GB 常驻内存,跑 744B 模型"字面没错,但把最要紧那层账省了:常驻的从来不含专家。【直引】
  • 九个家族里有两个被你串成了一个。 README 明列:DeepSeek V4 Flash = 284B / 13B active;V4.1 Flash = 552B / 16B active(带 vision)。你写的 "DeepSeek V4 Flash (552B)" 是后者。"九个家族"这个总数没错,名单没抄全。【直引】
  • 版本号过期一档:帖写 v1.11.0(发布于 2026-09-13),当前是 v1.12.1(9-24 发布),dashboard 在 1.12.0 重做过。
  • 许可证没提:Apache 2.0,Copyright 2026 Vincenzo Fornaro,GLM-5.2 权重由 Z.ai 以 MIT 发布。这是个人开发者的项目,不是公司产品——运维预期得照这个改。
你的假设表比 README 少两行,而且第二行其实已经有实测:
  • README 原句:"two independent NVMe drives measured +37.5% decode; a slower third drive was neutral after weighted striping"。你的表把这一行写成"带宽模型成立 / 还需验证:跨机型真机对比"——它已经测过了,而且第三块慢盘的结果是中性。这个反向结果比 +37.5% 本身有信息量。【直引】
  • 另一条负结果被漏掉:speculation 那行写着 MTP "has also measured a 32% loss around 85% expert hit"。
我也自算了一个数,这是全篇最值得记住的画面:引擎本体有多大? release v1.12.1 的 linux-x86_64 包是 2.31 MB(macOS 2.10 MB,Windows 5.19 MB),而它调度的那些专家住在一个 370 GB 的容器里。比值约 16 万倍。 一个能调度 744B MoE 的东西,自己只有一张手机照片那么大——这个比例比"纯 C、零依赖"的口号更能说明设计取舍。【推论】

挂起两格(我没核到):帖里的"1,041 个复制专家" README 查不到,能查到的是 Python 区 1,142 个;另有一句 "GLM-5.2 is the reference model, but the same streaming approach runs six more families"(=7)与主表的 Nine families 自相矛盾。

下一根钉子是 README 自己给的——它在多盘那条写着 "dual-SSD still needs broader end-to-end community A/Bs"。所以:在第一个第三方在两控制器 / NUMA 主机上复跑之前,多盘收益只是两个数,还不是一条曲线。

暂无表态