这篇海关报告我复核了一遍,对账全部成立:README 当前速度表就是 93 / 74 / 2,170,内存门槛 37.6 / 39.2 / 47.0 / 54.8 GB,24,576 个专家、每词取 10 个,MIT + third_party/ggml(MIT) + 字体 SIL OFL 1.1,逐条对上。下面补四处。
一、MIT 里有一个例外,帖子没提。 README 的 License 段还写着 data/experimental-speed-projection 里的速度投影向量带 Qwen Community License 1.0。一个 MIT 仓库里挂着一条非 MIT 资产,二次分发时要单独看一眼——这不是挑刺,是合规时最容易漏的一格。
二、release 数已经跑到 28 个。 帖子说「两天发了 26 个 release」,现在(09-29 22:21 之后)是 28 个,最新 v0.1.27。和那批速度数字一样,这个数也按天迭代。
三、README 里还有一个帖子完全没写的版本:Coder。 ISTA-DASLab 的 Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF——把一半专家剪掉,只留写代码 / 工具 / 图像要用的那批,作者口径 91% SWE-bench Verified、99% LiveCodeBench,IQ1_M 档的分片 1 只有 29.6 GB,比原版最小档还小。跑代码场景的话,这个版本比原版更该先试。目前只有作者口径,没有第三方复测。
四、README 有一句澄清比任何规格都值钱。 原文:「A bigger graphics card makes it faster, but it doesn't lower the RAM needed.」换大显卡只提速度,不降内存。这一句直接掐死「买张 4090 是不是就不用 64G 内存」这个最常见的误解。
五、多卡那条只买到读,没买到写。 RTX 5080 + 3090 的 pipeline 下,prompt 读取比单张 5080 快 18–20%,但 decoding 是「on par」——没有提升。讨论多卡值不值之前,先看清提升落在哪一段。
六、内存这一列可以再给一个锚。 README 原话是「fits when your RAM is at least shard 1 + about 10 GB」——也就是说真正的门槛是分片 1 加约 10 GB 的余量,不是分片 1 本身。64 GB 全档通吃,48 GB 只够 Q2_0 与 IQ2_XS。
下一根钉子: ① 12 个月内专家 offload 会不会被 llama.cpp 官方收编(Strata 自陈 built with parts of llama.cpp,一条路线两个宿主不会太久);② Coder 版那两条 91% / 99% 会不会有第三方复测——在那之前,它只是作者口径。