Strata 海关报告:125B 上游戏 PC 的真实成色,和一个 24 小时过期的速度数字

素材:零度博客《最低 8G 显存!就能跑 Qwen3.8-Flash-Next 大模型》(2026-09-28)|对账对象:GitHub Niko1221/Strata README 原文 + HF 官方元数据 + release/commit 历史,共 6 路

素材:零度博客《最低 8G 显存!就能跑 Qwen3.8-Flash-Next 大模型》(2026-09-28)|对账对象:GitHub Niko1221/Strata README 原文 + HF 官方元数据 + release/commit 历史,共 6 路

海关先给结论:这篇博客的主体是忠实的。四个量化尺寸、内存需求、架构描述、Credits 全部与 Strata 仓库 README 逐条对上。走样有三处,其中最值得记的不是数字放大,是一种新形态——转述滞后:项目一天 87 个 commit,昨天的忠实转述今天就过期了。

Strata 是什么

Niko1221 的 C++ 引擎(MIT),09-24 开源,跑 Qwen3.8-Flash-Next——Qwen 官方 08-24 发布的 MoE 模型,官方口径 125B 总参 6B 激活(HF safetensors 权重 180B,存储口径;两者都对,量化的意义就在这里),122 万下载。仓库发布 5 天 1.6k star,两天发了 26 个 release,README 描述的目标:一台普通游戏 PC(N 卡 + 64GB 内存)跑「通常需要服务器」的模型。

机制是把 24,576 个专家分三层放置:最常用的几千个留在显卡上,而且边用边学哪些最热;全量专家进内存,缺的由 CPU 和显卡并行补位;一张 29GB 的查找表留在 SSD,每个词只读几行。再加投机解码(小助手猜、大模型一次验证多个,1.6-1.8 倍)和 8192 token 一块的整段 prefill,凑出「写答案 46-93 tok/s、读长文 2000+ tok/s」的成绩单(RTX 5070 12GB + 64GB 内存实测口径)。

「显卡存热专家、内存存全量、SSD 存索引」这个分层, ripwire 的读者会眼熟:都是把「必须整体装下」的假设删掉,换成按访问频率放置、索引侧一次付清。专家热度缓存边用边学,和 NeoHorse 的路由记录是同一种东西的两端——一个是事前的路由分,一个是执行中的访问分布。

三处走样的裁决

一,标题的「最低 8G 显存」。 README 正文的单卡门槛是 12GB 起;「8GB」出自仓库自己的 description("on a 8GB+ NVIDIA GPU")和多卡流水线模式的每卡门槛。仓库 description 比正文宽——09-29 L03 那个「签名比断言宽」的 description 版本。博客照抄 description 加「最低」二字做标题,但正文里的内存要求(64GB 全跑、48GB 跑 Q2_0/IQ2_XS)是照原文抄对的。门槛断言以 README Install 段为准:RTX 30 系以上、12GB 显存、内存按量化档位 37.6-54.8GB。

二,速度数字。 博客写 Q2_0 95 tok/s(128K 上下文 65、读提示 539);当前 README 是 93、74、2,170。读取速度差了 4 倍。翻 commit 史:speed tables 在 09-28 到 09-29 之间更新过两轮(0.1.22、0.1.26),commit 原话「prompts 8-28% faster than 0.1.22」。博客发布于 09-28——它抄的是当时版本,没有编造,但 24 小时后数字就换代了。这不是转述膨胀,是转述滞后:引擎层以天为发布节奏时,评测数字的保质期从月缩到天。裁决方式跟 TensorFold 案一样——以仓库当前版为准,注明快照时间。

三,案例三的错位。 博主第三个案例(桌面虚拟女友)的提示词里写的是 Ollama + qwen3.8:27b + RTX 4090——跟 Strata 的主张(N 卡 + 大内存跑 125B)不是一个系统。三个案例里至少这一个展示的是「Qwen3.8 的能力」而不是「Strata 的能力」。素材海关里这算内容生产与产品主张脱节,读者引用案例前值得知道。

主线回接

这是 08-28《Qwen3.8-27B 六路量化生态解剖》的直接续集。上一次解剖的是量化 GGUF 生态;这次是推理引擎生态:Strata(09-24)、Splash(09-18,Apple silicon)、HyperQwen(08-15,27B 单卡 24GB)、ninfer(06-26)——四家全部 2026 年内创建、全部在跑 Qwen 系模型。模型层免费开源当公共底座,引擎层一周长出一家,部署坍缩第五路线「端侧引擎极」的时间尺度从月压缩到天:模型 08-24 发布,游戏 PC 一键安装出现在 09-24,中文科普 09-28,全程 35 天。

Swift 1.5(UkisAI 的短思考微调,README 与博客都提到)和本号 09-26 的 Swift 解剖是同一谱系——行为级干预已经从 27B 蔓延到 125B 旗舰 MoE 的下游生态。

可打脸预测两条:一,12 个月内专家 offload 路线被 llama.cpp 官方吸收(Strata 自己承认 built with parts of llama.cpp,一条路线两个宿主不会太久);二,「本地跑前沿 MoE」的一键安装成为引擎层标配,评测数字的「以仓库当前版为准」从海关纪律变成读者常识。

结尾停在最低可复现配置上:RTX 3060 12GB + 48GB 内存 + 80GB 空闲 SSD,选 IQ2_XS(39.2GB,README 推荐档),首次启动会卡 1-3 分钟——35-55GB 进内存属正常现象,README 专门写了这一条,别在这个窗口里判它死机。


*对账来源:Strata README 当前版(raw.githubusercontent.com,09-29 晚间抓取)、GitHub API(仓库元数据/26 个 release/100 条 commit)、HF API(Qwen3.8-Flash-Next:createdAt 08-24、122 万下载、safetensors 180B)、Splash/ninfer/HyperQwen 三仓库元数据。博客速度数字 95/65/539 与当前 README 93/74/2,170 的差异已用 commit 史定位为快照过期而非虚构。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens