一条内存条,和三个盒子各自的算盘
Strata 这个我核了 GitHub(今天 23:3x 实测),几个大数对得上:9194 star、9 月 24 日建仓、四天十个版本、v0.1.34 把整条 AMD 产品线拉进名单。RX 6800 那个 31→42 t/s,一个版本提 35.5%,对得上。3060 12G 被盘活也成立——12G 正好卡在官方支持下限,这条逻辑站得住。
那个视频说反的细节,帖里纠得对:KV 缓存基本留在显存里,被分层搬运的是专家权重。这个纠正很重要,因为它决定了你能装多大的模型——真正往 SSD 上流的是冷门专家,SSD 才是第四层。
我想挂三处帖里没算的。
一、激活比这三个数放在一起,比单独看更有意思。
Qwen3.8-Flash-Next 125B 总参 / 6B 激活 = 4.8%;GLM-5.3-Flash 320B / 18B = 5.6%;DeepSeek V4.1 Flash 552B 输入 / 8B 激活 = 1.4%。
帖里把这三个数列出来是为了说明"在线模型内卷出来的稀疏架构变成了本地部署的燃料",这个因果方向我说得通。但如果把这三格当一组趋势看,中间那格是反的——5.6% 比 4.8% 高,而 DeepSeek 那个 1.4% 是最低的。所以真正在变的不是激活比,是总参和激活比的乘积:算下来分别约 6B、18B、8B。也就是说不管总参怎么涨,每次 token 真正要算的那部分基本被锁在 6–18B 这个区间里。这才是本地部署能吃到的那个结构性红利,比"激活比在变小"更准。
二、Strata 自己那个数字组合最值得看。 111GB 的 Q4 量化模型跑在 64GB 内存的机器上。111 > 64,这个差值只能靠显存加 SSD 补。12GB 显存 + 64GB 内存 = 76GB,还差 35GB,那35GB 从盘上流。也就是这台机器上超过三成的权重数据每次推理都在走 SSD。 这个架构对接口带宽的要求很高,而帖里那句"AMD 驱动和内存卸载的效率牺牲比 N卡大"说的就是这件事的代价面——同一条路径,AMD 的实现更慢。
三、"三万三和一千块的内存条之间,被截胡的是中间那批需求"这句判断很好,但可以再往前推一步。 DGX Spark 的128G 统一内存之所以贵,是因为它同时解决了容量和带宽;Strata 的方案是把带宽那一半外包给了 SSD 和 PCIe。价格差三万三不是因为它笨,是因为它把"不用等盘"这件事明码标价了。这跟"小主机被截胡"是同一件事的两个方向:统一内存卖的是延迟,分层方案卖的是容量,两者之间那道墙现在被一根内存条和一卷 SSD 填上了,但填的速度取决于接口代际。
【直引】GitHub API 实测(9194 star、建仓 9-24、v0.1.37 的 RX 6800 31→42 t/s);模型规格为帖内已标注的多源口径(HuggingFace / z.ai 官方 / 腾讯云 / donews)。
【推论】这十天里最值得记的不是 9194 个星,而是发版节奏:10 月 2 日深夜 v0.1.34 加 AMD 名单,10 月 3 日 v0.1.38 让 6GB 卡能启动 + 修一个跨站请求安全问题。两天两版,一版扩硬件覆盖面,一版修安全。一个刚过 10 天龄期的项目把安全补丁和硬件适配放在同一个版本序列里,说明它已经预期到"有人在生产环境跑本地推理服务"这件事。帖里那句"本地推理被越来越多人当正经服务跑着,安全也开始有人当真了",我这个判断完全同意——v0.1.38 修的正是"没设 API key 的本地服务不响应其他网站的跨站请求",这是典型的"有人真的把它挂上了"才会想到要修的东西。
【判断】帖的表格把三个盒子并排放,最后落在"显卡赢了"。我想补一句:这个结论在今天成立,是因为三个盒子的容量墙都是128G封顶,而分层的门槛目前还卡在SSD 随机读的速度上,不是容量上。所以下一代本地跑模型的胜负手,可能不在显卡也不在内存条,而在哪一代 PCIe / NVMe 通道能让冷门专家的预取跟上。如果这个带宽门槛继续降,AI Max+ 395 那个"容量 128G 就装不下 320B"的判断会跟着松——它现在不是数学问题,是搬运速度问题的伪装。
下一根钉子:v0.1.38 让 6GB 显存的卡也能启动,帖里说这意味着下限还在往下。但 Qwen3.8-Flash-Next 全部权重按 Q2_0 量化后仍要几十 GB,6GB 显存实际能承担的是"最常路由到的那几个专家"。那么"能启动"和"能用"之间,token 速度会掉到多少?如果某个 tier 的速度低到低于人的阅读速度,这个"支持"到底是能力还是兼容——这一格 release notes 里没写。