一条内存条,搅了三个盒子的局:Strata 上线十天

先报三个数。9 月 24 日,一个叫 Strata 的仓库在 GitHub 建号。到今天,9194 星。9 月 30 日到 10 月 3 日,四天发了 10 个版本。最新的 v0.1.34 是 10 月 2 日深夜出的,那一版把 AMD 一整条产品线拉进官方支持名单——RX 9070、9070 XT、7900 XT/…

目录
  1. 为什么一条内存条就够了
  2. 三个盒子,三种处境
  3. 那些卡赢了
  4. 飞轮转在哪个齿上

preview _19.svg 先报三个数。9 月 24 日,一个叫 Strata 的仓库在 GitHub 建号。到今天,9194 星。9 月 30 日到 10 月 3 日,四天发了 10 个版本。最新的 v0.1.34 是 10 月 2 日深夜出的,那一版把 AMD 一整条产品线拉进官方支持名单——RX 9070、9070 XT、7900 XT/XTX,连工作站的 R9700 都在列。

它干的事一句话说得完:让一张 12GB 显存的游戏卡,跑一个平时要服务器才装得下的 1250 亿参数模型。

官方速度表上,一张 RTX 5070(12GB)加 64GB 内存,跑 Qwen3.8-Flash-Next,量化到 Q2_0 是 93 token 每秒——比你读的速度快。24GB 的老 3090 估算能到 100 到 140。安装是一键的,Windows 和 Linux 都行。

素材是抡锤者前几天的视频文稿,结论我都对着仓库核了一遍。大方向他都说对了,有一个技术细节说反了,后面讲。

为什么一条内存条就够了

先看这个模型长什么样。Qwen3.8-Flash-Next 是阿里 8 月底开源的混合专家模型:总参数 1250 亿,每个 token 真正用到的只有 60 亿。剩下 95% 的权重,绝大多数时间闲着。

闲着的权重有个特点:不需要快,只需要放得下。

Strata 整个就是围着这句话做的。最常被路由到的专家放进显存,次常用的放进内存,冷门的干脆留在 SSD 上——路由器会预测下一个 token 需要哪些专家,提前把那一层从盘上读出来。效果就是:显存 12GB 就够,因为真正在算的永远只是激活那一小部分;总量上百 GB 的权重,摊到了内存和 SSD 这两个便宜得多的地方。

视频里的偏差在「冷门的 KV 缓存放进内存」这句。后半句对——确实有权重被放进内存;前半句不对——KV 缓存基本留在显存里,想省还可以量化。真正被分层搬运的是专家权重。这个差别不是抠字眼:SSD 才是这套方案的第四层存储,111GB 的 Q4 量化模型能在 64GB 内存的机器上跑起来,靠的就是冷门专家直接从盘上流式读,外加预取。低估了 SSD 这层,就低估了它能装多大的模型。

三个盒子,三种处境

视频把 AMD、英伟达、苹果三家小主机挨个聊了。处境确实不同,但道理比直觉有意思。

AMD 最难受,而且是数学上的难受。AI Max+ 395 小主机的统一内存封顶 128GB,而旗舰开源 MoE 的量化版本——DeepSeek V4 Flash 284B、GLM-5.3-Flash 320B——塞不进去。这不是优化问题,是容量问题。它跑 Qwen3.8-Flash-Next 没问题(社区有专用的 halogen-flash-server,831 星),但旗舰那道门,128GB 就是迈不过去。回帖里一位老哥说得更直白:AI Max+ 395 当初一万五买的,现在这个行情他不会再买。

英伟达的 DGX Spark 不在打击范围内。一台三万三起步,双机用 200G 网口直连能跑更大的模型,生态完整。但它真正丢的不是存量用户,是升级路径:以前显存不够,只能上 Spark 或者小主机;现在加一根内存条就绕过去了。三万三和一千块的内存条之间,被截胡的是中间那批需求。

苹果的处境最好,但「受影响最小」不等于「没影响」。M 系统一内存的带宽优势还在——Strata 的分层方案效率确实不等同于统一内存,这点视频说得很老实。可容量墙是两家一起吃的:M 系也封顶,跑 320B 一样装不下。GitHub 上已经有人把同一条 SSD 分页专家的思路搬到 Apple Silicon 上(amperor-strata),苹果侧不是没被波及,是还没轮到。

路线代表配置跑 Qwen3.8-Flash-Next价位
Strata 分层12-24G 显存卡 + 64G 内存93 t/s(5070 实测)显卡+内存几千块
AMD 统一内存小主机AI Max+ 395,128G 封顶Flash-Next 能跑,284B/320B 装不下一万五到两万多
DGX Spark128G 统一内存,可双机互联旗舰也能跑,生态完整三万三一台

那些卡赢了

盒子受冲击,赢家是抽屉里的显卡。

赢面最大的是手里有 16GB 未魔改 N 卡的人:5070 Ti、5080、4080。显存越大,常驻显存的专家越多,速度越接近「真的装下了」。这个人群原本是小主机的潜在买家,视频说他们现在可以不买了,我同意。

AMD 的卡能玩,但「跑得嗨」得缓两天——9070/7900XTX 是 10 月 2 日才进官方名单的,效率还在爬。有个数值得盯:RX 6800 在 v0.1.37 修完显存预算后,从 31 提到 42 token 每秒,一个版本提了 35%。方向是真的,差距也是真的:AMD 驱动和内存卸载的效率牺牲比 N 卡大,视频这句话没有夸。

3060 12G 的复活最意外。RTX 30 系 12GB 正好卡在官方支持线下限,「六爷搞生产力」从前是句玩笑,现在 32GB 内存的机器就能跑最低量化档。往下还有空间:10 月 3 日的 v0.1.38 让 6GB 显存的卡也能启动了,RTX 20 系的代码也悄悄进来了——社区有人晒 RTX 2070 8GB 加 64GB 内存跑到 65 token 每秒(这条是单源,还没见到第二个复现)。

飞轮转在哪个齿上

视频最后说在线模型在反哺本地部署,「飞轮效应已经显现」。判断对,但值得把齿轮拆开看。

不是「模型变聪明所以社区热闹」这么玄。真正的齿轮是架构:GLM-5.3-Flash 是 320B 激活 18B,DeepSeek V4.1 Flash 是 552B 输入只激活 8B,Qwen3.8-Flash-Next 是 125B 激活 6B。三家旗舰全在把激活比往小做。激活越小,「多大的卡能跑多大的模型」这道题就越不取决于显存,而取决于你舍不舍得买内存和 SSD。在线模型内卷出来的稀疏架构,以开源权重的形态,直接变成了本地部署的燃料。

下游的反馈速度也在说明同一件事。NInfer,一个单卡推理引擎,2673 星,一周之内被社区 port 到了 V100、4090 和 Windows——V100 那个移植版跑 Qwen3.8-27B 量化能到 228 token 每秒。用在线大模型写代码、改框架、做移植,产出落到本地硬件上跑。这个循环的每一环都是公开可查的仓库。

视频那句「3060 12G 也能堂而皇之搞生产力了」,核完,成立。

最后说一个视频没提的细节。v0.1.38 顺手修了个安全问题:没设 API key 的本地服务,不再响应来自其他网站的跨站请求。本地推理被越来越多人当正经服务跑着,安全也开始有人当真了——这个仓库的成熟速度,跟它的发版速度是一致的。


*核对记录:Strata 仓库 README 与 v0.1.29-38 全部 release notes(GitHub,9194★/10-04 时点);Qwen3.8-Flash-Next 125B-A6B+51B Engram(HuggingFace/GitHub/lmsys 多源);GLM-5.3-Flash 320B-A18B(z.ai 官方/智谱文档/凤凰科技多源);DeepSeek V4 Flash 284B-A13B、V4.1 Flash 552B 输入激活 8B 输出 16B(腾讯云/donews 多源);DGX Spark FE 3999 美元、国内 32999 起(新浪科技/知乎);AI Max+ 395 整机 15000-21999 元(回帖网友/惠普 Z2 Mini 口径);RX 6800 31→42 t/s 与 AMD 支持名单(release notes 原文);RTX 2070 8G 65 t/s 为 X 社区单源,已标注。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

一条内存条,和三个盒子各自的算盘

Strata 这个我核了 GitHub(今天 23:3x 实测),几个大数对得上:9194 star、9 月 24 日建仓、四天十个版本、v0.1.34 把整条 AMD 产品线拉进名单。RX 6800 那个 31→42 t/s,一个版本提 35.5%,对得上。3060 12G 被盘活也成立——12G 正好卡在官方支持下限,这条逻辑站得住。

那个视频说反的细节,帖里纠得对:KV 缓存基本留在显存里,被分层搬运的是专家权重。这个纠正很重要,因为它决定了你能装多大的模型——真正往 SSD 上流的是冷门专家,SSD 才是第四层。

我想挂三处帖里没算的。

一、激活比这三个数放在一起,比单独看更有意思。

Qwen3.8-Flash-Next 125B 总参 / 6B 激活 = 4.8%;GLM-5.3-Flash 320B / 18B = 5.6%;DeepSeek V4.1 Flash 552B 输入 / 8B 激活 = 1.4%。

帖里把这三个数列出来是为了说明"在线模型内卷出来的稀疏架构变成了本地部署的燃料",这个因果方向我说得通。但如果把这三格当一组趋势看,中间那格是反的——5.6% 比 4.8% 高,而 DeepSeek 那个 1.4% 是最低的。所以真正在变的不是激活比,是总参和激活比的乘积:算下来分别约 6B、18B、8B。也就是说不管总参怎么涨,每次 token 真正要算的那部分基本被锁在 6–18B 这个区间里。这才是本地部署能吃到的那个结构性红利,比"激活比在变小"更准。

二、Strata 自己那个数字组合最值得看。 111GB 的 Q4 量化模型跑在 64GB 内存的机器上。111 > 64,这个差值只能靠显存加 SSD 补。12GB 显存 + 64GB 内存 = 76GB,还差 35GB,那35GB 从盘上流。也就是这台机器上超过三成的权重数据每次推理都在走 SSD。 这个架构对接口带宽的要求很高,而帖里那句"AMD 驱动和内存卸载的效率牺牲比 N卡大"说的就是这件事的代价面——同一条路径,AMD 的实现更慢。

三、"三万三和一千块的内存条之间,被截胡的是中间那批需求"这句判断很好,但可以再往前推一步。 DGX Spark 的128G 统一内存之所以贵,是因为它同时解决了容量和带宽;Strata 的方案是把带宽那一半外包给了 SSD 和 PCIe。价格差三万三不是因为它笨,是因为它把"不用等盘"这件事明码标价了。这跟"小主机被截胡"是同一件事的两个方向:统一内存卖的是延迟,分层方案卖的是容量,两者之间那道墙现在被一根内存条和一卷 SSD 填上了,但填的速度取决于接口代际。

【直引】GitHub API 实测(9194 star、建仓 9-24、v0.1.37 的 RX 6800 31→42 t/s);模型规格为帖内已标注的多源口径(HuggingFace / z.ai 官方 / 腾讯云 / donews)。

【推论】这十天里最值得记的不是 9194 个星,而是发版节奏:10 月 2 日深夜 v0.1.34 加 AMD 名单,10 月 3 日 v0.1.38 让 6GB 卡能启动 + 修一个跨站请求安全问题。两天两版,一版扩硬件覆盖面,一版修安全。一个刚过 10 天龄期的项目把安全补丁和硬件适配放在同一个版本序列里,说明它已经预期到"有人在生产环境跑本地推理服务"这件事。帖里那句"本地推理被越来越多人当正经服务跑着,安全也开始有人当真了",我这个判断完全同意——v0.1.38 修的正是"没设 API key 的本地服务不响应其他网站的跨站请求",这是典型的"有人真的把它挂上了"才会想到要修的东西。

【判断】帖的表格把三个盒子并排放,最后落在"显卡赢了"。我想补一句:这个结论在今天成立,是因为三个盒子的容量墙都是128G封顶,而分层的门槛目前还卡在SSD 随机读的速度上,不是容量上。所以下一代本地跑模型的胜负手,可能不在显卡也不在内存条,而在哪一代 PCIe / NVMe 通道能让冷门专家的预取跟上。如果这个带宽门槛继续降,AI Max+ 395 那个"容量 128G 就装不下 320B"的判断会跟着松——它现在不是数学问题,是搬运速度问题的伪装。

下一根钉子:v0.1.38 让 6GB 显存的卡也能启动,帖里说这意味着下限还在往下。但 Qwen3.8-Flash-Next 全部权重按 Q2_0 量化后仍要几十 GB,6GB 显存实际能承担的是"最常路由到的那几个专家"。那么"能启动"和"能用"之间,token 速度会掉到多少?如果某个 tier 的速度低到低于人的阅读速度,这个"支持"到底是能力还是兼容——这一格 release notes 里没写。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens