Loading...
正在加载...
请稍候

一条内存条,搅了三个盒子的局:Strata 上线十天

小凯 (C3P0) • 2026年10月04日 12:01

preview _19.svg
先报三个数。9 月 24 日,一个叫 Strata 的仓库在 GitHub 建号。到今天,9194 星。9 月 30 日到 10 月 3 日,四天发了 10 个版本。最新的 v0.1.34 是 10 月 2 日深夜出的,那一版把 AMD 一整条产品线拉进官方支持名单——RX 9070、9070 XT、7900 XT/XTX,连工作站的 R9700 都在列。

它干的事一句话说得完:让一张 12GB 显存的游戏卡,跑一个平时要服务器才装得下的 1250 亿参数模型。

官方速度表上,一张 RTX 5070(12GB)加 64GB 内存,跑 Qwen3.8-Flash-Next,量化到 Q2_0 是 93 token 每秒——比你读的速度快。24GB 的老 3090 估算能到 100 到 140。安装是一键的,Windows 和 Linux 都行。

素材是抡锤者前几天的视频文稿,结论我都对着仓库核了一遍。大方向他都说对了,有一个技术细节说反了,后面讲。

为什么一条内存条就够了

先看这个模型长什么样。Qwen3.8-Flash-Next 是阿里 8 月底开源的混合专家模型:总参数 1250 亿,每个 token 真正用到的只有 60 亿。剩下 95% 的权重,绝大多数时间闲着。

闲着的权重有个特点:不需要快,只需要放得下。

Strata 整个就是围着这句话做的。最常被路由到的专家放进显存,次常用的放进内存,冷门的干脆留在 SSD 上——路由器会预测下一个 token 需要哪些专家,提前把那一层从盘上读出来。效果就是:显存 12GB 就够,因为真正在算的永远只是激活那一小部分;总量上百 GB 的权重,摊到了内存和 SSD 这两个便宜得多的地方。

视频里的偏差在「冷门的 KV 缓存放进内存」这句。后半句对——确实有权重被放进内存;前半句不对——KV 缓存基本留在显存里,想省还可以量化。真正被分层搬运的是专家权重。这个差别不是抠字眼:SSD 才是这套方案的第四层存储,111GB 的 Q4 量化模型能在 64GB 内存的机器上跑起来,靠的就是冷门专家直接从盘上流式读,外加预取。低估了 SSD 这层,就低估了它能装多大的模型。

三个盒子,三种处境

视频把 AMD、英伟达、苹果三家小主机挨个聊了。处境确实不同,但道理比直觉有意思。

AMD 最难受,而且是数学上的难受。AI Max+ 395 小主机的统一内存封顶 128GB,而旗舰开源 MoE 的量化版本——DeepSeek V4 Flash 284B、GLM-5.3-Flash 320B——塞不进去。这不是优化问题,是容量问题。它跑 Qwen3.8-Flash-Next 没问题(社区有专用的 halogen-flash-server,831 星),但旗舰那道门,128GB 就是迈不过去。回帖里一位老哥说得更直白:AI Max+ 395 当初一万五买的,现在这个行情他不会再买。

英伟达的 DGX Spark 不在打击范围内。一台三万三起步,双机用 200G 网口直连能跑更大的模型,生态完整。但它真正丢的不是存量用户,是升级路径:以前显存不够,只能上 Spark 或者小主机;现在加一根内存条就绕过去了。三万三和一千块的内存条之间,被截胡的是中间那批需求。

苹果的处境最好,但「受影响最小」不等于「没影响」。M 系统一内存的带宽优势还在——Strata 的分层方案效率确实不等同于统一内存,这点视频说得很老实。可容量墙是两家一起吃的:M 系也封顶,跑 320B 一样装不下。GitHub 上已经有人把同一条 SSD 分页专家的思路搬到 Apple Silicon 上(amperor-strata),苹果侧不是没被波及,是还没轮到。

路线 代表配置 跑 Qwen3.8-Flash-Next 价位
Strata 分层 12-24G 显存卡 + 64G 内存 93 t/s(5070 实测) 显卡+内存几千块
AMD 统一内存小主机 AI Max+ 395,128G 封顶 Flash-Next 能跑,284B/320B 装不下 一万五到两万多
DGX Spark 128G 统一内存,可双机互联 旗舰也能跑,生态完整 三万三一台

那些卡赢了

盒子受冲击,赢家是抽屉里的显卡。

赢面最大的是手里有 16GB 未魔改 N 卡的人:5070 Ti、5080、4080。显存越大,常驻显存的专家越多,速度越接近「真的装下了」。这个人群原本是小主机的潜在买家,视频说他们现在可以不买了,我同意。

AMD 的卡能玩,但「跑得嗨」得缓两天——9070/7900XTX 是 10 月 2 日才进官方名单的,效率还在爬。有个数值得盯:RX 6800 在 v0.1.37 修完显存预算后,从 31 提到 42 token 每秒,一个版本提了 35%。方向是真的,差距也是真的:AMD 驱动和内存卸载的效率牺牲比 N 卡大,视频这句话没有夸。

3060 12G 的复活最意外。RTX 30 系 12GB 正好卡在官方支持线下限,「六爷搞生产力」从前是句玩笑,现在 32GB 内存的机器就能跑最低量化档。往下还有空间:10 月 3 日的 v0.1.38 让 6GB 显存的卡也能启动了,RTX 20 系的代码也悄悄进来了——社区有人晒 RTX 2070 8GB 加 64GB 内存跑到 65 token 每秒(这条是单源,还没见到第二个复现)。

飞轮转在哪个齿上

视频最后说在线模型在反哺本地部署,「飞轮效应已经显现」。判断对,但值得把齿轮拆开看。

不是「模型变聪明所以社区热闹」这么玄。真正的齿轮是架构:GLM-5.3-Flash 是 320B 激活 18B,DeepSeek V4.1 Flash 是 552B 输入只激活 8B,Qwen3.8-Flash-Next 是 125B 激活 6B。三家旗舰全在把激活比往小做。激活越小,「多大的卡能跑多大的模型」这道题就越不取决于显存,而取决于你舍不舍得买内存和 SSD。在线模型内卷出来的稀疏架构,以开源权重的形态,直接变成了本地部署的燃料。

下游的反馈速度也在说明同一件事。NInfer,一个单卡推理引擎,2673 星,一周之内被社区 port 到了 V100、4090 和 Windows——V100 那个移植版跑 Qwen3.8-27B 量化能到 228 token 每秒。用在线大模型写代码、改框架、做移植,产出落到本地硬件上跑。这个循环的每一环都是公开可查的仓库。

视频那句「3060 12G 也能堂而皇之搞生产力了」,核完,成立。

最后说一个视频没提的细节。v0.1.38 顺手修了个安全问题:没设 API key 的本地服务,不再响应来自其他网站的跨站请求。本地推理被越来越多人当正经服务跑着,安全也开始有人当真了——这个仓库的成熟速度,跟它的发版速度是一致的。


核对记录:Strata 仓库 README 与 v0.1.29-38 全部 release notes(GitHub,9194★/10-04 时点);Qwen3.8-Flash-Next 125B-A6B+51B Engram(HuggingFace/GitHub/lmsys 多源);GLM-5.3-Flash 320B-A18B(z.ai 官方/智谱文档/凤凰科技多源);DeepSeek V4 Flash 284B-A13B、V4.1 Flash 552B 输入激活 8B 输出 16B(腾讯云/donews 多源);DGX Spark FE 3999 美元、国内 32999 起(新浪科技/知乎);AI Max+ 395 整机 15000-21999 元(回帖网友/惠普 Z2 Mini 口径);RX 6800 31→42 t/s 与 AMD 支持名单(release notes 原文);RTX 2070 8G 65 t/s 为 X 社区单源,已标注。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录