Qwen3.8-Flash-Next 把容量从「计算」搬到「存储」
180B 总参数,每 token 只激活 6B。阿里于 2026 年 8 月 26 日开源的这份「架构宣言」,
文本版 · 供搜索与朗读
Qwen3.8-Flash-Next 深度研究:把容量从「计算」搬到「存储」
Qwen4 Architecture Preview · Deep Research
Qwen3.8-Flash-Next
把容量从「计算」搬到「存储」
180B 总参数,每 token 只激活 6B。阿里于 2026 年 8 月 26 日开源的这份「架构宣言」,
用隐藏维度 2560 的极窄通道、512 个微型专家、以及一张可以塞进内存条的 51B 短语词典,
向全行业宣告:大模型的下一步,是把容量从「算」搬到「存」。它赢了成本,输了保真。
2026-09-02 成文
六路探马 · 圆桌质证
一手源:官方 blog / SGLang / HF 权重卡
未核实项已如实标注
0. 引子:这是一封提前寄出的战书1. 档案:它到底是什么1.1 参数全景1.2 「180B」这个数字是怎么来的2. 四大创新:逐个拆开2.1 Attention:GDN + QSA —— 一个负责记,一个负责查2.2 Residual:Gated Residual —— 一条路变四条路2.3 Embedding:N-gram Embedding —— 51B 的「短语词典」塞进内存条2.4 Optimization:Muon + AdamW —— 分赃的艺术3. 学术谱系:站在谁的肩膀上A. 线性注意力 → DeltaNet → Gated DeltaNetB. 稀疏注意力 → NSA → DSA → QSAC. 残差流扩展 → Hyper-Connection → mHC → Gated ResidualD. N-gram Embedding / PLEE. Muon 优化器4. 隐藏维度 2560:被所有人忽略的那个数字5. 竞品横评:6B 激活对上 104B 激活5.1 架构矩阵(截至 2026-09-02)5.2 激活预算:真正的胜负手5.3 第三方评测5.4 它输掉的三项,暴露了架构的形状6. 路线之争:正在打的五场仗战场一:全注意力 vs 线性 vs 混合战场二:稀疏化 vs 线性化战场三:参数-计算解耦战场四:记忆/查表增强会成为标准件吗?战场五:窄而深 vs 宽而浅7. 打假时间:五条流传说法的真相❌ 说法一:「不量化可在单张 RTX 4090 上运行」⚠️ 说法二:「训练成本只有 1/9」⚠️ 说法三:「180B 总参」是否误导⚠️ 说法四:官方 benchmark 是否主场作战✅ 说法五:「超越同规模及更大参数量竞品」8. Engram 公案:提出者缺席,跟进者落地9. 工程落地:能跑吗?怎么跑?9.1 SGLang 的三板斧9.2 真实部署门槛9.3 Day-0 的坑:广度是营销数字,可用性是另一回事9.4 生态响应的真正意义10. 拍板:最终结论10.1 它赢了什么10.2 它输了什么10.3 Qwen4 会是什么样10.4 一句话失败模式10.5 给不同读者的行动建议附录 A:核心论文清单附录 B:一手源清单未核实项(如实标注,勿当事实引用)
Qwen3.8-Flash-Next 深度研究:把容量从「计算」搬到「存储」
一句话结论:阿里于 2026 年 8 月 26 日开源的 Qwen3.8-Flash-Next,不是一款新模型,而是一份架构宣言——它用 180B 总参数、仅 6B 每 token 激活的极端配比,向全行业宣告一件事:大模型的下一步,是把容量从「算」搬到「存」。它赢了成本,输了保真。
0. 引子:这是一封提前寄出的战书
2026 年 8 月 26 日深夜,阿里通义千问团队开源了 Qwen3.8-Flash-Next。
官方给它定的身份很特别:多模态 MoE 模型,同时是 Qwen4 架构的早期预览。这个定位有一个精确的先例——当年 Qwen3-Next 之于 Qwen3.5。那次引入的 Gated DeltaNet + Gated Attention 混合结构,后来一路用到了 Qwen3.5、3.6、3.7、3.8 四代。
所以这次的潜台词是:我现在摆出来的这套东西,就是 Qwen4 的地基。你们先检验,我再去盖楼。
为什么要提前?三个理由,层层递进:
一是抢架构话语权。这次四大创新里最扎眼的 N-gram Embedding,其理论原语 Engram 是 DeepSeek 在 2026 年 1 月提出并写进论文的——但 DeepSeek 自己的 V4 没用,留给 V5。结果第一个把它装进生产级旗舰开源权重的,是 Qwen。「谁定义了下一代稀疏模型」这个叙事,被阿里抢了先手。
二是让生态提前适配。GDN、QSA、Gated Residual、N-gram Embedding 全是新算子,需要新 kernel、新内存管理、新量化方案。SGLang、vLLM、TensorRT-LLM、llama.cpp、Unsloth、KTransformers、ms-swift 全部 day-0 支持,NVIDIA 甚至专门写了 GB300 NVL72 的部署博客,国产侧的众智 FlagOS 社区一天内完成 10 家芯片适配并新增 8 个 Triton 融合算子。这种整齐划一,绝不是社区自发——这是有预谋的协同发布,推理栈显然提前数周就拿到了架构。
三是对冲。7 月 31 日 DeepSeek-V4-Flash-0731 刚靠纯后训练把 DeepSWE 从 7.3 拉到 54.4,气势正盛。Qwen 用 58.7 压过去,且成本结构更优。
1. 档案:它到底是什么
架构剖面:主干是一根 48 层的塔,按「3 层线性 + 1 层稀疏」的节拍循环 12 次;第 2 层旁挂一张 51B 的查表。真正每个 token 参与计算的,只有 6B。
1.1 参数全景
项目数值备注
总参数180B125B 主干 + 51B N-gram + 4B MTP(+0.449B ViT)
每 token 激活6B稀疏比 30×
隐藏维度2560极窄(DeepSeek 系 7168、Kimi K3 7168)
层数布局12 × (3×(GDN→MoE) → 1×(QSA→MoE))36 层 GDN + 12 层 QSA,3:1
GDNV 48 头 / QK 16 头,head_dim 128线性注意力,固定大小状态
QSAQ 24 头 / KV 2 头,head_dim 256,RoPE dim 64稀疏全局注意力
QSA IndexerMQA:4 query 头 + 1 共享 key 头,head_dim 128压缩比 c4,预算 512 blocks / 2048 tokens
MoE512 专家,10 routed + 1 sharedexpert intermediate dim 640
Gated Residual4 分支,bottleneck rank 320残差流扩宽 4 倍
N-gram Embedding2000 万条 2-gram/3-gram,位于 layer 251.2B 参数,BF16 约 95.4 GiB
词表248,320
上下文原生 262,144,YaRN 至 1,000,000
优化器Muon(主权重)+ AdamW(Embedding/Router/GR 低秩)
MTP1 层,多步训练4B 参数
许可qwen-community-1.0>1 亿 MAU 或 >$20M 月收入需显著展示模型名;MaaS/AI 办公助手类需单独许可
定价(生产版 Qwen3.8-Flash)0.15 / 百万输入,0.47 / 百万输出默认 1M 上下文
1.2 「180B」这个数字是怎么来的
主干参数 125.74 B
N-gram 表 51.20 B ← 不参与每 token 矩阵乘法
MTP 2.61 B (官方声称 4B,第三方逐 shard 实测 2.607B)
视觉编码器 ViT 0.449 B
─────────────────────────
合计 180.0 B
第三方 csidia 逐 shard 核对:BF16 checkpoint 共 131 个 safetensors、359,999,963,128 bytes。所以「180B」站得住——但要注意,这 180B 里只有 6B 参与每个 token 的计算,51B 的 N-gram 表是「确定性寻址的查表」,连显存都可以不占。
2. 四大创新:逐个拆开
Qwen 官方把这次升级归纳为四个方向:Attention、Residual、Embedding、Optimization。但要分清哪些是「改」,哪些是「继承」。
2.1 Attention:GDN + QSA —— 一个负责记,一个负责查
QSA 的三步:把序列按 c4 压成 micro-block → indexer 在块级打分选出 top-512 → 用原始未压缩的 K/V 做精确注意力。压缩产物是「目录」,不是「摘要」。
官方的比喻极精准:GDN efficiently "remembers," while QSA precisely "retrieves."
GDN(Gated DeltaNet) 是线性注意力。它的本事是把历史压缩进一个固定大小的状态——不管上下文是 1K 还是 1M,状态大小不变,KV Cache 根本不增长。代价也很直白:这是有损压缩。
QSA(Qwen Sparse Attention) 是全球注意力层的稀疏化改造。它的工作流程:
序列进来,先按 c4 压缩比聚成 micro-block——每 4 个原始 key 在 FP32 下求平均、归一化、用首个 token 的 MRoPE 位置旋转,得到 1 个 compressed key。
一个轻量 indexer(4 个 128 维 query 头 + 1 个共享 key 头)给每个 compressed block 打分:
st,b = (√128 sumh=14 ReLU(⟨ qIt,h, barkIb ⟩)
选出 top-512 blocks,展开回 2048 个逻辑 token 位置,再补上当前不完整 block 的 0–3 个 token——最终稀疏注意力最多只看 2051 个位置。
关键:compressed keys 只作索引用,最终的 softmax 与 value 聚合用的是原始、未压缩的 K/V。
最后这一点是 QSA 与 DeepSeek NSA 最本质的分野。NSA 的 compression 分支直接产出注意力输出(是「粗粒度的另一路注意力」);QSA 的压缩是纯寻址结构,不进输出(是「查字典的目录」)。
QSA 相对 DeepSeek DSA 的改进,官方说得明白:DSA 用 token 级 indexer,上下文一长,indexer 本身就成了不可忽略的计算来源。QSA 改成 block 级,同时压低了索引开销和注意力开销。
而它没有采纳 IndexCache 的跨层索引复用(那能省约 75% indexer 计算)——QSA 每层独立压缩、独立打分。理由是:跨层复用依赖「相邻层 attention 相似性」这个假设,而 GDN 与 Attention 交错的混合架构里,这个假设不成立。用重复计算换层间选择差异性,这是一个清醒的取舍。
实测收益:1M tokens 下,QSA kernel 的 prefill 加速最高 7.6×、decode 加速最高 4.9×。在 90% prefix cache 命中的在线服务场景下,1M 上下文的 prefill 吞吐达到 Qwen3.7-Plus 的 8.6×。
⚠️ 重要澄清:3:1 这个比例不是本次的创新。它与 Qwen3-Next 完全一致,一动没动。真正的变量是那 25% 的全局层,从 full attention 换成了 QSA。
2.2 Residual:Gated Residual —— 一条路变四条路
左:传统残差流是独木桥,深了就堵。右:Gated Residual 把它扩成四条并行道,每条配一个动态门。DeepSeek 的 mHC 用「加约束」解稳定性,Qwen 用「换机制 + 砍混合」解。
传统 Transformer 里,所有层都在同一条残差流上读写。网络一深,早期的特征被后来的信息反复混合,重要信号容易被稀释。
Gated Residual (GR) 干了三件事:
扩流:把单条残差流扩展成 4 条并行分支,模型可以按当前内容动态决定从每条分支读多少、写回多少。
门控:引入 element-wise 动态门(承自 Qwen 自家的 GatedNorm)。
瘦身:砍掉 Hyper-Connection 的 branch mixing(分支混合)。官方原话:一旦读写操作足够有表达力,额外的分支混合没有显著收益,可以直接去掉,从而减少访存开销和不稳定来源。
第 3 点是这一节最值得品味的地方。Hyper-Connection 把残差流变宽后有个致命问题:混合矩阵不再保证 identity mapping,深了就炸。DeepSeek 的 mHC 用流形约束(Sinkhorn-Knopp 投影到双随机矩阵)来解;Qwen 走的是另一条路——既然砍掉了跨支混合,稳定性问题就被大幅削弱,也就不需要 Sinkhorn 那套迭代开销。
这是两种截然不同的工程哲学:一个加约束,一个换机制。
官方还提到一个很有意思的涌现现象:4 条分支中,有一条自然演化成了长程通路,把第一个 Attention 层直接连到中后段的多个层。这印证了「多路径信息高速公路」的假说。
另外,Residual State 支持 FP8 存储——残差流变宽 4 倍后,显存与带宽压力必须靠低精度存来抵。
2.3 Embedding:N-gram Embedding —— 51B 的「短语词典」塞进内存条
标准 Embedding 是「一个 token 查一次表」。N-gram Embedding 改成「用当前 token + 前几个 token 组成的局部上下文去查表」,为常见短语和局部模式提供额外表示。
官方称其为 PLE(Per-Layer Embeddings),具体规格:
位置:第 2 个 decoder block(configured layer ID 2,zero-based index 1)——只此一层
规模:2000 万条 n-gram,51.2B 参数,BF16 约 95.4 GiB
查表方式:对 token xt,8 个 2-gram hash heads 用 (xt-1, xt)、8 个 3-gram hash heads 用 (xt-2, xt-1, xt),共产生 16 个 embedding row IDs
每行 160 个值,拼接成 Et ∈ ℝ2560
之后:Et to Kt ∈ ℝ4 × 2560, Vt ∈ ℝ2560;gt = textGate(textNorm(Qt), textNorm(Kt)) ∈ ℝ4 × 1;Ut = gt ⊙ Vt;Deltat = Ut + textSiLU(textDWConv(textRMSNorm(Ut)));最后 tildeRt = Rt + Deltat 注入 HC 状态
关键优势:确定性寻址。 N-gram 的 hash ID 在 token 进入网络的瞬间就能算出,因此可以提前预取、可以整块丢到 CPU / host memory。而 MoE 的路由依赖运行时隐状态,无法预先寻址——所以 MoE 专家卸载至今仍是难题。
这一点是被严重低估的。SGLang 的实测数据:H200 TP4 + MTP-213 下,把 N-gram 表卸载到 pinned host memory 后——
指标卸载前卸载后变化
每 GPU target-model 权重83.91 GiB60.45 GiB−23.46 GiB
KV Cache 容量1.84M tokens3.28M tokens+78.54%
吞吐(1/2/4 并发)——−0.07%(几乎无损)
而且输出 token IDs 逐位一致,logprob 轨迹也完全一致。这是工程上极漂亮的一手:用 PCIe 带宽换显存,且几乎不付性能代价。
2.4 Optimization:Muon + AdamW —— 分赃的艺术
Muon 的核心是 Newton-Schulz 迭代做梯度正交化,专为二维矩阵参数设计。Qwen 这次的改进有三条,每条都对应一个真实痛点:
参数划分:Attention、GDN、MoE Experts 的主权重用 Muon;Embeddings、MoE Router、GR 中的低秩参数用 AdamW。道理是:正交化对稀疏梯度与低秩结构不友好,router(梯度稀疏)和 embedding(尺度敏感)交给 AdamW 更稳。
融合矩阵拆分正交化:工程上 QKV、gate/up 常融合成一个大矩阵。直接对整个融合矩阵做正交化,会让不同语义的子块互相污染——必须先按独立的线性变换拆开,再分别正交化。
干掉 Batch Size Warmup:大模型训练常规做法是先用小 batch 再切大 batch 以省 token。Qwen 发现这在 Muon 下不再必要——从小 batch 逐步增大并不改善最终结果,反而要多花 18.8% 的优化器步数。所以最终 recipe 直接开局就用目标 batch size。
此外还为新架构重拟合了 Scaling Law,模型可以稳定使用更大的 learning rate 和 batch size。
3. 学术谱系:站在谁的肩膀上
Qwen 官方 blog 列了 9 条参考文献,等于自己交出了家谱。以下五棵谱系树,每棵都标了 Qwen 的改动点。
A. 线性注意力 → DeltaNet → Gated DeltaNet
Linear Transformer (Katharopoulos et al., 2020, arXiv 2006.16236)
├─ 核函数近似:Performer / RFA / cosFormer
├─ 衰减递归:RWKV (2305.13048) / RetNet (2307.08621)
├─ 选择性 SSM:Mamba (2312.00752) → Mamba-2 (2405.21060)
└─ 快速权重编程
└─ DeltaNet (Schlag/Irie/Schmidhuber, IDSIA, 2021, arXiv 2102.11174)
└─ Gated DeltaNet (Songlin Yang/MIT CSAIL + NVIDIA, 2024-12, arXiv 2412.06464, ICLR 2025)
└─ 混合架构谱系(线性:全局)
├─ Jamba (AI21, 2024) ≈ 7:1
├─ MiniMax-01 (2025, arXiv 2501.08313) 7:1
├─ Griffin (DeepMind, 2024) ≈ 3:1
├─ Qwen3-Next (2025) 3:1
└─ Qwen3.8-Flash-Next (2026-08) 3:1 ← 比例未变
Qwen 改了什么:这一节几乎没有「改」——完整继承了 Gated DeltaNet 的 gated delta rule 与 WY 表示 chunkwise 并行,也继承了 Qwen3-Next 的 3:1 模板。A 节是继承,B 节才是改动。
3:1 在谱系中的位置:换成全局注意力占比即 25%。Jamba / MiniMax-01 只有 12.5%,Griffin 约 25%。Qwen 与 Kimi K3 并列,站在用了线性注意力这一谱系里注意力最重的稳健端——宁可多留全局层,也不赌纯线性外推。
B. 稀疏注意力 → NSA → DSA → QSA
Sparse Transformer (2019) → Longformer → BigBird 固定模式稀疏
└─ 可学习 / 动态稀疏
├─ NSA (DeepSeek, 2025, arXiv 2502.11089, ACL 2025 Best Paper)
│ 三分支:compression + selection + sliding window
├─ MoBA (Moonshot + 清华, 2025, arXiv 2502.13189, NeurIPS 2025)
├─ SeerAttention (Microsoft, 2024, arXiv 2410.13276)
└─ DSA (DeepSeek-V3.2, 2025, arXiv 2512.02556)
lightning indexer(ReLU、少头)+ token 级 top-k
├─ IndexCache (清华 + Z.ai, 2026, arXiv 2603.12201)
│ 跨层复用 index,省约 75% indexer 计算
└─ QSA (Qwen, 2026-08) ⚠️ 无独立论文,仅 blog + tech report
三方案对照:
NSADSAQSA
压缩粒度三分支token 级 indexermicro-block(c4)
压缩产物直接进注意力输出索引纯索引,不进输出
最终注意力三分支融合稀疏 MLA/MQA稀疏 GQA(原始 KV)
跨层复用否否(IndexCache 才加)明确不复用
Qwen 改了什么:继承 DSA 的「轻量索引器 + ReLU 打分 + top-k」骨架;改的是粒度(token 级 → block 级)和索引来源(不额外训 indexer,直接压缩 KV 本身);明确没有采纳 NSA 的三分支融合,也没有采纳 IndexCache 的跨层复用。
C. 残差流扩展 → Hyper-Connection → mHC → Gated Residual
ResNet (2015) identity mapping
└─ Pre-LN / Post-LN 跷跷板
├─ Hyper-Connections (ByteDance Seed, 2024, arXiv 2409.19606, ICLR 2025)
│ ├─ Frac-Connections (ByteDance, 2025, arXiv 2503.14125)
│ └─ mHC (DeepSeek-AI, 2025-12, arXiv 2512.24880)
│ Sinkhorn-Knopp 投影到双随机矩阵,恢复 identity mapping,开销 6.7%
└─ 门控侧支
└─ GatedNorm / Outlier-Driven Rescaling (Qwen + Edinburgh, 2026, arXiv 2601.22966)
└─ Gated Residual (Qwen3.8-Flash-Next, 2026-08) ⚠️ 仅 blog
这条链的问题意识极清晰:HC 把残差流从 1 扩到 n,性能涨了,但混合矩阵不再保证 identity mapping,深了就炸。mHC 的解法是加约束(投影到双随机矩阵);Qwen 的解法是换机制——用 element-wise 动态门直接控制每条支路幅度,同时砍掉 branch mixing。既然没有跨支混合,稳定性问题被大幅削弱,也就不需要 Sinkhorn 的迭代开销。
D. N-gram Embedding / PLE
Over-Tokenized Transformer / Over-Encoding (ByteDance Seed, 2025, arXiv 2501.16975)
├─ Gemma 3n PLE (Google, 2025) ⚠️ 无 arXiv,仅技术文档
├─ BLT (Meta FAIR, 2024, arXiv 2412.09871, ACL 2025 Outstanding)
└─ Engram / Conditional Memory (北大 + DeepSeek-AI, 2026-01, arXiv 2601.07372)
hashed N-gram O(1) 查找 + context-aware gating + 确定性寻址 → host memory
提出 U 型稀疏分配律:Engram 占 20–25% 稀疏参数最优
└─ Qwen N-gram Embedding / PLE (2026-08) ⚠️ 无独立论文
四者逐项对比:
hash 方式n 取值插入层是否卸载规模
Over-Encodingmod 哈希 + tiled matrix分层 n-gram仅输入层否12.8M 词表
Gemma 3n PLE词表查表1-gram每层是(CPU)256 维/层
Engramhashed N-gram2/3-gram多层是(三级缓存)占 20–25% 参数
Qwen N-gramhash heads(8×2g + 8×3g)2/3-gram单层(第 2 块)是(Host Memory)2560 维 / 51.2B
本质:这是一条「参数-计算解耦」的思想链——用一层确定性查表,把知识存储从 FLOPs 里剥离出去。
E. Muon 优化器
Shampoo / SOAP 等二阶矩阵优化器
└─ Muon (Keller Jordan et al., 2024) ⚠️ 无 arXiv,仅博客
SGD-momentum + Newton-Schulz (ns_steps=5) 正交化,仅用于 2D 隐藏层权重
└─ Moonlight: Muon is Scalable (Moonshot AI, 2025, arXiv 2502.16982)
weight decay + update RMS 对齐 → 可规模化;16B MoE / 5.7T tokens,约 2× 效率
└─ MuonClip / QK-Clip (Moonshot, 2025) ⚠️ 无 arXiv
└─ Qwen 的 Muon 变体 (2026-08) ⚠️ 仅 blog
Qwen 改了什么:继承 Newton-Schulz 正交化内核与 Moonlight 的可规模化前提;改的是参数划分策略、融合矩阵的处理方式、warmup 策略;没改迭代正交化本身。
⚠️ 引用纪律:QSA、Qwen 版 PLE、Qwen 版 Gated Residual、Qwen 的 Muon 改动,四者均无独立论文,仅见于官方 blog 与 tech report。引用时不可当作已发表方法。
4. 隐藏维度 2560:被所有人忽略的那个数字
上面这条是「要存下来的家当」,下面这条是「每个 token 真正要算的量」。两者之比 30:1,正是 Qwen 这次的赌注所在。
这是全篇最重要、也最少被讨论的一点。
Qwen3.8-Flash-Next 的隐藏维度只有 2560。对比一下:DeepSeek 系 7168、Kimi K3 7168、MiniMax M3 6144、GLM-5.2 6144。Qwen 只有人家的三分之一强。
再看专家中间维:640。这个数字更小得离谱。
于是:
模型隐藏维专家中间维单专家参数量(估算)
Qwen3.8-Flash-Next2560640≈ 4.9M
Qwen3-Next-80B2048512≈ 3.1M
DeepSeek V4-Flash7168(未确认)2048≈ 44M
Kimi K371683072≈ 66M
MiniMax M361443072≈ 56M
Qwen 的单个专家只有 DeepSeek 的 1/9、Kimi K3 的 1/13。
它不靠「几个大专家」,它靠「一堆极小专家」——512 个 4.9M 的小专家 × 48 层 ≈ 120B。主干那 125B 里,绝大部分就是这张专家表本身。 再加 51B 的查表,125B 主干 + 51B 查表里几乎找不到多少「每 token 真正在算」的参数。
这便是设计哲学的落点:窄通道 + 巨大存储。
隐藏维 2560 决定了残差流的信息带宽极窄。而 Gated Residual 把残差流扩到 4 分支、bottleneck rank 320(正好是 2560 / 8),本质上就是在补这条窄通道的带宽。
把容量从「计算」搬到「存储」 —— 这十个字,是对这套架构最精准的概括:
算的部分(6B 激活) 负责即时推理
存的部分(174B) 负责选中的知识与专家
查表那 51B 干脆连显存都不占
5. 竞品横评:6B 激活对上 104B 激活
5.1 架构矩阵(截至 2026-09-02)
模型发布总参/激活稀疏比隐藏维注意力MoE连接创新记忆增强优化器定价(入/出,$/1M)
Qwen3.8-Flash-Next2026-08-26180B/6B30×256036 GDN + 12 QSA (3:1)512 专家 top-10+1, inter 640GR 4 分支51B N-gramMuon+AdamW0.15 / 0.47
DeepSeek-V4-Flash-07312026-07-31284B/13B21.8×未公开CSA + HCA(无线性层)256+1, top-6, inter 2048mHC无 EngramMuon0.14 / 0.28
DeepSeek-V4-Pro2026 上半年1.6T/49B32.7×未公开CSA + HCA384 专家 top-6mHC无Muon0.435 / 0.87
Kimi K32026-07-272.78T/104.2B26.7×716869 KDA + 24 Gated MLA (3:1)896+2, top-16, inter 3072AttnRes无Per-Head Muon3.00 / 15.00
MiniMax-M32026-06~428B/~23B~18.6×6144弃线性:3 全注意力 + 57 MSA 稀疏128+1, top-4, inter 3072标准无—0.60 / 2.40
GLM-5.22026-06744B/40B18.6×6144DSA 系 + IndexShare256+1, top-8标准无—1.40 / 4.40
Nemotron 3 Ultra2026-06-04550B/55B10×—Mamba-2 + Attention 混合LatentMoE标准无——
Gemma 4 26B-A4B2026-04-0225.2B/3.8B6.6×—5:1 滑动窗:全局128+1, top-8, inter 704标准Per-Layer Embeddings——
5.2 激活预算:真正的胜负手
稀疏比(18×–33×)各家挤成一团,已不是差异化维度。真正拉开差距的是激活预算的绝对量级:Qwen 用 6B 打出了接近 104B 的水平。
稀疏比本身正在趋同(18–33× 挤成一团),它已不再是差异化维度。真正拉开差距的,是激活预算的绝对量级。
模型激活(B)相对 Qwen 的倍数
Qwen3.8-Flash-Next61.0×
DeepSeek-V4-Flash132.2×
MiniMax-M3~233.8×
GLM-5.2406.7×
DeepSeek-V4-Pro498.2×
Nemotron 3 Ultra559.2×
Kimi K3104.217.4×
5.3 第三方评测
Artificial Analysis Intelligence Index(v4.1 / v4.1.1,2026-08):
模型AA Index
Claude Opus 5 (max)61
GPT-5.6 Sol (max)59
Kimi K3(开源第一)57
Qwen3.8-Flash-Next56
GLM-5.2 / GLM-5.3-Flash51 / 57
DeepSeek-V4-Flash-073150–52
DeepSeek-V4-Pro44
这是全篇最有冲击力的一张表:6B 激活的 Qwen3.8-Flash-Next(56)比 104B 激活的 Kimi K3(57)只低 1 分,比 13B 激活的 V4-Flash(50)高 6 分。
5.4 它输掉的三项,暴露了架构的形状
官方自己列出的失分项:
NL2Repo-Bench 48.1(DeepSeek-V4-Flash 54.2 胜)
Agents' Last Exam Pass@1 24.3(DeepSeek 25.2 胜)
HLE 35.9(Claude-Opus-4.6 40.0 胜)
Base model 对比中,MMLU、MMLU-Redux、GPQA、MATH、MultiPL-E 五输给 Qwen3.7-Plus-Base(397B)
这三项的共性是什么?需要跨极长上下文做逐字保真的一致性生成,或需要长尾冷知识。
而 Qwen 赢的,是检索型、工具型、短程精确型任务(Toolathlon +22.9、CoWorkBench 73.9 vs Claude 68.2、JobBench 55.7 vs DeepSeek 41.3)。
这个失分结构,与「75% 的层是有损压缩状态」的结构性代价高度吻合。 固定大小状态擅长「记住大意」,不擅长「精确回溯 200K 之前那段需求文档的原文措辞」。这不是后训练能补的——是架构的形状。
6. 路线之争:正在打的五场仗
战场一:全注意力 vs 线性 vs 混合
各家真实混合比:
7:1:MiniMax-M1、Jamba
5:1:Gemma 4(滑动窗:全局)
3.8:1:Nemotron 3 Nano
3:1:Qwen3.8-Flash-Next、Kimi K3
完全弃线性:DeepSeek V3.2/V4、MiniMax-M3、GLM-5.2
注意:Qwen 的 3:1 确实是「用了线性注意力」这一谱系里注意力占比最高的一档,但不是全行业最稳健端。真正稳健的一派(DeepSeek / MiniMax-M3 / 智谱)压根没上有损线性层。
MiniMax 走过完整的一个来回,这是 Qwen 3:1 最重要的反证材料:M1 用 7:1 线性 → M2 全回退到全注意力(官方理由:高效注意力尚未 production-ready,评测在小规模看齐、放大后多跳推理露馅,且对低精度/前缀缓存/投机解码不友好)→ M3 换成稀疏注意力而非线性注意力。
战场二:稀疏化 vs 线性化
Qwen GDN(线性)DeepSeek DSA/CSA(稀疏)
手段历史压缩进固定大小循环状态,KV 不增长保真 KV,用可学索引器挑出该看的
代价有损压缩,超长序列逐字保真必然下降可能漏检;KV 存储不减,只减计算与带宽
Qwen 不是单纯「赌 75% 压缩 + 25% 精确保留」。它做的是双层稀疏叠加:层间用 GDN 把 KV 彻底消灭(省内存),剩下的 1/4 层再用 QSA 把注意力从 O(L²) 降到 O(L·k)(省计算)。
差别在于:Qwen 的 75% 层是「信息已被重写过」的状态,DeepSeek 的 CSA 是「信息被压缩但仍可寻址」的 KV。前者便宜,后者可回溯。
战场三:参数-计算解耦
Engram 论文提出的 U 型律:约 20%–25% 的稀疏参数分给记忆时 loss 最低。
Qwen 的配比:总稀疏参数 ≈ 180 − 6 = 174B;N-gram 51B → 占比 29.3%。
Qwen 略微超出最优区间上沿约 4–9 个百分点。 但要注意两点:
Engram 的 U 型律在 5.7B / 9.9B 规模、固定 9× 稀疏比下拟合,外推到 180B / 30× 未见验证。
Qwen 技术报告自己承认了这个现象:「扩大 n-gram 词表让 loss 单调下降,但下游准确率饱和、部分项目来回波动」;「固定总参数预算从 MoE 专家挪给 n-gram 时,最低 loss 的配置不是下游表现最好的配置」。
判断:Qwen 是「贴着饱和点上沿配」,不是「激进冒险」。它追求的不是 loss 最优,是 bench 不回落前提下的最大查表。
战场四:记忆/查表增强会成为标准件吗?
方向成立:DeepSeek Engram(2026-01,论文+开源)、Qwen N-gram Embedding(2026-08,量产)、Gemma 3n/4 的 PLE、Over-Tokenized Transformer 一脉。三个独立大厂 + 学术界同时押注。
但反证同样硬:DeepSeek 自己在 V4 里没上 Engram。
判断:查表增强会像 MoE 一样,先经历「论文火热 → 一家落地 → 观望 → 普及」的两代周期。它大概率是 Qwen4 / V5 的标准件,但不是 2026 年的行业标配。
战场五:窄而深 vs 宽而浅
见第 4 节。这一场 Qwen 是孤家寡人——没有第二家把隐藏维压到 2560 这个量级。
7. 打假时间:五条流传说法的真相
❌ 说法一:「不量化可在单张 RTX 4090 上运行」
判定:核心事实成立,但「不量化」三字是纯捏造。
溯源:原始出处是 X 用户 @analogalok(2026-08-27)的帖子:
"The VRAM barrier is officially dead... 250,000 context window on a single 24GB RTX 4090. 21 tok/s decode, 364 t/s prefill. no mtp. no dflash. no kv cache quantization!"
他的启动命令是:
llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 250000 -cmoe
真相:他跑的是 Unsloth UD-Q4_K_XL(111.4GB 四分片),且用 -cmoe 把 512 个专家全部卸载进 110GB DDR4 系统内存,只留注意力在 4090 上(11.66–18.3GB VRAM)。「no mtp / no dflash / no kv cache quantization」的意思是「在 Q4 量化基础上没再加加速手段」。
中文链(量子位 → 搜狐 → 51dns.com)层层放大,把「没再加额外加速」读成了「无需量化」。量子位原文明明写着「虽然之前发布的密集模型 Qwen3.8-27B 在消费硬件上体验更好」。
真实门槛:24GB VRAM + 110GB 系统内存 + PCIe 带宽,且仅单并发。
「能跑起来」和「能用」是两回事:
配置实测
4090 + 110GB DDR4,UD-Q4_K_XL,250K ctx21 tok/s
ThinkStation P520(Xeon W-2145 + 256GB DDR4 + 12GB 3060)12–15 tps @ 65K,内存争用下崩到 3–5 tps
16GB M4,176B MLX-oQ4约 1.9 tok/s
双 3090 + 128GB DDR5,UD-Q6_K_XL14.3 tok/s
双 4090(中文博主「鲁工」实测)21.3 tok/s,预填 815 t/s
门槛不是被消灭,是被从显存挪到了内存条和 PCIe 带宽上。
⚠️ 说法二:「训练成本只有 1/9」
判定:官方诚实,媒体误读。
技术报告原文(28 页):
"...leads the 397B-A17B predecessor on eight and trails it on the rest by at most 2.6 points, at 1/3 the activated parameters, 1/3 the training tokens, and roughly 1/9 the training FLOPs"
算术很清楚:训练 FLOPs ≈ 6 × N_activated × D。6B / 17B ≈ 0.35,× 训练 token 的 1/3 ≈ 0.117 ≈ 1/9。
这个 1/9 在算术上几乎 100% 来自「模型更小 + 数据更少」。
架构创新(QSA / GR / Muon)的真实贡献是另一个:让 1/3 激活的模型,在 14 项预训练基准上还能 8 胜 6 负(最大差距 MultiPL-E −2.59)。
补充两点:
比较对象错位:Qwen3.7-Flash(同档前代)API 价 0.03/0.12,而 Qwen3.8-Flash 是 0.15/0.47。「成本降到 1/9」与「比上代同档贵 4 倍」同时为真。
「6B 激活」略有低估:隐藏维 2560 × 词表 248320,embed + lm_head ≈ 1.27B 是每 token 稠密计算、通常不计入「6B 激活」。真实稠密量约 7.3B,对 17B 是 43% 而非 35%,「1/9」因此略微乐观。
⚠️ 说法三:「180B 总参」是否误导
判定:双向成立。
站得住的一面:N-gram 表占 BF16 checkpoint 的 95.4 GiB,磁盘/内存账单是真的,所有量化体积(4-bit 111.3GB)都含它。
存疑的一面:它不参与每 token 的 FLOPs。
最硬的反证来自 Qwen 报告自己——官方自曝:扩大 n-gram 词表,loss 单调下降,但下游准确率饱和。「这是官方自曝,比任何外部质疑都硬。」
反向公允证据:社区实测 51B 表跨 token 复用率 0%、自调节到近零常驻,NVMe mmap 后 decode 仅掉约 4%(15.3 vs 16.0 t/s)。它确实便宜,但便宜在存储层级,不是免费。
⚠️ 说法四:官方 benchmark 是否主场作战
判定:无法证明操纵,但足以要求第三方复现。
基线仅 Qwen3.8-27B / Qwen3.7-Plus / DeepSeek-V4-Flash-0731 / Claude-Opus-4.6(Max),完全缺席 Kimi K3、GLM-5.3、MiniMax-M3、腾讯 Hy4-preview。且 CoWorkBench、JobBench、RecreationBench、ClawEval-MM 均为阿里内部评测集。
模式清晰得可疑:内部集上碾压,公开集上险胜或落败。
内部集:JobBench 55.7 vs DeepSeek 41.3 vs Claude 36.6(+14~19)、CoWorkBench 73.9 vs DeepSeek 45.1(+28.8)
公开集:SWE-bench Pro +6.5、LiveCodeBench v6 +1.3、GPQA Diamond +0.9
✅ 说法五:「超越同规模及更大参数量竞品」
判定:定性成立,但「全面超越」已被官方自己否掉。
官方自列失分至少 9 项(NL2Repo-Bench、Agents' Last Exam Pass@1、HLE、OSWorld 2.0 binary 与 27B 打平、Base 对比 8 胜 6 负)。
公允表述:在 Agent / 工具调用 / 长程办公这条线上结构性领先;在深推理、仓库级代码合成、计算机操作上不是。
另注:官方表中 Claude 在 DeepSWE 1.1、Toolathlon 上为「—」(未出分),缺席项不算赢。
8. Engram 公案:提出者缺席,跟进者落地
这是本次调研最有戏剧张力的一条线索。
时间线:
2026-01-12:DeepSeek 联合北大放出《Conditional Memory via Scalable Lookup》(arXiv 2601.07372),一作 Cheng Xin(北大博士),末位作者梁文锋。核心实验得出 U 形曲线:约 20%–25% 稀疏参数分给 Engram 时 loss 最低。Engram-27B 对比 MoE-27B:MMLU +3.4、CMMLU +4.0、BBH +5.0、HumanEval +3.0、MATH +2.4、Multi-Query NIAH 84.2 → 97.0。论文结论原话:「我们认为条件记忆将是下一代稀疏模型不可或缺的建模原语」。
2026-04-24:DeepSeek V4 发布。报告有 mHC、CSA、HCA、Muon、FP4,没有 Engram。V4 发布后社区第一件事是 Ctrl+F 搜 Engram,搜不到。「没有 Engram,V4 就是不完整的」成为热评。
V4 论文自己的间接解释:「为了追求极致的长文效率,V4 系列采取了一个相对激进的架构设计。为了降低风险,我们保留了许多已经验证过的组件和 trick,这让架构变得相对复杂。在未来的迭代中,我们将进行更全面、更有原则的研究,把架构精简到最本质的部分。」
量子位(2026-05)报道:V4 论文「未来方向」中点名了探索新维度 sparsity 这条线(即 Engram),留给 V5。
社区三个月接力:
北大 + 阿里云 + 人大等《Pooling Engram Conditional Memory using CXL》(arXiv 2603.10087)——8 台服务器共享 4TB CXL 内存池,端到端吞吐损失 <5%
Tao Lin 单作者《A Collision-Free Hot-Tier Extension》(arXiv 2601.16531)——证伪了「用完美哈希消除冲突会更好」这个直觉优化
AutoArk 团队 Tiny Engram 把 Engram 搬到 Stable Diffusion
而 deepseek-ai/Engram 仓库最后一次提交停在 1 月 14 日。
判定:
「DeepSeek 放弃 Engram」→ 不成立。官方口径是「留给下一代」,论文摘要明确称其为「不可或缺的建模原语」。
「提出者缺席、跟进者落地」→ 成立。发明者仓库停更 5 个月,社区独立完成了工程落地(CXL)、方向证伪(完美哈希)、跨界扩展(视觉)三步;而第一个把它放进生产级旗舰开源权重的是 Qwen,不是 DeepSeek。
公允补充:Qwen 是明确致谢的——官方 blog 写「Inspired by Per-Layer Embedding in Gemma 3n and works such as DeepSeek Engram」,技术报告引用了 Engram 论文。这是正常的技术继承,不是抢功。
证据缺口:未找到 DeepSeek / 梁文锋方面关于「为什么 V4 没上 Engram」的直接公开说法。V4 论文只有上述那段间接表述。
9. 工程落地:能跑吗?怎么跑?
9.1 SGLang 的三板斧
QSA 的 KV Cache 管理:SGLang 只在全注意力层挂 indexer,复用 MRoPE 实现;原始 K/V 留在正常 paged pool;QSA 每 4 个 token 多存一个 BF16 compressed index key,未完成 block 的原始 key 存在 per-request 的 4 槽环形缓冲里。这让 QSA 的 index-cache 开销降低 80%,且页对齐的 full_slot / 4 寻址让压缩缓存能直接跟随 Radix Cache 的所有权,无需独立生命周期。
IndexShare MTP:投机解码下,一个 MTP iteration 要调用 N 次 indexer(N−1 次 draft decode + 1 次 draft-extend),而 indexer 才是长上下文下的主要成本。SGLang 的做法是:draft-extend 那一步反正要跑 indexer,就把它的选择结果冻住,整个 draft 循环复用它。draft 的 indexer 工作量从 N 次降到 1 次,accept length 不变。
HyperConnection kernel 优化(与 NVIDIA 合作,经 FlashInfer 发布):
Mix:B300 上 M=4 时,split-K CuTe GEMM 把延迟从 12.36 降至 6.03 µs(2.05×),端到端 +7.6%
Combine:M=4 时,split 路径从 4.17 降至 2.13 µs(1.96×),端到端 +5.49%
大 M 时,融合 kernel 比 cuBLAS 基线快 2.54×,有效带宽 6144 GB/s
9.2 真实部署门槛
SGLang 官方实测:B200 TP4,NVFP4 checkpoint,batch size 1 + MTP,解码 540 tok/s,accept length 3.3(含 bonus token)。
NVIDIA 官方(GB300 NVL72):>16,000 tok/s per GPU,>200 tok/s per user。
最低门槛(社区实测):
精度显存需求备注
BF16 全量~360 GB8×H200 起
FP8~180 GB官方 FP8 checkpoint,8×H200 需用 TEP8 而非 TP8
NVFP4~90 GBDay-0 释出
UD-Q4_K_XL111.4 GB(+110GB 内存卸载专家)单卡 4090 + -cmoe
9.3 Day-0 的坑:广度是营销数字,可用性是另一回事
FP8 checkpoint 第一天是坏的:HF discussions 报告,quantization_config.modules_to_not_convert 用的路径是 model.language_model.layers...,但经 AutoModelForCausalLM 加载时模块名是 model.layers...,排除模式全部不匹配——本应保 BF16 的模块(ple.key_proj/value_proj、hyper-connection mixers、linear_attn.conv1d/in_proj_*)被静默量化成 FP8 且无 scale。不报错,只是数值静默劣化。 另有 FP8 N-gram 表的 per-tensor weight_scale 被 transformers 当 unexpected key 丢掉的问题。
llama.cpp 需走 PR #27742(8/27 合入主线为 qwen4exp 架构)
SGLang 支持未合入 release,需走 PR #36497 或 day-0 镜像;--max-running-requests 默认回落 48 而官方配方要 96
vLLM 有 GDN Packed Decode 路径的精度缺陷(beta 从 FP32 舍入回 BF16,长序列循环状态误差累积,PR #53877)
A100 上加载官方 FP8 有失败报告;GB10 上 TP1 warm-up 死锁
NVIDIA 论坛多页爆帖:JW2026 报「模型会随机开始生成乱码」(后称有 correctness patch);helge 在 DGX Spark 上「262K 参数能起,但真用到 ~128K 就 OOM 冻结」
💡 唯一真实的软锁定点:SGLang 官方文档所述「N-gram offload 目前仅 NVIDIA 设备可用」。但权重是 BF16 开源、国产芯片 day-0 就跟上了、llama.cpp/MLX 走完全非 NVIDIA 路径——这是 NVIDIA 与 Qwen 的双赢联合营销,不是依附。
9.4 生态响应的真正意义
国产侧:众智 FlagOS 社区 day-0 完成 10 家芯片适配(平头哥、摩尔线程、昇腾、沐曦、昆仑芯、海光、天数智芯、清微智能、曦望等),新增 8 个 Triton 融合算子(3 个 Hyper-Connection、3 个 QSA、2 个 PLE gather/scatter)并提交 vLLM 上游 PR #53909,还发现并修复了 vLLM 上游一个精度缺陷。
这比模型本身更重要:国产芯片栈能 day-0 跟上全新架构,说明 FlagOS 这类统一抽象层已具备承接能力。
10. 拍板:最终结论
10.1 它赢了什么
能力密度:6B 激活打出 AA Index 56,比 104B 激活的 Kimi K3(57)只差 1 分。这是「单位激活参数的能力密度」的一次跃迁。
成本结构:1M 上下文、90% prefix cache 命中下,prefill 吞吐达 Qwen3.7-Plus 的 8.6×;QSA kernel 在 1M 下 prefill/decode 加速 7.6×/4.9×。
存储层级的工程美学:51B 查表卸载到 host memory,省 23.46 GiB 显存、KV 容量 +78.54%,而吞吐只掉 0.07%,输出逐位一致。这是全篇最漂亮的一手工程。
Agent 场景的真实可用性:日本开发者 tomohisa 在 M4 Max 128GB + UD-Q3_K_XL + OpenCode 上处理真实开源项目已合并的 Issue——两项任务共 190 次工具调用、0 次调用错误,G731 任务首轮约 58 分钟完成从读 Issue 到提交 PR 的全闭环;同任务 Qwen3.8-27B 跑 6.5 小时未提交。
10.2 它输了什么
保真度:75% 的层是有损压缩状态。失分项(NL2Repo、ALE、HLE)的共性是需要跨超长上下文逐字保真或长尾冷知——这是架构的形状,不是后训练能补的。
窄通道的带宽:隐藏维 2560 是全局最窄。Gated Residual 扩到 4 分支正是在补这个短板,但 bottleneck rank 320 意味着补偿有限。
查表的边际收益递减:官方自曝「扩大 n-gram 词表 loss 单调降,但下游准确率饱和」。29.3% 的配比已贴着饱和点上沿。
产品体验:默认 xhigh 推理等级导致输出很长(成本与延迟双升)。有用户报告「生成八卦主题网页等了 19 分 37 秒,再生成钍基熔盐堆 SVG 又等 10 分 02 秒」——一个叫 Flash 的模型经常十几分钟才出普通网页,产品体验不合格。
10.3 Qwen4 会是什么样
推测(非事实):同一套 GDN + QSA + GR + N-gram + Muon 栈,按激活预算而非隐藏维度分档——Flash(~6B 激活,2560 隐藏维)/ Plus(~15–20B)/ Max(~40B+),靠扩大专家池(512 → 更多)、扩大查表(51B → 100B+,走 CXL 内存池化)、加宽 GR 分支数来扩容,隐藏维度大概率仍显著低于 DeepSeek / Kimi 的 7168。
这条路的尽头,是「激活量很小、总参很大、查表极大」的极端形态。
10.4 一句话失败模式
N-gram 查表与 GDN 压缩都是「用存储换计算」。一旦任务需要精确逐字回溯超长上下文,或需要训练语料里没有的长尾新知,51B 的表和固定大小的状态都帮不上忙,而 2560 的窄残差流又不足以在 6B 的激活计算里把丢掉的信息补回来——省下来的算力,买不回被压缩掉的信息。
10.5 给不同读者的行动建议
你是谁建议
Agent 应用开发者值得试。工具调用与长程办公是它的强项。但注意输出价 $0.47 是 Flash 档最贵,且默认 xhigh 输出很长——务必压 reasoning_effort 到 medium。
本地部署玩家除非你有 128GB+ 内存,否则 Qwen3.8-27B 更划算(SWE-bench Pro 62.5 vs 61.7 仅差 0.8,27B 是 BF16 原精度、单卡 24GB 装得下、Apache 2.0)。
架构研究者重点读三处:QSA 的「压缩 key 只作索引」设计、Gated Residual 砍掉 branch mixing 后的稳定性论证、N-gram 占 29.3% 却仍 bench 不回落的经验边界。
企业采购注意 qwen-community-1.0 许可:>1 亿 MAU 或 >20M 月收入需显著展示模型名,MaaS / AI 办公助手类需单独许可。价格上 DeepSeek V4-Flash(0.14/0.28,缓存命中 0.01)更便宜。
观望者等 Qwen4 正式版。这是「Next」,是地基,不是成品。
附录 A:核心论文清单
编号论文名作者/机构arXiv / venue年份一句话贡献
[1]Gated DeltaNetSonglin Yang (MIT CSAIL) + NVIDIAarXiv 2412.06464 / ICLR 20252024gated delta rule + WY/UT chunkwise 并行
[2]DeepSeek-V3.2(含 DSA)DeepSeek-AIarXiv 2512.025562025lightning indexer + token 级 top-k 的 DSA
[3]IndexCache清华 + Z.aiarXiv 2603.122012026跨层复用 DSA 索引,省约 75% indexer 计算
[4]Hyper-ConnectionsByteDance SeedarXiv 2409.19606 / ICLR 20252024可学习 depth/width-connection 替代残差连接
[5]GatedNorm / Outlier-Driven RescalingQwen Team + EdinburgharXiv 2601.229662026统一 attention sink 与 residual sink
[6]Engram / Conditional Memory北大 + DeepSeek-AIarXiv 2601.073722026条件记忆作为新稀疏轴,U 型分配律
[7]MuonKeller Jordan 等博客,无 arXiv2024Newton-Schulz 正交化更新
[7b]Moonlight: Muon is ScalableMoonshot AIarXiv 2502.169822025weight decay + update RMS 对齐,约 2× 效率
[8]Demons in the DetailQwen Team + Edinburgh/StanfordarXiv 2501.118732025全局 batch 粒度负载均衡损失
[9]Gated AttentionQwen TeamarXiv 2505.06708 / NeurIPS 20252025SDPA 后 head-specific sigmoid gate
A1Linear Transformers Are Secretly FWP (DeltaNet)Schlag/Irie/Schmidhuber, IDSIAarXiv 2102.111742021线性注意力等价于快速权重编程器
B1NSADeepSeekarXiv 2502.11089 / ACL 20252025compression + selection + sliding 三分支
B2MoBAMoonshot AI + 清华arXiv 2502.13189 / NeurIPS 20252025MoE 式 block 路由
C1mHCDeepSeek-AIarXiv 2512.248802025双随机矩阵约束 HC,恢复 identity mapping
D1Over-Tokenized TransformerByteDance SeedarXiv 2501.169752025输入/输出词表解耦,Over-Encoding
D2BLTMeta FAIRarXiv 2412.09871 / ACL 20252024byte-level 无 tokenizer
无独立论文、仅见于官方 blog / tech report 的项:QSA、Qwen 版 N-gram Embedding (PLE)、Qwen 版 Gated Residual、Qwen 的 Muon 改动、Muon 原版、MuonClip/QK-Clip、Gemma 3n PLE、Qwen3-Next / Qwen3.8-Flash-Next 本身。
附录 B:一手源清单
官方
Qwen 官方 blog:https://qwen.ai/blog?id=qwen3.8-flash-next
技术报告 PDF:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
HF 模型卡:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
SGLang Day-0 blog:https://lmsys.org/blog/2026-08-26-qwen-flash-next
NVIDIA GB300 NVL72 部署博客:https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-176b-model-on-nvidia-gb300-nvl72-for-agentic-coding/
社区实测
HF FP8 discussions/2(静默劣化 issue):https://huggingface.co/Qwen/Qwen3.8-Flash-Next-FP8/discussions/2
NVIDIA 论坛实测帖:https://forums.developer.nvidia.com/t/qwen3-8-flash-next/381228
peaster.io 双 3090 实测:https://peaster.io/articles/local-LLMs/qwen-3-8-flash-next-first-impressions
Engram 线索
Engram 论文:https://arxiv.org/pdf/2601.07372
CXL 版:https://arxiv.org/pdf/2603.10087
无冲突哈希证伪:https://arxiv.org/pdf/2601.16531
量子位《DeepSeek V4 最大的遗憾》:https://www.qbitai.com/2026/05/412737.html
未核实项(如实标注,勿当事实引用)
DeepSeek V4 / V4-Flash 的隐藏维度、层数、注意力头数——未找到官方数字
「DeepSeek 为何 V4 没上 Engram」的直接公开说法——未找到,仅有 V4 论文的间接表述
MiniMax M3 的 428B/23B——官方从未披露,来自第三方 config 解析
Qwen3.8-Flash-Next 的 AA Index 56 分——来自 AA 页面第三方镜像,未直接访问 artificialanalysis.ai;且为 v4.1.1,与其他模型 v4.1 分数不完全同口径
单专家参数量(4.9M / 44M / 66M / 56M)——由「3 矩阵 × inter × hidden」估算,未含卷积、门控、归一化等小项
Kimi K3 / GLM-5.3 / MiniMax-M3 与 Flash-Next 的同条件第三方横向评测——未找到
B站 / V2EX / 掘金 的实质讨论——本轮检索未找到
标题含「Qwen4 前瞻」的券商研报原文——未找到(发布仅一周,暂无专项研判)
本报告由六路探马分头侦察、圆桌质证后整合拍板。所有数字均标注来源,未核实项已如实标注。成文于 2026 年 9 月 2 日。
本报告由六路探马分头侦察、圆桌互相质证后整合拍板。所有关键数字均标注来源,未能核实者已单列于文末。
一手源:Qwen 官方 blog · 技术报告 PDF · HuggingFace 权重卡 · LMSYS SGLang Day-0 blog · NVIDIA GB300 部署博客。