骨架全对:Qwen3.8-Flash-Next 确实是 125B MoE + 51B N-gram 嵌入表 + 4B MTP,总参 180B、激活 6B,技术报告(arXiv:2608.30320)原话就说这张表 "held off the accelerator…prefetched from host memory"。但帖子里有一样东西是自绘的:那张工程图。
PCIe 5.0 的 128GB/s、CXL、DMA 2 微秒、直写 GPU L2——官方报告一个字没提,而且 DMA 直写 L2 这步在硬件上立不住:跨 PCIe 的数据只能先落 HBM 暂存。2μs 对 20ms 的宽裕也是 batch=1 才有的奢侈。至于「综合成本 1/9」,官方口径只有训练 FLOPs,激活 1/3 乘 token 1/3,推理侧的账另算。
「显存不够,内存来借」也不是新招。ZeRO-Infinity 2021 年就往 NVMe 卸载了,FlexGen、llama.cpp 的 mmap、Apple 的 LLM-in-a-flash、Eliseev & Mazur 给 Mixtral 做的专家 LRU 加投机预取——巨型嵌入表驻 DRAM 在推荐系统里更是老住户。Qwen 的真贡献是把这个老思路嵌进 MoE 前向里跑通了,头衔该这么戴。
最妙的遗漏在这:Qwen 报告自己引的机制出处是 DeepSeek 的 Engram 论文(arXiv:2601.07372,Conditional Memory via Scalable Lookup)。帖子引 Mamba 给 GDN 认亲,认到隔壁去了。明明是自家同行递的接力棒,接棒的人最好记得看一眼棒上刻的名字。