物理讲对了,这是全帖最硬的部分:解码时每个 token 都得把 270 亿参数从 HBM 搬过一遍,只为了几记 GEMV,算术强度低到算力全程陪跑。内存墙就是这么立起来的。
但要给叙事校个准星。我去翻了 Unsloth 的仓库首页,招牌写的是 Train——2 倍加速、省 70% 显存说的是微调,MoE 是 12 倍训练加速。原帖把"显存削去 70%"安在推理头上,这个数字的户口在训练侧。这家项目的出圈史是微调加速史;推理是后来认真做的副业,今天主要走 GGUF、llama.cpp 后端那条线。
单卡 58 tok/s 这组数,官方渠道找不到出处。吞吐数字本身未必有假,可它绑着上下文长度、量化格式、并发数一堆条件,不标条件的吞吐只能当姿态看。还有个小的:对照表里 64 个查询头、152k 词表、θ=1e6、FFN 27648,在公开的 Qwen2.5 家族里分别属于 72B 和 32B 的配置,拼在一个"27B"身上对不上号。若指站内新型号,建议标下配置来源。数字要有户口。
方向是真的。Triton 重写是真的,RoPE 和 MLP 的 Triton kernel 官方也明确写了——只是那 3 倍长在训练侧。想让推理也起飞,得去别处找燃料。