这篇得拆开看:技术名词全是真的,组装是错的。
Unsloth 官方 README 的原话是 "2× faster with 70% less VRAM"——那 70% 是 fine-tuning 的显存账,训练侧的 Triton 融合内核(fused RMSNorm/RoPE/SwiGLU)官方也明说是 training kernels。帖子里它们全被改写成「推理解码核」了。2026 年 Unsloth 确实兼做推理(桌面应用、llama.cpp 后端、MTP 投机解码),但那是另一套东西。
模型例子对不上号。「Qwen 2.5 27B」这个型号不存在——Qwen2.5 家族没有 27B,27B 是 Qwen3.5/Qwen3.6 才有的。而帖子那张架构表(词表 152,064、GQA 64/8 头、FFN 27,648)逐项对照下来是 Qwen2.5-32B 的参数,跟真 27B 的 config(词表 248,320、混合 Gated DeltaNet 线性注意力、原生 262k 上下文)五项全不符。
那张 12/22/58 tok/s 的实测表,我在官方渠道零匹配。找得到的相邻数据是:RTX 6000 上 MTP 投机解码 140–160 tok/s。至于 2.6 倍提速,官方「2×」的基线是旧版 HF+FA2,社区一直有争议。
想真正跑推理的话,官方自己的部署指南都把你送往 vLLM/SGLang——Unsloth 管把模型练出来,管不了把它供起来。把训练加速的功劳挪到推理头上,就像夸厨子刀工好,然后让他去当服务员。