Saluki 27B 拆解:7.9GB 的 27B、外挂的视觉,和标题里那个 262K
国内教程圈 10 月 8 日热传一篇部署文:一个叫 Saluki 27B 的模型,号称把 Qwen3.8-27B「压缩 7 倍」到 7.9GB,还带「多模态」「262K 上下文」,16GB 显卡就能跑 agent 工具调用,网盘直链伺候。三个卖点,我逐个验了一遍。先说结论:压缩是真的,多模态要打引号,262K 是底座…
Saluki 27B 拆解:7.9GB 的 27B、外挂的视觉,和标题里那个 262K
国内教程圈 10 月 8 日热传一篇部署文:一个叫 Saluki 27B 的模型,号称把 Qwen3.8-27B「压缩 7 倍」到 7.9GB,还带「多模态」「262K 上下文」,16GB 显卡就能跑 agent 工具调用,网盘直链伺候。三个卖点,我逐个验了一遍。先说结论:压缩是真的,多模态要打引号,262K 是底座的纸面参数——而这款模型真正值得说的东西,教程标题一个字没提。
先把身世捋清。Saluki 不是从零训练的模型,它是一条三层流水线的末端。最上游是 Qwen 官方的 Qwen3.8-27B:54GB 的 fp16 权重,架构上自带三样东西——一个 SigLIP 风格的视觉塔、一个多头预测(MTP)投机解码头、还有一套混合注意力(64 层里只有 16 层是传统全注意力,其余 48 层是线性注意力)。第二层是 ISTA-DASLab 的量化版:这是 Dan Alistarh 组,当年 GPTQ 就出自这里,他们用自家的 GSQ-RCO 方法给 Qwen3.8-27B 出了一套非均匀量化 GGUF——每个张量按敏感度分配精度,而不是一刀切。这套上游在 HF 上有 149 万下载。第三层才是 Saluki:HF 上的 ConwayResearch(一家叫 Conway 的公司,端侧模型产品线全用狗命名——Woof、Bark、Husky、Saluki)在 10 月 8 日凌晨挂出的 IQ2-mix 极限档,2-bit 量化,7.89GB,Apache 2.0,链条干净。
所以「压缩 7 倍」的真身是量化:54 除以 7.89 等于 6.84,约等于 7。这没什么魔法,2-bit 量化本来就是这个压缩率,真正的技术含量在精度分配和量化后的调校——但教程标题把它写成了模型本身的特性,读者会以为这是个新架构。
「多模态」的口径要打引号。Saluki 的 model card 写得很明白:「主文件只含文本;需要图片时另加 0.6 到 0.9 GB 的视觉文件」。视觉能力是底座 Qwen3.8 继承来的,以 mmproj 外挂文件的形式存在,要额外下载、启动时单独挂载。而那篇教程从头到尾只给了主模型的网盘包,没有一步提到视觉文件——照着教程装出来的环境,跑不了图片理解。这和之前 FrogNano 的案例是同一个剧本:底座继承的能力出现在产物里,教程标题就把它当成了模型的卖点。
「262K 上下文」是三件套里最虚的一个。262144 确实是个真实数字,但它写在 Qwen3.8-27B 底座的 config 里,是纸面的 max_position_embeddings——量化权重不改变这个数,也不为此负责。要紧的是跑不跑得动:得益于混合架构,只有 16 层全注意力需要存传统 KV 缓存,262K 上下文的 KV 大约 16 GiB(fp16),加上 7.9GB 的模型本体,远超 16GB 显卡。教程自己的启动命令写的是 -c 32768——32K 上下文,KV 只要 2 GiB,这才是一张 4080 SUPER 的真实世界。纸面参数和部署现实之间隔着一张显卡的大小。
那 Saluki 真正的卖点是什么?工具调用没被量化压垮,甚至反超了。model card 里自建的 Underdog Bench(从 Berkeley Function Calling Leaderboard 冻结了 120 个任务)上,Saluki 得 88 分,全尺寸 Qwen3.8-27B 得 84 分;并行工具调用 42 比 35。2-bit 量化版在 agent 核心能力上反超原模型 4 分,这是这个赛道里少见的「量化税变负数」。代价也印在同一张表上:竞赛数学只剩原模型的 82 到 85%(AIME 2025 是 79.2 对 96.7),SWE-bench 30 对 33,MuSR 67.5 对 79.6——平均下来九个基准保持 96%。
这份 model card 的诚实度值得单独一提:任务集在测任何模型之前冻结,自建分数和公开榜分数用不同 harness 这件事明说了,「120 个任务是适度的测试,几分差距可能是跑与跑之间的波动」这种自认小样本的话也写了。瑕疵是两处模糊:88 比 84 是怎么做到的——量化策略、校准数据还是量化后修复——一个字没提;而「在自家 benchmark 上赢对手 18 分」的对手 Bonsai 2,是这个赛道真正的霸主。prism-ml 的 Ternary-Bonsai-2-27B 累计下载 439 万次,是 Saluki 两天下载量(1.5 万)的 287 倍。挑战者用自己出的卷子考赢了 incumbent,冻结声明让这事值得认真对待,但 harness 没开源之前,可复制性有限。
还有两个小注脚。一是改名经济学:Conway 在 9 月 30 日就发过 Underdog-27B-1.0,315 次下载,无人问津;10 月 4 日迭代 1.1 版,依旧冷清;换上狗名 Saluki、写上「Qwen3.8 压缩 7 倍」的定位之后,两天 1.5 万下载、144 赞。模型还是那个赛道的模型,名字换了,命运就换了。二是生态速度:Qwen3.8 自带的 MTP 头被社区当天转出投机解码版(Kujira 的 MTP-GGUF,上千下载),Conway 自己一周内也发起了 underdog-llama-server 运行时分发——从发模型到发运行时,这个团队在往全栈走。
至于夸克和迅雷的网盘直链,那不是 Saluki 的功劳,是国内访问 Hugging Face 的环境催生的搬运基建——教程的 183 次阅读和 HF 上两天的 1.5 万下载,说明绝大部分用户本来就走 HF,教程只是给不走 HF 的人留了条路。
留给读者一对数字:88 比 84,7.89 对 54。前一对是 2-bit 量化在工具调用上反超全尺寸的分数,后一对是压缩 6.84 倍的体积账。要不要为一对反超的分数接受数学掉 15 个点,取决于你的 agent 要不要做数学题——这个判断,model card 比教程标题诚实得多。