Saluki 27B 拆解:7.9GB 的 27B、外挂的视觉,和标题里那个 262K

国内教程圈 10 月 8 日热传一篇部署文:一个叫 Saluki 27B 的模型,号称把 Qwen3.8-27B「压缩 7 倍」到 7.9GB,还带「多模态」「262K 上下文」,16GB 显卡就能跑 agent 工具调用,网盘直链伺候。三个卖点,我逐个验了一遍。先说结论:压缩是真的,多模态要打引号,262K 是底座…

Saluki 27B 拆解:7.9GB 的 27B、外挂的视觉,和标题里那个 262K

国内教程圈 10 月 8 日热传一篇部署文:一个叫 Saluki 27B 的模型,号称把 Qwen3.8-27B「压缩 7 倍」到 7.9GB,还带「多模态」「262K 上下文」,16GB 显卡就能跑 agent 工具调用,网盘直链伺候。三个卖点,我逐个验了一遍。先说结论:压缩是真的,多模态要打引号,262K 是底座的纸面参数——而这款模型真正值得说的东西,教程标题一个字没提。

先把身世捋清。Saluki 不是从零训练的模型,它是一条三层流水线的末端。最上游是 Qwen 官方的 Qwen3.8-27B:54GB 的 fp16 权重,架构上自带三样东西——一个 SigLIP 风格的视觉塔、一个多头预测(MTP)投机解码头、还有一套混合注意力(64 层里只有 16 层是传统全注意力,其余 48 层是线性注意力)。第二层是 ISTA-DASLab 的量化版:这是 Dan Alistarh 组,当年 GPTQ 就出自这里,他们用自家的 GSQ-RCO 方法给 Qwen3.8-27B 出了一套非均匀量化 GGUF——每个张量按敏感度分配精度,而不是一刀切。这套上游在 HF 上有 149 万下载。第三层才是 Saluki:HF 上的 ConwayResearch(一家叫 Conway 的公司,端侧模型产品线全用狗命名——Woof、Bark、Husky、Saluki)在 10 月 8 日凌晨挂出的 IQ2-mix 极限档,2-bit 量化,7.89GB,Apache 2.0,链条干净。

所以「压缩 7 倍」的真身是量化:54 除以 7.89 等于 6.84,约等于 7。这没什么魔法,2-bit 量化本来就是这个压缩率,真正的技术含量在精度分配和量化后的调校——但教程标题把它写成了模型本身的特性,读者会以为这是个新架构。

「多模态」的口径要打引号。Saluki 的 model card 写得很明白:「主文件只含文本;需要图片时另加 0.6 到 0.9 GB 的视觉文件」。视觉能力是底座 Qwen3.8 继承来的,以 mmproj 外挂文件的形式存在,要额外下载、启动时单独挂载。而那篇教程从头到尾只给了主模型的网盘包,没有一步提到视觉文件——照着教程装出来的环境,跑不了图片理解。这和之前 FrogNano 的案例是同一个剧本:底座继承的能力出现在产物里,教程标题就把它当成了模型的卖点。

「262K 上下文」是三件套里最虚的一个。262144 确实是个真实数字,但它写在 Qwen3.8-27B 底座的 config 里,是纸面的 max_position_embeddings——量化权重不改变这个数,也不为此负责。要紧的是跑不跑得动:得益于混合架构,只有 16 层全注意力需要存传统 KV 缓存,262K 上下文的 KV 大约 16 GiB(fp16),加上 7.9GB 的模型本体,远超 16GB 显卡。教程自己的启动命令写的是 -c 32768——32K 上下文,KV 只要 2 GiB,这才是一张 4080 SUPER 的真实世界。纸面参数和部署现实之间隔着一张显卡的大小。

那 Saluki 真正的卖点是什么?工具调用没被量化压垮,甚至反超了。model card 里自建的 Underdog Bench(从 Berkeley Function Calling Leaderboard 冻结了 120 个任务)上,Saluki 得 88 分,全尺寸 Qwen3.8-27B 得 84 分;并行工具调用 42 比 35。2-bit 量化版在 agent 核心能力上反超原模型 4 分,这是这个赛道里少见的「量化税变负数」。代价也印在同一张表上:竞赛数学只剩原模型的 82 到 85%(AIME 2025 是 79.2 对 96.7),SWE-bench 30 对 33,MuSR 67.5 对 79.6——平均下来九个基准保持 96%。

这份 model card 的诚实度值得单独一提:任务集在测任何模型之前冻结,自建分数和公开榜分数用不同 harness 这件事明说了,「120 个任务是适度的测试,几分差距可能是跑与跑之间的波动」这种自认小样本的话也写了。瑕疵是两处模糊:88 比 84 是怎么做到的——量化策略、校准数据还是量化后修复——一个字没提;而「在自家 benchmark 上赢对手 18 分」的对手 Bonsai 2,是这个赛道真正的霸主。prism-ml 的 Ternary-Bonsai-2-27B 累计下载 439 万次,是 Saluki 两天下载量(1.5 万)的 287 倍。挑战者用自己出的卷子考赢了 incumbent,冻结声明让这事值得认真对待,但 harness 没开源之前,可复制性有限。

还有两个小注脚。一是改名经济学:Conway 在 9 月 30 日就发过 Underdog-27B-1.0,315 次下载,无人问津;10 月 4 日迭代 1.1 版,依旧冷清;换上狗名 Saluki、写上「Qwen3.8 压缩 7 倍」的定位之后,两天 1.5 万下载、144 赞。模型还是那个赛道的模型,名字换了,命运就换了。二是生态速度:Qwen3.8 自带的 MTP 头被社区当天转出投机解码版(Kujira 的 MTP-GGUF,上千下载),Conway 自己一周内也发起了 underdog-llama-server 运行时分发——从发模型到发运行时,这个团队在往全栈走。

至于夸克和迅雷的网盘直链,那不是 Saluki 的功劳,是国内访问 Hugging Face 的环境催生的搬运基建——教程的 183 次阅读和 HF 上两天的 1.5 万下载,说明绝大部分用户本来就走 HF,教程只是给不走 HF 的人留了条路。

留给读者一对数字:88 比 84,7.89 对 54。前一对是 2-bit 量化在工具调用上反超全尺寸的分数,后一对是压缩 6.84 倍的体积账。要不要为一对反超的分数接受数学掉 15 个点,取决于你的 agent 要不要做数学题——这个判断,model card 比教程标题诚实得多。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

54 GB 压成 7.89 GB,工具调用反而赢了

这帖的骨架我核了,全对:7.89 对 54 是 6.84 倍;Underdog Bench 88 对 84(120 题、源自 BFCL v4、测前冻结、thinking 关、温度 0);并行工具调用 42 对 35;SWE-bench Verified 30 对 33;AIME 2025 79.2 对 96.7;MuSR 67.5 对 79.6;九个基准平均保持 96%。

一、「2-bit」是反推的,不是披露的

上游 ISTA-DASLab 最小的 IQ2_XS 是 8.4 GB、2.50 位每权重;Saluki 的 7.89 GB 文件,model card 没写 bits per weight。所谓 2-bit 是从体积推的,最后一道压缩工序的配方没公开。

二、Bonsai 2 那一格要分开念

同一张 Underdog 表上 PrismML 的 Bonsai 2 只有 70 分,但它报的是 14 个基准 98.2% 保持、5.95 GB、1.75 位每权重、AIME25 还有 95.00。代价是要 PrismML 自己的 llama.cpp fork,stock llama.cpp 直接拒它的打包格式。两个「保持率」口径不同,9 个基准对 14 个基准,不能直接比大小。

三、有两格量化版反而更高

IFEval 93.5 对 91.5,IFBench 72.7 对 71.0。指令跟随没被压垮,被压垮的是字母级谜题和竞赛数学——这个方向性本身就是压缩策略的证据。

四、缺的两块拼图

model card 没给峰值显存表,也没给量化后的实测上下文长度。「16GB 显卡跑 agent」这句话离可复现,还差这两张表。

下一根钉子:88 对 84 是挑战者自己出的卷子。有人把同样 120 题跑在 Bonsai 2 的 fork 上、给出同一 harness 的三方对照之前,这个反超只能算「值得认真对待」。

👍 1
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens