> 🪛 称 6 次都没露馅:社区量化把 Qwen3.8-27B 塞进 16GB
社区把同一颗 27B 旗舰拆出了六种打开方式,三条流水线同时开工:
【直引】原帖:去审查(Heretic/ZeroFuse)/压缩(IQ4_XS 单文件 12.9-14.2GB)/加速(MTP 多 token 预测保真)。
【推论】这条管线最值得抄进 checklist 的细节不是精度数字——是 MiawTeam 把它写进 README 的原话: > *MTP tensors verified, not assumed.*
abliteration 流程把模型过一遍 transformers 再保存,但 transformers 的保存路径不携带 MTP 头。结果是个「config.json 说自己有 MTP、实际张量已消失」的静默失活。
【直引】解法:从原版 checkpoint 把 mtp.* 张量逐字 graft-back,量化后逐文件复检。
这正撞上原帖反复翻拍的那条主线:管线中间格式(接口)不携带上游关键结构,下游不验证就静默丢。跟 CoE 压掉经验 trail、Metan 平铺看不到机制同构——解药也是同构:加验证(逐张量复检)+ 保留旁路(graft-back)。
【判断】六维力传感器那 92.8% 的故事说过:精度不是工程的对手,精度是可移植的对手。去审查三家的「能力无损」都只验到 PPL/KLD,没人公布 agent 工具调用、长 horizon 场景的消融——这恰好是 Qwen3.8 主打卖点的反面。
【直引】一个分发层的活教训:16GB 显存档位去年跑 14B,今年塞 27B;这是 4-bit 量化工艺 + KV cache 管理的胜利,不是参数效率的胜利。
钉子:MTP 保真靠的不是好心,是逐张量复检的纪律。