Swift-Qwen3.8-27B 解剖:把「想太多」当病治——死掉的 SFT、量化税的行为面与三层打法

arXiv 谱系:Qwen3.8-27B 后训练衍生 ukisai 出品 八路搜索 + 官方基准页 + HN 作者自述交叉核实

arXiv 谱系:Qwen3.8-27B 后训练衍生 | ukisai 出品 | 八路搜索 + 官方基准页 + HN 作者自述交叉核实

先给结论。这个模型治一个很具体的病:Qwen3.8-27B 想太多。思考 token 砍 58.3%,精度平均掉不到 1%,吞吐快 1.95 倍。数字有口径水分,但病是真的,药也真的对症。最值钱的不是结果,是作者在 HN 上公开的试错过程——里面有一次干干净净的失败。

一、这个模型是什么

UkisAI 出的 Qwen3.8-27B 后训练版。不是微调整权重那种粗活,是针对「overthinking tokens」的定向手术。训练完以 adapter 形态发布,挂在原版 Qwen3.8-27B 上用。文本、图像、视频能力都保留。

起因很实在。作者跑自家量化版 Qwen3.8-27B,被随机推理循环烦死了。同一段检查反复做,答案早就出来了还在想。medium 和 low 档位都治不好。

二、方法:五步,其中一步死了

作者在 HN 把完整流程摊开了。按顺序:

1. 找到 Meta 一篇论文(arXiv:2606.00206),针对 PTQ 场景的 overthinking 缓解。开箱即用,效果一般。 2. 自己上 8×H100,生成大量分布外 trace。编码、语言、视觉、agentic 四个域。 3. 把带 overthinking 的 trace 挑出来分组,找公约数 token。 4. 拿这些 token 建推理时惩罚器。 5. 计划用惩罚器生成干净 trace,再 cross-entropy SFT 进权重。

第五步完全失败。作者原话是 "Did not work at all"。

但失败里捡到东西:惩罚器本身比 Meta 论文给的 token 好使,而且对 BF16 也有效,不只是低精度模型。最后成品的路线是惩罚器思路加上一个 transfer 组件——这个组件来自 BottleCap AI 的 ThinkingCap-Qwen3.6-27B,同赛道前作。

这个失败值得单独说。推理时的惩罚有效,蒸进权重就死,说明「少想」这个行为锚在推理动力学的层面,不在静态分布里。惩罚器是外挂的刹车,SFT 是想把刹车焊进去,焊不进去。

三、账本与口径

九个基准,BF16,每模型五次取平均。挑关键的列:

基准精度变化思考 token 均值降幅
GPQA-Diamond88.38 → 88.28-41.0%
C-Eval90.00 → 90.62-46.1%
AIME 202698.67 → 94.00-26.7%
HMMT Nov99.33 → 96.00-31.1%
LiveCodeBench v676.76 → 81.55-24.3%
Terminal-Bench 2.166.74 → 65.84-38.7%
几个海关结论:

头条数字是中位数口径。 58.3% 指 GPQA 的 median 降幅,全套件里最大那个。均值口径只有 41%。官方页自己写明了这一点,还写明 LiveCodeBench 测的是 completion tokens 其他行测的是 thinking tokens。厂商在自家发布页把头条数字的口径拆给你看,这个诚实度高于社区平均,照例给分。

平均不掉分的反面是硬数学掉分。 AIME 掉 4.67 个点,HMMT 掉 3.33 个点。竞赛级难度的分是拿思考长度换的。代码反而涨 4.79 个点,Terminal-Bench 的四小时长任务几乎无损。少思考的代价不均匀——数学吃预算,代码和长程任务不太吃。

部分基线输出复用了存档 run。 复现要找他们要 harness manifests。小扣分。

四、最有意思的一组对照:量化与掉分的互相抵消

官方顺手测了量化版。W4A16 混合精度和 AWQ INT4 下,token 节省全部保留。意外的是 AIME:

BF16 下 Swift 掉 4.67 个点。INT4 下 base 82.67,Swift 84.00,反超 1.33 个点。

两种税互相抵消了。量化掉了 14 个点的底,Swift 砍思考掉的 4.67 个点被量化噪声盖住,甚至可能因为少绕循环而净赚。这个非单调现象是全文最值钱的实验。

顺着往下想一层。Swift 的动机本来就是「量化实例的推理循环」。HN 评论区有人给了个假说:低量化模型对自己推理没信心,所以更容易过度思考。假说没验证,但方向对——量化税有行为面。以前讨论量化只看精度掉多少,现在多了一个维度:量化会改变思考行为,不只是掉分。掉分是静态税,诱发 overthinking 是动态税,动态税还带利息(思考 token 也是要花钱的)。

五、赛道:三种干预位置

少思考这件事,市面上有三层打法。按干预位置分:

层代表成本效果
模板层Qwen-Sharp-Chat-Templates,改 chat_template 鼓励少想零训练,换个 jinja 文件温和
接口层官方 reasoning_effort 参数(medium/low)零成本官方原生,但 Swift 在同档位还能再省 22-25%
权重层Swift、ThinkingCap8×H100 级训练58% 级压缩,且与上两层可叠加
Swift 在 medium 和 low 档位下继续省 token,说明权重级手术和接口级参数是独立生效的,不冲突。三层可以叠着用。

同赛道还有 BottleCap 的 ThinkingCap(Qwen3.6 时代,均值砍一半最好九成)、Reddit 上的社区量化实践。「短思考」从论文话题变成产品赛道,就在这两个月。

六、三个独立观察

观察一:这是对 test-time compute 军备竞赛的一次反向下注。 全行业都在加思考预算,这条线在减。和 Jev 的判断题模型是同一种下注方向:不是所有场景都值得想更久。证据也同构——Terminal-Bench 长任务几乎无损说明多数场景的思考预算是浪费的,AIME 掉分说明竞赛场景不是。思考预算的价值是任务依赖的,这条曲线现在有人开始测绘了。

观察二:草稿纸问题多了第五种解。 此前记录过四种:丢弃级(Prefix Sliding 扔窗口)、窗口级、隐空间级(latent reasoning,草稿不落 token)、不动点迭代级(DBTM 自适应)。Swift 是行为级——草稿照写,但训练让它写短。不动结构不动接口,动行为。五解并排放,第一次看清「中间思考的成本」是个多维优化问题,每一维都有人在动手。

观察三:MTP 主线没断。 社区量化链已经出了 suzu89/Swift-Qwen3.8-27b-oQ8-mtp,MLX 版把 MTP 带上了。之前解剖 Qwen3.8 发布 72 小时量化生态时记过 MTP 保真是社区分水岭,这条链在 Swift 身上延续了。另外 mradermacher 的 Abliterated(去审查)版都出了,说明传播链进入第二阶段——不再是有兴趣,是有人当日常工具用。

七、可打脸预测

12 个月内,短思考从社区衍生品变成官方产品线:Qwen 或同级厂商发布自带权重级短思考变体,或者把 thinking-budget 训练做成可配置开关。依据是 overthinking 已被多家独立证实为可训练维度,接口层的 effort 参数先落地,权重层收编是第二步——每代显卡都在变贵,思考 token 的账迟早要算到厂商头上。

另一个预测:短思考模型在超长思考预算场景下的掉分会放大。思考 scaling 曲线被压扁之后,xhigh 档的边际收益会比 base 更早触顶。谁先测出这条曲线的拐点,谁就拿到下一个帖子。


*主要参考:ukisai.com/news/introducing-swift(官方基准页)、HN Show HN 49727511(作者方法自述)、bottlecapai.com ThinkingCap 发布页、arXiv:2606.00206(Meta PTQ overthinking)、HuggingFace ukisai/Swift-Qwen3.8-27B-GGUF、r/LocalLLaMA 三方对比帖。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens