![一段不断被剪短的思考里程带]
这一篇我把官方页整张表拉下来对了一遍(ukisai.com/news/introducing-swift)。九个基准、BF16、每模型五个种子,全部对得上。
先记一笔加分项:官方在自己首发页上写明,头条那个 58.3% 是 GPQA-Diamond 的中位数,而且是全套件里最大的一个;还写明 LiveCodeBench 那行量的是 completion tokens、其他行量的是 thinking tokens。厂商主动拆自己头条的口径,这个诚实度高于社区平均。
表有一行接错了管子
你那张表里,GPQA −41.0%、C-Eval −46.1%、AIME −26.7%、HMMT −31.1%、LCB −24.3%,五行取的都是 mean。第六行 Terminal-Bench 写的是 38.7%——官方表里那是它的 median,同名的 mean 只有 26.5%。
一处混列,把这行的降幅抬高了一半。
量化那条得劈成两半说
官方量化表里 AIME 有两行:
| 量化 | base | Swift | 结果 |
|---|---|---|---|
| 混合精度 W4A16 | 84.00 | 84.00 | 打平 |
| AWQ INT4 | 82.67 | 84.00 | 反超 1.33 点 |
更严的一层在这里:官方原文写着 INT4 那组用 template-default effort、截断的答案算错,"so it is a separate comparison from the BF16 math results"。
也就是说,把 BF16 那个 −4.67 和 INT4 这个 +1.33 摆在一起讲「两种税互相抵消」,是在拿两场不同考试的成绩单比。现象可能还在——量化噪声确实会盖住小掉分——但证据比看上去弱。
顺手补两个官方自己给的数:token 节省在所有推理档位都成立,xhigh 41.0%、medium 22.7%、low 25.8%。中间档省得最少,这个形状有点意外。
「平均掉不到 1%」是被谁撑住的
把百分比折回题数就看清了:
- GPQA-Diamond(198 题):175.0 → 174.8,−0.2 题
- AIME 2026(30 题):29.6 → 28.2,−1.4 题
- HMMT Nov(30 题):29.8 → 28.8,−1.0 题
- C-Eval(约 300 题):+1.9 题
- LiveCodeBench v6(约 200 题):+9.6 题
两件被漏掉的事
一是许可证。 Swift 用的是自家 Swift Open License v1.0:个人、研究、教育、评估用途免费,年收入(含关联方)低于 100 万美元的商业使用也免费,超过这条线要买 Enterprise License。这不是开源许可证,做产品的同事得先看清。
二是最有价值的那个负结果。 第五步 SFT 整段作废,作者原话 "Did not work at all"。推理时惩罚有效,蒸进权重就死——这说明「少想」这个行为锚在推理动力学里,不在静态分布里。惩罚器是外挂上去的刹车,SFT 想把刹车焊进骨头,焊不上。
这条比 58.3% 值钱,值得单独写一篇。