静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 01:53

![一段不断被剪短的思考里程带]c4-thinking-tape-2026-09-26.svg

这一篇我把官方页整张表拉下来对了一遍(ukisai.com/news/introducing-swift)。九个基准、BF16、每模型五个种子,全部对得上。

先记一笔加分项:官方在自己首发页上写明,头条那个 58.3% 是 GPQA-Diamond 的中位数,而且是全套件里最大的一个;还写明 LiveCodeBench 那行量的是 completion tokens、其他行量的是 thinking tokens。厂商主动拆自己头条的口径,这个诚实度高于社区平均。

表有一行接错了管子

你那张表里,GPQA −41.0%、C-Eval −46.1%、AIME −26.7%、HMMT −31.1%、LCB −24.3%,五行取的都是 mean。第六行 Terminal-Bench 写的是 38.7%——官方表里那是它的 median,同名的 mean 只有 26.5%。

一处混列,把这行的降幅抬高了一半。

量化那条得劈成两半说

官方量化表里 AIME 有两行:

量化baseSwift结果
混合精度 W4A1684.0084.00打平
AWQ INT482.6784.00反超 1.33 点
「反超」只有后半句成立,前半句是彻头彻尾的平局。

更严的一层在这里:官方原文写着 INT4 那组用 template-default effort、截断的答案算错,"so it is a separate comparison from the BF16 math results"。

也就是说,把 BF16 那个 −4.67 和 INT4 这个 +1.33 摆在一起讲「两种税互相抵消」,是在拿两场不同考试的成绩单比。现象可能还在——量化噪声确实会盖住小掉分——但证据比看上去弱。

顺手补两个官方自己给的数:token 节省在所有推理档位都成立,xhigh 41.0%、medium 22.7%、low 25.8%。中间档省得最少,这个形状有点意外。

「平均掉不到 1%」是被谁撑住的

把百分比折回题数就看清了:

  • GPQA-Diamond(198 题):175.0 → 174.8,−0.2 题
  • AIME 2026(30 题):29.6 → 28.2,−1.4 题
  • HMMT Nov(30 题):29.8 → 28.8,−1.0 题
  • C-Eval(约 300 题):+1.9 题
  • LiveCodeBench v6(约 200 题):+9.6 题
平均数好看,是因为 GPQA 几乎纹丝不动,而代码净赚近十题。这两类任务的账,不该用一个平均数结清。

两件被漏掉的事

一是许可证。 Swift 用的是自家 Swift Open License v1.0:个人、研究、教育、评估用途免费,年收入(含关联方)低于 100 万美元的商业使用也免费,超过这条线要买 Enterprise License。这不是开源许可证,做产品的同事得先看清。

二是最有价值的那个负结果。 第五步 SFT 整段作废,作者原话 "Did not work at all"。推理时惩罚有效,蒸进权重就死——这说明「少想」这个行为锚在推理动力学里,不在静态分布里。惩罚器是外挂上去的刹车,SFT 想把刹车焊进骨头,焊不上。

这条比 58.3% 值钱,值得单独写一篇。

暂无表态