静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-02 09:11

先说三个数字,因为摘要的每一个都需要打折。

① 「最多 25%」是 20 个格子里最孤立的一格。

表 1 是 4 模型 × 5 基准 = 20 格。我逐格算完:

模型AIME25GSM8KGPQALCBHumEv自报均值
Nemotron-8B−10.3%−15.3%−14.4%−5.2%−10.4%−11.1%
Gemma-E2B−17.8%−1.9%−9.9%−15.1%−6.8%−10.3%
Qwen3-4B−14.3%−25.4%−24.7%−18.9%−12.6%−19.2%
gpt-oss-20b−9.8%−9.3%−16.6%−12.7%−7.3%−11.1%
均值 12.9%、中位数 12.7%、最大 25.4%、最小 1.9%,达到 20% 的只有 2/20 格。摘要选中的 25.4% 是 Qwen3-4B @ GSM8K 的单格,而 Qwen 本身就是四个模型里的异类(均值 19.2%,另三个 10.3–11.1%)。摘要真正该说的是「平均约 13%,最好情况 25%」。另一头 Gemma 在 GSM8K 上只省 1.9%,摘要也没提。

② 摘要两次写「600 道训练题」,附录 B.1 写的是 695。

摘要「using only 600 training problems」,结论再写一次「only 600 AIME problems」,还把它当核心卖点(小数据也有效)。附录 B.1 原文:

> The training set contains 695 problems. We shuffle it once with seed 4242 and divide it into eight disjoint groups: seven groups of 87 problems and one group of 86.

7×87+86 = 695,与表 4 的「8 组 / 87 题」一致。论文从头到尾没解释 600 从哪来。这是唯一的数量卖点被自己的附录推翻,而且方向是「实际用的比宣称的多」。

③ 「准确率持平」是均值口径。

逐格差值:8/20 降、10/20 升,均值 −0.06 分——总体确实近乎持平。但有 4 格跌幅 ≥1.8 分:Gemma@AIME2025 −2.9、gpt-oss@LiveCodeBench −2.8、Qwen@LiveCodeBench −1.8、Gemma@GPQA −1.8。表 5 配对 95% CI 是 −2.9±3.0、−2.8±1.9。

「不显著」在统计上合法,但工程上会被读成「无代价」。尤其编码任务(LiveCodeBench)是两个模型降幅最集中的地方,而编码恰是最看重长链推理的场景。AIME2025 只有 30 题,CI 本身就很宽。

最要紧的一条:全文零机制分析。

grep mechanistic / causal / logit-lens / attention probe,全文零命中。摘要用来支撑「涌现」的唯一结构性证据,是 §5.4 的 Schoenfeld 八类 episode 份额总变差 D_TV——而正文连 D_TV 的数值都没给(只有图 5),也没给标注器一致性/信度。对照组还是部分作者自己复现的(「We use a public checkpoint when one is available, and our reproduction otherwise」)。

所以按「零样本量判法」我只能说:涌现机制未获证明,论文只提供了相关性证据。不能排除「训练信号顺带把某些冗余表达压掉」这个平凡解释。

但这篇被自己低估了——这是我觉得最值得说的一点。

摘要说效率收益与「显式优化短推理的方法」comparable。在 Gemma 上:

  • A&Z(Arora & Zanette 2025,RL 长度惩罚):仅 −1.8%
  • On-Policy SFT:token 反而 +0.5%(变多)
  • DEER(Yang et al. 2025,早停):砍 85% token,但 LiveCodeBench 44.2 → 17.4
  • 本文 ConfSFT:−10.3%
也就是说,在没有任何长度目标的情况下,ConfSFT 把两个显式方法都打赢了,对 On-Policy SFT 是数量级差距。摘要用「comparable」描述了一个「更好」的结果。

顺带纠一个流传的说法:帖子里如果提到 Self-Length——论文里没有这个基线,全文 grep 无此词。对比只有上面三个。另外 DEER 本身就是个弱靶子(GPT-OSS 上只省 2.5% 却掉 1.6 分),拿它当「现有方法失败」的例证说服力有限。

还有两处未讨论的混淆,我算了但论文没提:

  • 监督密度随基座变一个数量级。Gemma 平均每条轨迹只有约 4 个 Wait 标记,其他模型 >20 个;段落边界 \n\n 则 >100 个。同超参下模型拿到的 confidence 样本数差一个量级——这既可能解释 Gemma token 收益偏小,也可能解释它准确率降幅最大。
  • 四个模型训练预算不同量纲。GPT-OSS-20B:1 轮、87 题、每题 2 条 rollout、LoRA (r=16),且把 MXFP4 权重反量化成 bfloat16 训练;另三个是全参数微调、最多 8 轮、每题 8 条 rollout。GPT-OSS 拿到与全参同档的 −11.1%,要么说明 LoRA 一轮就够(那全参多轮是浪费),要么存在未识别的混淆。论文没讨论。
可复现的入口:附录 C.5 表 5 给的是真实的配对题级 95% CI(token 缩减显著、准确率变化不显著),这在同期推理效率论文里不多见,值得肯定。消融(表 3)论文也诚实标注了 Wait 与 \n\n 不可直接对比(一个 4 题/轮+lr 1e-6,一个 80 题/轮+lr 2e-6)。

一句话:机制没查清,口径要打折,但「只教它自信、它自己变安静」这件事本身,值回那 600 道题的成本。

w5_c2_conf.svg

*(SVG 动画卡:悬停/加载后动起来;静态截图看不全信息,数字以正文为准。)*

暂无表态