先说三个数字,因为摘要的每一个都需要打折。
① 「最多 25%」是 20 个格子里最孤立的一格。
表 1 是 4 模型 × 5 基准 = 20 格。我逐格算完:
| 模型 | AIME25 | GSM8K | GPQA | LCB | HumEv | 自报均值 |
|---|---|---|---|---|---|---|
| Nemotron-8B | −10.3% | −15.3% | −14.4% | −5.2% | −10.4% | −11.1% |
| Gemma-E2B | −17.8% | −1.9% | −9.9% | −15.1% | −6.8% | −10.3% |
| Qwen3-4B | −14.3% | −25.4% | −24.7% | −18.9% | −12.6% | −19.2% |
| gpt-oss-20b | −9.8% | −9.3% | −16.6% | −12.7% | −7.3% | −11.1% |
② 摘要两次写「600 道训练题」,附录 B.1 写的是 695。
摘要「using only 600 training problems」,结论再写一次「only 600 AIME problems」,还把它当核心卖点(小数据也有效)。附录 B.1 原文:
> The training set contains 695 problems. We shuffle it once with seed 4242 and divide it into eight disjoint groups: seven groups of 87 problems and one group of 86.
7×87+86 = 695,与表 4 的「8 组 / 87 题」一致。论文从头到尾没解释 600 从哪来。这是唯一的数量卖点被自己的附录推翻,而且方向是「实际用的比宣称的多」。
③ 「准确率持平」是均值口径。
逐格差值:8/20 降、10/20 升,均值 −0.06 分——总体确实近乎持平。但有 4 格跌幅 ≥1.8 分:Gemma@AIME2025 −2.9、gpt-oss@LiveCodeBench −2.8、Qwen@LiveCodeBench −1.8、Gemma@GPQA −1.8。表 5 配对 95% CI 是 −2.9±3.0、−2.8±1.9。
「不显著」在统计上合法,但工程上会被读成「无代价」。尤其编码任务(LiveCodeBench)是两个模型降幅最集中的地方,而编码恰是最看重长链推理的场景。AIME2025 只有 30 题,CI 本身就很宽。
最要紧的一条:全文零机制分析。
grep mechanistic / causal / logit-lens / attention probe,全文零命中。摘要用来支撑「涌现」的唯一结构性证据,是 §5.4 的 Schoenfeld 八类 episode 份额总变差 D_TV——而正文连 D_TV 的数值都没给(只有图 5),也没给标注器一致性/信度。对照组还是部分作者自己复现的(「We use a public checkpoint when one is available, and our reproduction otherwise」)。
所以按「零样本量判法」我只能说:涌现机制未获证明,论文只提供了相关性证据。不能排除「训练信号顺带把某些冗余表达压掉」这个平凡解释。
但这篇被自己低估了——这是我觉得最值得说的一点。
摘要说效率收益与「显式优化短推理的方法」comparable。在 Gemma 上:
- A&Z(Arora & Zanette 2025,RL 长度惩罚):仅 −1.8%
- On-Policy SFT:token 反而 +0.5%(变多)
- DEER(Yang et al. 2025,早停):砍 85% token,但 LiveCodeBench 44.2 → 17.4
- 本文 ConfSFT:−10.3%
顺带纠一个流传的说法:帖子里如果提到 Self-Length——论文里没有这个基线,全文 grep 无此词。对比只有上面三个。另外 DEER 本身就是个弱靶子(GPT-OSS 上只省 2.5% 却掉 1.6 分),拿它当「现有方法失败」的例证说服力有限。
还有两处未讨论的混淆,我算了但论文没提:
- 监督密度随基座变一个数量级。Gemma 平均每条轨迹只有约 4 个
Wait标记,其他模型 >20 个;段落边界\n\n则 >100 个。同超参下模型拿到的 confidence 样本数差一个量级——这既可能解释 Gemma token 收益偏小,也可能解释它准确率降幅最大。 - 四个模型训练预算不同量纲。GPT-OSS-20B:1 轮、87 题、每题 2 条 rollout、LoRA (r=16),且把 MXFP4 权重反量化成 bfloat16 训练;另三个是全参数微调、最多 8 轮、每题 8 条 rollout。GPT-OSS 拿到与全参同档的 −11.1%,要么说明 LoRA 一轮就够(那全参多轮是浪费),要么存在未识别的混淆。论文没讨论。
Wait 与 \n\n 不可直接对比(一个 4 题/轮+lr 1e-6,一个 80 题/轮+lr 2e-6)。一句话:机制没查清,口径要打折,但「只教它自信、它自己变安静」这件事本身,值回那 600 道题的成本。
*(SVG 动画卡:悬停/加载后动起来;静态截图看不全信息,数字以正文为准。)*