这篇最狠的数字不在标题里,在表 2 的两个负号上
帖文说「原语能释放大量潜在执行能力」。这句话是真的——但钥匙不在模型自己手里。
原文表 2(Generation 是裸做,后三列是给不同形式的提示):
| 模型 | 裸做 | 自己生成原语 | 教师分步计划 | 教师原语 | 金标准原语 |
|---|---|---|---|---|---|
| gpt-5.4-mini | 50.55 | 48.90 (−1.65) | 60.44 | 63.74 | 71.98 |
| gpt-5.4-nano | 44.51 | 46.15 (+1.64) | 54.40 | 60.99 | 68.68 |
| Qwen3.6-27B | 52.75 | 41.21 (−11.54) | 56.04 | 64.84 | 78.57 |
所以「潜在执行能力」准确的名字应该叫 oracle 条件下的执行能力。真正能落地的那条链路——先想清楚结构再算——在论文自己的数据里是负收益。
这就是费曼最在乎的那种区别
给你看过答案之后你能认出来,跟你自己想得出来,是两件事。这篇把它做成了可测量的:Discovery(只给题目,说出承重结构)对 Digestion(给你完整解答,反推结构)。
- Qwen3.6-27B:Discovery 24.73% → Digestion 92.31%
- R1-Distill-32B:Discovery 6.04% → Digestion 65.38%
- gpt-5.4-nano:41.76% → 97.25%
但「83.6% 的失败源于发现」这句,得换个分母读
Discovery 的通过率本身只有 4.40% 到 82.42%,12 个模型里 8 个低于 35%。当发现这一步的失败率高达 65%–96%,失败题几乎必然落在 D⁻ —— 83.6% 更多是「Discovery 指标定得严」(τ=0.8 的单 gold rubric)的结果,而不是「发现是因果瓶颈」的证据。
真正有信息量的那一格是:D⁻ 里有多大比例是「给了就会做」(D⁻E⁺)。正文没单列,只给了聚合的 147/294 = 50%。
换个说法就温吞多了:发现失败的题里,有一半即使把结构递到手上也做不出来。
还有三处藏在正文里的自曝
- 基准只有 182 题。 从 HLE-Verified 随机抽 200,剔除 18 道不适合,剩 182。附录按原语家族拆开后,Argument 那一族大概只有 7 题——任一格子动一道题就是 ±14.3 个百分点。R1-Distill 三兄弟在 Argument 上的 Discovery 全是 0.00%。
- 训练只有 22 步。 原文:*effective batch size of 32 … seed 42. Each model is trained for one epoch, corresponding to 22–23 optimizer steps.* 709 道题、LoRA rank 64、单 seed、全文 grep 不到误差棒。在这种训练强度下,Absorb 的 +2.42 和 OPSD 的 −0.62 之间没有统计意义可言。
- 修的不是它诊断出来的那个瓶颈。 27B 上 Absorb 的 Discovery 是 −0.55,9B 上只有 +1.10,而 Generation 涨了 5.49。原文承认:*Improvements from Absorb are concentrated in downstream reasoning rather than explicit Discovery.* 因果链在最后一步断了——作者管这叫「内化」,但那是事后辩护,不是预测。
方法论倒是要夸,也有一处要打折
夸的部分:裁判是 GPT-5.4-High(temperature 0),他们抽 200 组(100 判对 / 100 判错)、跨 12 个模型分层,找三个数学研究生盲评,一致率 95.5%、Cohen's κ = 0.91。这类让 LLM 当裁判的论文,十篇里有八篇不做这一步。
打折的部分:原语标注是 GPT-5.4-High 生成的,教师原语是 GPT-5.4 给的,裁判还是 GPT-5.4-High。对 Qwen 和 DeepSeek 系列来说,这是一条闭源到开源的隐性蒸馏通道——「自蒸馏」那个「自」字要打个折。
一句话
把结构塞进上下文,它能做到 78.57;让它自己找结构,它掉到 41.21。差的这 37 个点,就是「会做」和「懂」之间的距离。而这篇论文最后给的药,没有缩短这段距离。