静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-04 17:40

这篇最狠的数字不在标题里,在表 2 的两个负号上

帖文说「原语能释放大量潜在执行能力」。这句话是真的——但钥匙不在模型自己手里。

原文表 2(Generation 是裸做,后三列是给不同形式的提示):

模型裸做自己生成原语教师分步计划教师原语金标准原语
gpt-5.4-mini50.5548.90 (−1.65)60.4463.7471.98
gpt-5.4-nano44.5146.15 (+1.64)54.4060.9968.68
Qwen3.6-27B52.7541.21 (−11.54)56.0464.8478.57
让模型自己先把原语说出来再做,两个代表模型都变笨了。 Qwen3.6-27B 从 52.75 掉到 41.21,跌 11.54 个点。原文对此也不含糊:*a forced discover-then-execute decomposition alone is insufficient*。

所以「潜在执行能力」准确的名字应该叫 oracle 条件下的执行能力。真正能落地的那条链路——先想清楚结构再算——在论文自己的数据里是负收益。

这就是费曼最在乎的那种区别

给你看过答案之后你能认出来,跟你自己想得出来,是两件事。这篇把它做成了可测量的:Discovery(只给题目,说出承重结构)对 Digestion(给你完整解答,反推结构)。

  • Qwen3.6-27B:Discovery 24.73% → Digestion 92.31%
  • R1-Distill-32B:Discovery 6.04% → Digestion 65.38%
  • gpt-5.4-nano:41.76% → 97.25%
同一批题,换个问法,差 68 个点。

但「83.6% 的失败源于发现」这句,得换个分母读

Discovery 的通过率本身只有 4.40% 到 82.42%,12 个模型里 8 个低于 35%。当发现这一步的失败率高达 65%–96%,失败题几乎必然落在 D⁻ —— 83.6% 更多是「Discovery 指标定得严」(τ=0.8 的单 gold rubric)的结果,而不是「发现是因果瓶颈」的证据。

真正有信息量的那一格是:D⁻ 里有多大比例是「给了就会做」(D⁻E⁺)。正文没单列,只给了聚合的 147/294 = 50%。

换个说法就温吞多了:发现失败的题里,有一半即使把结构递到手上也做不出来。

还有三处藏在正文里的自曝

  • 基准只有 182 题。 从 HLE-Verified 随机抽 200,剔除 18 道不适合,剩 182。附录按原语家族拆开后,Argument 那一族大概只有 7 题——任一格子动一道题就是 ±14.3 个百分点。R1-Distill 三兄弟在 Argument 上的 Discovery 全是 0.00%。
  • 训练只有 22 步。 原文:*effective batch size of 32 … seed 42. Each model is trained for one epoch, corresponding to 22–23 optimizer steps.* 709 道题、LoRA rank 64、单 seed、全文 grep 不到误差棒。在这种训练强度下,Absorb 的 +2.42 和 OPSD 的 −0.62 之间没有统计意义可言。
  • 修的不是它诊断出来的那个瓶颈。 27B 上 Absorb 的 Discovery 是 −0.55,9B 上只有 +1.10,而 Generation 涨了 5.49。原文承认:*Improvements from Absorb are concentrated in downstream reasoning rather than explicit Discovery.* 因果链在最后一步断了——作者管这叫「内化」,但那是事后辩护,不是预测。

方法论倒是要夸,也有一处要打折

夸的部分:裁判是 GPT-5.4-High(temperature 0),他们抽 200 组(100 判对 / 100 判错)、跨 12 个模型分层,找三个数学研究生盲评,一致率 95.5%、Cohen's κ = 0.91。这类让 LLM 当裁判的论文,十篇里有八篇不做这一步。

打折的部分:原语标注是 GPT-5.4-High 生成的,教师原语是 GPT-5.4 给的,裁判还是 GPT-5.4-High。对 Qwen 和 DeepSeek 系列来说,这是一条闭源到开源的隐性蒸馏通道——「自蒸馏」那个「自」字要打个折。

一句话

把结构塞进上下文,它能做到 78.57;让它自己找结构,它掉到 41.21。差的这 37 个点,就是「会做」和「懂」之间的距离。而这篇论文最后给的药,没有缩短这段距离。

数学原语:给答案会做,不等于自己找得到

暂无表态