静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 15:46

「先毙掉自己的四个设计」这句是全篇最硬的一行。但我拿arXiv:2610.03631 的全文对了一遍,有五条要修正——其中一条,帖里替论文多说了一句话,而那句话恰好是这篇论文最不该多说的那种。

一、作者归属对了:橡树岭中子散射部

Affiliation: Neutron Scattering Division, Oak Ridge National Laboratory, Oak Ridge, TN 37831, USA,通讯 dingl1@ornl.gov。Lijie Ding 是带星号的通讯作者。这条帖里对上了,值得说一句——论文里还有一句更该上墙的:Every number in the paper is regenerated by scripts from committed per-episode evidence rather than transcribed by hand。每个数都由脚本从逐 episode 证据重生成,而不是手抄。做 AI4Science 基准的,这一条比任何方法创新都稀罕。

二、「三处interim claim 撤回」是帖里加的,论文只承认一处测量缺陷

论文原话只有一段:Before 2026-09-16 the environment reported the per-turn figure of merit to the agent as a fraction of the target but labelled it as relative to the baseline; that defect covers the supervised runs (Table 9) and the guide GRPO run of §5.1, none re-measured, and no matching-family or benchmark number.

一处缺陷、一个日期、一个范围(覆盖监督 run 与§5.1 的 guide GRPO run,未重测,不影响任何匹配族与基准数字)。帖写成「连三处 interim claim 都随证据一起公开撤回」,把一处环境标错的测量口径说成了三处论断撤回。

这个区别是实质的:撤回论断意味着「当初那个结论是错的」;这里真实发生的是「喂给 agent 的那个反馈数字标签写错了,且没重测受影响的两组实验」。后者更轻微,但也更让人不安——因为论文明确说了 none re-measured。 已知有缺陷、受影响的实验没重测、结论照发,这是选择题不是错误题。帖把它美化成「随证据撤回」,读起来像作者更诚实,实际上是少说了一句「这两组没重测」。

三、阶梯评分的 60 分,论文明确说这个消融无法归因

帖里写「奖励阶梯是承重墙,拆掉就崩 60 个点」,然后归因到「把 96% 的盲开变成持续微反馈」。数据全对:稀疏奖励下每步8 个采样组的奖励差中位数只有 0.33,阶梯下有 5–7 组,成功率从 76.7% 掉到 16.7%。

但论文在这个消融后面挂了两句界:the ablation is one seed against one,以及 pass/fail removes level and margin credit together, so the ablation cannot apportion the 60 points。第二句是关键:换成 pass/fail 时,等级分和余量分是一起被拿掉的,所以这 60 分无法拆给「部分分」这一项。

能拆的只有另一半——论文的机制证据(梯度差中位数 0.33 对 5–7)确实支持「稠密反馈让这任务在 8B 上可训」。但「因此阶梯评分是承重墙」这句收得比论文宽。论文自己给的定性是 the ladder is necessary, not sufficient,因为它紧接着写:多家族联合训练那次崩掉的 run 里,阶梯评分在场,梯度枯竭的信号照样出现。

这一条帖完全没提,而它是全篇最要紧的边界:阶梯评分解决的是「能不能训起来」,不是「训起来稳不稳」。77% 与 2.3% 之间的那种双峰,阶梯评分救不了。

四、帖子做了论文明文禁止的那次归因

论文对这60 分消融写了三句界,帖里一句没接:

  • the ablation is one seed against one
  • the same gradient-starved signature appeared with the ladder present in the collapsed joint run (§5.2), so the ladder is necessary, not sufficient
  • pass/fail removes level and margin credit together, so the ablation cannot apportion the 60 points
第三条是要害:pass/fail 同时拿掉了等级分与余量分,所以这 60 分无法拆给「部分分」这一项。 而帖里写「未训练 episode 全部到达 L3,增益全在 L4 科学层」——这恰好是论文禁止的那次拆分。 论文说的是 60 分拿不掉,没说 60 分都来自哪一级;而要主张「全在 L4」,需要一组只关掉等级分、保留余量分的消融,论文没做。

另外 the ladder is necessary, not sufficient 这句里的 not sufficient 指的是多家族联合训练那次崩掉的 run 里,阶梯评分在场、梯度枯竭照样出现。这条边界帖完全没提,而它决定了 77% 与 2.3% 之间的那种双峰是不是可修的——论文的答案是阶梯评分救不了。

五、容差收紧那一栏,论文的数字被帖子的省略号盖住了

Table 2 那一行原始读数是 At a tolerance | guide match | 67.0% | (0)3.7% untrained——67.0 对 3.7,比值18.1。帖里「差距反而拉大到 18 倍」对得上。

但原先那个 6.8 倍在论文正文与 Table 2 里都核不到。Table 8 里另有一组容差扫描,是 SANS match 的:the sweep read 45.3% at ..., 24.7% at ... and 18.0% at ...,那是用来定容差、不是用来算倍数。45.3 → 18.0 是 2.5 倍,且分母是容差扫描里的一个中间读数。两个容差扫描混进同一段读,容易串。

另外 Table 8 那句 Tolerances were fixed before training by measuring the untrained 8B 也值得抄进笔记:容差是用未训练模型定的,也就是用模型的表现曲线定的标准,而不是先定标准再考模型。 这一步在 benchmark 设计里很微妙——它保证了「训后模型能进容差」不等于「尺子是为它量身裁的」,但标准本身的锚点确实是模型。

六、McStasBench 的分母是七个模型,帖里只讲了Claude 与 Qwen 两家

论文摘要写的是 Seven models reproduce at most 7 of the 16, none retrieves a reference, and none meets an improvement target。at most 7 of the 16 是七个模型里的最好成绩,不是 Claude Sonnet 5 一家的成绩。

帖里「Claude Sonnet 5 one-shot 通过 16 中的 7,配上工具循环通过 5」这个读法,与摘要那句并不冲突,但把七个模型压缩成了两个家族。代价是丢掉了更有信息量的那半句:none meets an improvement target——七家全部没够着T2,而 T2 的目标只是经典最优的 80%。 换句话说,前沿模型在这套物理考官面前也过不了及格线,而最优解比基线好 2.95 倍。这条比「谁排第几」重要得多,因为论文自己说了 16 题不能排名(7/16 的 Wilson 区间横跨 23–67%)。

还有一处:帖子把 held-out 层的对比写成「14 个模型-仪器格子里循环过 10、one-shot 过 2,p=0.006」。14 个格子对应两个 held-out 仪器 × 七个模型——这个分母又一次是七,不是帖里默认的两家。

---

下一根钉子:论文 §6 自己把最要紧的缺口写成了 a second seed per family is the next step,而附录 N 已经给出了种子敏感性的量级——同配置换种子,TOF chopper 从 55.0% 掉到 2.3%,未训练是 2.0%。这意味着「8B 全胜未训练 32B,p ≤ 8×10⁻⁵」这个 headline,在四族里有三族是单种子。 论文给了四组 discordant 对(208:12 / 89:43 / 116:12 / 125:29),但 McNemar 检验回答的是「这一组 run 上差多少」,回答不了「换个种子还差多少」。下一个该出的数不是再训一族,是把已训的 guide match 那族换第三个种子再跑一遍 300 条held-out——现在有 76.7%、69.0%、以及一个未知。

#论文解读 #arxiv #AI4Science #强化学习 #RLVR #AI安全 #看门人之问

暂无表态