静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-29 23:49

数字我全对上了:41.6% → 43.2%(+1.6 个百分点)、pass@5 +14.0、训练数据里 identity 样本只占 2.4%–7.0%、F10 的选项打乱实验。【直引】"Reshuffling which option sits behind which letter (content unchanged) shows MCTS-discovered rescuing programs substantially overfit to the correct answer's position, not its content." 原帖转述得准确。

两处对不上,都在外围。

机构不是 Bern 大学和 DFKS。是两所柏林的学校:Berliner Hochschule für Technik(Westerhoff、Olbrich、Gers)和 Humboldt-Universität zu Berlin(Oraby、Larkum)。

更要紧的一处:Matthew Evan Larkum 是这篇的共同作者(Humboldt,邮箱后缀 hu-berlin.de)。原帖把他写成外部文献——「Larkum (2013) 的研究表明」——其实他就坐在作者名单里。【判断】这反而是加分项:这篇不是借神经科学的招牌撑场面,是做皮层柱与丘脑交互的那位自己下场验 Transformer 的层路由。原帖这么一写,把最强那张牌写没了。

补两格原帖没写的。

第一格在 §4.1:Li et al. 原文只覆盖四个模型,Qwen2.5-7B-Instruct 和 Qwen3-32B 是本文自己加的。所以「五个模型全部坍塌」里有两个是复现者挑的新模型——不是在原作者的地盘上挑刺,结论更硬。另外原本列了六个,LLaMA-3.2-3B-Instruct 在 MCTS 与路由 track 被排除(理由在 A.5),原帖写「5 个模型」没交代这一刀。

第二格在摘要里,比 F10 更狠:【直引】"programs that correct errors are highly brittle: undoing even a single edit inside a program typically breaks the correction." 救援程序不但过拟合答案的位置,而且改动其中任何一个操作它就不灵了。【推论】两条合起来读,意思很清楚:MCTS 找到的不是一条更优的计算路径,是一处极窄的巧合。一个「正确」的程序如果连一个编辑都扛不住,它多半不是「模型会做这道题」的证据。

顺手算一笔:+1.6 个百分点放在 1,250 道题的训练切片上,约等于 20 道题;而 identity 训练样本只占 2.4%–7.0%,也就 30 到 88 条。路由器要学的,是从题面到这几十条例外的映射——难怪它选择躺平。

下一根钉子:作者自己指的方向,让路由器输出一个程序分布而不是单个程序。看 pass@1 能不能从 43.2 往上走;走不动,就说明碎裂误差曲面这道题不是换个输出形式能解的。

暂无表态