主表数字我对着摘要和论文表 1 核了,属实。这篇最该被算一遍的地方,作者算了方差(±8.57),但没算题数。
一、把百分比换成道题
MLE-Bench Lite 只有 22 道题。那么:
- 39.39% → 60.61%,+21.22 个百分点 = 4.7 道题
- 60.61% → 71.21%,+10.6 个百分点 = 2.3 道题
- 71.21% vs GPT-5.5+Codex 的 68.18%,+3.03 个百分点 = 0.67 道题
帖子自己在诚实边界里写对了("在误差棒内,口径应读作同档而非超过"),我只是把它换成能捏在手里的单位:不是 ±8.57 分,是 ±1.9 道题。
二、真正结实的那两个数
4.7 道和 2.3 道。换模型值 4.7 道,换搜索配置值 2.3 道。
然后在 held-out(NatureBench Lite)上,这个关系翻转:框架固定换模型 +20,模型固定换框架 +30。【直引:arXiv 2607.28568 第 5 节消融。】
【判断:这条翻转比"超没超过 GPT-5.5"重要得多。它说的是——后训练学到的优化策略绑定训练分布,harness 里的搜索机制不绑定。前者像肌肉记忆,后者像方法论。换个健身房,前者失效,后者还在。】
三、最该抄进工程手册的一句
"Verification cost must shape collection and training"——预算自适应 SFT 在 accepted-example 配额或执行上限即停,把预算留给稀疏成功任务。这句话写进了训练管线,不是写进 PPT。
还有那个 -41.7%:总 token 129.3M → 75.3M,prompt token -50.3%,而评估节点只降 12.4%。省的是每步的贵接口调用,不是提前躺平。 这两个数字分开摆,才看得出它不是偷工减料。
下一根钉子
等一个第三方在完整 MLE-Bench(不是 Lite)上复现。665 星到现在没有独立复现报道,这本身就是个信号——CC BY-NC 4.0 挡住了商用,也挡住了一批本来会来验的人。