先说结论:这篇的骨架我核了一遍,数字对得上。arXiv 2609.13009 确实存在,9 月 11 日提交,作者 50+ 人;GPT-5.6-Sol 的 HLE-Physics 从 47.3% 修到 78.7%、CMT 从 61.0% 修到 87.2%,摘要里逐字对得上。【直引】
但有一处量纲要标红,而它恰好是你标题的来源。
论文摘要明写:「Corrected scores are computed on the retained evaluation subsets following expert review.」【直引】翻译过来是——修正后的分数,是在专家审完留下的那批题上算的。CritPt 那 94.4% 是 pass@4,且明确标注「on the 54 retained CritPt challenges」;只有单人标注的 54 道题被排除了。
所以 32.3% → 87.5% 这个跃迁,分子分母都动过:题目被修好或剔掉了,才有了新分母。它不是同一场考试的两次阅卷,是换了一份删过题的卷子再考一次。你正文里其实写了「修复或剔除病题」,但标题和表格并排放着,读者很容易读成同一份卷子的两次得分。【判断】我认为这张表该在表头上方加一行「修正后为保留子集,非同卷重测」。
补两个你没写进去的格子。
一是你引的 59.4% 有分母问题。它出自 OpenAI 对 SWE-bench Verified 的审计,分母是 138 道 o3 在 64 次运行里频繁做不出的题,不是全部 500 道。换算到全集是 138/500 × 59.4% ≈ 16%。其中 35.5% 是测试过窄(拒绝功能正确的另解),18.8% 是测了题目没要求的功能,另有 5.1% 是别的结构问题。【直引】你引得比大多数二手稿严谨(你写的是 138 个任务),但读者会默认「六成 Verified 是坏的」。
二是比坏题更狠的一层,在阅卷侧:METR 请 scikit-learn / Sphinx / pytest 的四位活跃维护者审了 296 个已经通过自动评分器的 AI 生成 PR,约一半不会被合并,评分器相对人类合并决策虚高 24.2 个百分点。【直引】题坏是出卷的病,评分器虚高是阅卷的病。你这篇只写了前者,而后者才是「尺子先坏」最直接的证据。
尺度锚:250 道送审题里,模型真错的只有 12 道。摊到一份 100 题的卷子,是 5 道题。剩下 95 道里,57 道是题目本身有病,38 道是老师看走眼。
另有一处我觉得比结论更有意思:论文附录 G 列了 56 组「标注冲突」——同一道题,两个专家一个判基准错、一个判模型错,HLE-Physics 里就有 19 组。【直引】也就是说,连「谁错了」这件事本身都需要一次仲裁。这不削弱结论,但它把「请专家来判」这剂药的成本摆到了台面上。
下一根钉子:六个基准修完之后,谁来做那批「专家验证过的、面向开放问题的」新题?论文把球踢给了「竞赛式公开赛制 + 非营利运营」,目前没看到接球的人。