骨折的考卷:47分的"差生",其实是87分的学霸
"分数低的时候,问题在学生;分数被压到接近零的时候,问题在考卷本身。"
📖 论文名片
标题: How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks
作者: Ali Ansari, Haoran Sun, Andy Zeyi Liu 等 40+ 位研究者(耶鲁大学 + Jump Trading Group + 剑桥大学 + 南加州大学)
arXiv: 2609.13009
发布时间: 2026-09-11
🎭 开场:一张令人崩溃的物理试卷
想象你是高中生,参加一场全校模拟考。
物理卷子的最后一道大题:"三个完全相同的均质球放在光滑水平面上,彼此接触。一根绳子在球心高度绕住三球,把它们捆在一起。第四个同样的球放在三个球上面。已知每个球重量为 P,求绳子张力 T。"
你笔走龙蛇,算出 T = P/(3√6)。你长舒一口气,检查了代数,确认无误。
两周后成绩公布:零分。
你冲去找老师。老师指着参考答案说:"标准答案是 T = (√6/18)P。你的答案跟它不一样,当然零分。"
你愣住了。因为 P/(3√6) 分子分母同乘 √6,恰好就是 (√6/18)P——你的答案和标准答案在数学上完全等价。仅仅是分母没有"有理化"而已。
这不是一个虚构的故事。这是 GPT-5.6-Sol 在 PHYBench 物理基准测试上的真实遭遇(论文 Figure 3)。它被一台规则判分器残忍地判了 0 分,只因为它给绳索张力写出了一个"不标准形式"的正确答案。
而这,只是冰山一角。
🧩 第一章:好学生与坏考卷
1.1 一个不对劲的现象
过去两年,AI 社区流传着一个令人沮丧的结论:大模型在物理上很菜。
证据看起来无可辩驳。Artificial Analysis 智能指数(2026)显示:
- GPT-5.6-Sol 在 HLE-Physics(人类最后的考试·物理卷)上只有 47.3%
- 在 CMT-Benchmark(凝聚态物理基准)上只有 61.0%
- 在 CritPt(前沿物理挑战)上更是惨到 32.3%
这些基准测试覆盖了从本科物理到前沿研究的各个层次。32.3% 意味着什么?接近瞎蒙。大家都在说:AI 数学突飞猛进,物理一塌糊涂。
但物理学家们在日常工作中的体验,完全是另一个故事。
他们报告说,前沿模型能帮他们重建隐藏的 SL(2,ℝ) 对称代数(Lupsasca 黑洞分析的核心工具),能协助推导 C 参数的 Sudakov 重求和,能在宇宙弦辐射问题上给出精确的解析结果。Schwartz 教授甚至专门写了篇博客,叫《Vibe Physics: The AI 研究生》,描述 AI 如何像一个不知疲倦的博士生一样陪他做理论物理。
一边是 32 分的考试成绩,一边是"像一个优秀的物理研究生"的真实体验。
总有一边在说谎。
这篇论文的作者们决定亲自查证。他们召集了耶鲁大学等机构 40 多位物理学教授和研究生,把六个主流物理基准测试的错题本翻了个底朝天。
1.2 审计方法:让真物理学家当"阅卷组"
流程设计得很严谨,像一场学术界的"案件重审":
- 先按原始流程考一遍——用基准自带的题库、参考答案和判分器,得到"审前分数"(pre-audit scores)
- 把所有被判错的题集中起来——四个基准共 250 道"错题"送审
- 专家逐题审查三类可能:
- 模型错误:题目没问题、参考答案正确,但模型答错了——这是真错误
- 判分错误:题目没问题,模型答对了,但判分器不认——冤案
- 基准错误:题目本身有缺陷——缺条件、表述模糊、参考答案就是错的——考题出错
每个案子由对应子领域的专家(教授或经导师背书的研究生)独立裁决。
结果出来后,连研究者们自己都吓了一跳。
🔬 第二章:95% 的"错误"不是模型的
2.1 数据不会说谎,但考卷会
250 个被判错的案子里,专家裁决:
| 错误类型 | 数量 | 占比 |
|---|---|---|
| 基准错误(题目/答案本身有缺陷) | 143 | 57.2% |
| 判分错误(模型答对但被判错) | 95 | 38.0% |
| 模型错误(模型真的错了) | 12 | 4.8% |
95.2% 的"错题",错不在模型。
这是整篇论文最有冲击力的一张表。用一个比喻来说:
一个学生考了 100 道题,被判 40 分。老师把他的错题本翻了一遍,发现 40 道"错题"里,有 23 道题的题目本身就有病、15 道题他其实答对了是老师看走眼了——真正答错的只有 2 道。
分基准看,荒诞程度各有特色:
- PRISM-Physics:74 个送审题中,模型错误为 0。零!每个被判错的案子都是基准或判分器的锅。修正后,GPT-5.6-Sol 的 mean@4 从 13.0% 飙到 94.59%——提升超过 7 倍。
- PHYBench:56 个送审题中,判分错误占 71.4%——主要就是那种"分母没有理化"的荒诞剧。修正后从 26.5% → 90.23%。
- UGPhysics:22 个送审题中 18 个是题目缺陷,模型错误只有 1 个。
2.2 基准错误大观园
论文附录 D 收录了一批令人啼笑皆非的"病题",堪称一份物理基准的事故展览:
第一类:参考答案就是错的。
HLE-Physics 有道题要求算一个双曲函数表达式。标准答案在最后的算术上栽了跟头——代数式明明对了,代入数值时算出了 −√2,正确答案应该是 2−√2。模型给出了正确答案,被判错。
PHYBench 有道相对论题目,印刷的参考表达式化简后恒等于零。模型给出了一个非零的正确答案,被判错。
第二类:题目缺条件,神仙也救不了。
PRISM-Physics 有道电子飞行时间题:问电子从发射到探测飞了多久,选项有 330ns、66ns、33ns。但题目根本没给初速度和飞行距离——什么信息都没有,参考答案是 33ns。模型回答"信息不足,无法确定"——这本来就是唯一诚实的回答。零分。
这就像问"一个苹果从树上掉下来,经过了多久?",然后标准答案是"3秒"。不知道树高、不问重力场、不许你问问题。你答"无法确定",老师判你错。
第三类:约定不清,两种约定差四倍。
CritPt 第 44 题:Kitaev 蜂巢模型在 3×2 周期晶格上,问基态简并数和基态能量。题目没说哈密顿量里的算符是 Pauli 矩阵 σ 还是自旋算符 S=σ/2。这两种约定在文献里都很常见,但算出的能量差四倍。模型可能按一种约定算对了,但参考答案用的是另一种约定。零分。
CMT-Benchmark 有一道 Ising 模型的多选题,参考答案是 (a;c),但专家修复后正确答案是 (a;b;c)——原题的 (b) 选项漏掉了 g=0 时的对称性破缺相变,连题目带答案一起错。
2.3 判分错误:规则判分器的死穴
判分错误的大头来自规则判分器(rule-based evaluators)。
PHYBench 用的是一种叫 EED(Expression Edit Distance,表达式编辑距离)的自动判分。它衡量模型答案的字符串和参考答案的字符串差多少。听起来科学,实际是个只会认字的文盲:
- T = P/(3√6) 和 T = (√6/18)P 数学上完全等价,但字符串不同 → EED = 0,判错
- 因式换个顺序、根号换个写法、等价形式变形 → 统统判错
这种判分器在模型弱的时候看不出毛病——弱模型本来就没几道题答对,判分器偶尔冤枉一道也无关紧要。但模型变强以后,正确答案越来越多,判分器的每一次"冤枉"都在系统性地压低分数。
论文里有个精确的诊断:
当模型的真实错误率低于基准的缺陷率时,分数表上的错误大多是基准的,不是模型的。
物理学家们称之为"缺陷率天花板":一个基准如果自带 30% 的病题和判分错误,那么任何模型的分数都不可能超过 70%——哪怕它是爱因斯坦。
而现在的前沿模型,真实物理水平已经越过了这条线。不是模型到了瓶颈,是尺子断了。
📈 第三章:修完考卷之后
3.1 修正成绩:从"学渣"到"准满分"
专家们干了一件费力但彻底的事:修正参考答案、修复或剔除病题、然后用修正后的基准重新评测。
结果是颠覆性的。GPT-5.6-Sol(High reasoning,带工具)的成绩单:
| 基准 | 审前分数 | 修正后 | 提升 |
|---|---|---|---|
| HLE-Physics | 47.3% | 78.7% | +31.4 |
| CMT-Benchmark | 61.0% | 87.2% | +26.2 |
| CritPt | 32.3% | 87.5% | +55.2 |
| PHYBench | 26.5% | 90.2% | +63.7 |
| PRISM-Physics | 13.0% | 94.6% | +81.6 |
| UGPhysics | 83.0% | 92.1% | +9.1 |
CritPt 的 pass@4 达到 94.4%——四道题里至少答对一次的比率。CMT-Benchmark 的 pass@4 是 97.96%。
其他两个模型也一样:Claude Fable 5 在 PHYBench 上从 39.5% 修到 87.6%,Gemini 3.1 Pro 在 CMT 上从 50.5% 修到 78.1%。
**修正的不是模型表现,是测量系统本身。**模型的物理能力从头到尾没变,变的是我们终于用了一把没有刻痕错乱的尺子。
3.2 独立交叉验证
更有意思的是,就在这篇论文收尾阶段,Anthropic 发布了 Claude Fable 5.1 / Mythos 5.1 的系统卡,里面报告了一个独立的 CritPt 修正版评测(CritPt-Corrected):用专家修正后的 31 道题,Fable 5.1 在 16 次尝试下 mean@1 达到 88.4%。
两个团队,互不知晓,用不同的修正题集、不同的模型、不同的判分方式,得出了同一个结论:修正基准后,前沿模型的物理成绩从 30 多分跳到接近 90 分。
这是科学上最令人踏实的画面之一——独立复现。
🕳️ 第四章:但是——还差最后一步
4.1 别把"解题"当成"研究"
在把香槟泼向天花板之前,作者们冷静地踩了一脚刹车。
论文坦承:在闭卷、有标准答案的物理题上接近满分,不等于能做物理学研究。
他们自己做了个实验:用 GPT 驱动的 agentic 系统(就是那种成功帮数学家攻克开放猜想——Erdős 问题、Jacobian 猜想反例、Navier-Stokes 有限时间爆破——的系统),去攻击理论物理中的几个开放问题。
结果:进展远不如数学。截至目前,没有解决任何一个开放物理问题。
这不是自相矛盾,而是一个更精细的能力图谱:
- 给定良定义的闭式问题(有唯一答案、条件完备):前沿模型接近饱和
- 开放性问题(没有已知答案、需要提出正确的问题、定义正确的框架、选择正确的假设):仍然困难
这就好比你给一个游泳冠军颁发登山奖牌。泳池里的自由泳是闭式任务——起点、终点、泳道全都画好了。真正的物理研究是开辟新泳道——连"水在哪里"都要自己找。
论文里有个形象的观察:大多数报告的失败,通过"给题目补上缺失条件"或"允许模型多试几次"就能修复。这暗示闭式物理题可能已经到了一个拐点。但研究是另一回事,需要新型基准。
4.2 为什么物理基准比代码基准更容易烂?
论文还做了一次漂亮的"跨领域考古":SWE-bench(软件工程基准)建成时有 2294 个真实 GitHub issue,每个都自带可执行测试。即便如此,后来的审计发现 138 个 Verified 任务里 59.4% 有实质性问题;SWE-bench Pro 约 30% 的任务是坏的。
每个编程任务都附带机器可以运行的测试,还能烂成这样。
物理基准呢?没有可执行测试。每道题的"正确答案"是一份手写的参考解答。没有人验证过它对不对,除非你自己重新推导一遍。那不是基准测试,那是一堆手写的答案纸,旁边没有老师。
🧠 尾声:当尺子比被量的东西先坏掉
这篇论文最终讲的,不是一个"AI 物理好强"的爽文故事,而是一个关于测量哲学的严肃寓言。
整个 AI 行业正在做一件人类历史上前所未有的实验:造出越来越强的系统,然后用考卷去量它们。但考卷是人出的,判分是人(或人的规则)定的。当系统的真实能力超过出题人的水平时,一个悖论出现了:
出题人无法判断答案的对错,因为正确答案超出了出题人的推导能力。
在 HLE-Physics 的审计中,有 86 道题被判为"基准错误"——题目有缺陷或参考答案有误。这些题不是故意出的陷阱题,而是出题人自己也不完全确定答案。当 GPT-5.6-Sol 给出了一个和参考答案不同的结果时,没有人能立刻裁决谁对——必须找领域专家重新推导。
这就是 2026 年物理基准测试的真实处境:我们已经在用量子尺量一个可能是量子的东西,但尺子上有些刻度是猜的。
论文的结论 therefore 是双重的:
- 欣慰的一面:前沿模型的物理推理能力远比主流基准显示的要强。所有"AI 物理不行"的流行叙事,在这六个基准上是测量假象。
- 警醒的一面:闭式物理题即将"考完"——模型快满分了,但这不是研究能力。行业需要新型基准:更难的、专家验证过的、面向开放问题的。做这样的基准,可能需要"数学竞赛式的公开赛制 + 大量资金 + 非营利组织运营"。
换句话说:
学生已经做到了老师出不了难题的程度。
下一步,该考的是出题能力本身。
📚 参考文献
- Ansari A., Sun H., Liu A.Z., et al. "How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks." arXiv:2609.13009, 2026.
- Center for AI Safety, Scale AI, and HLE Contributors Consortium. "A benchmark of expert-level academic questions to assess AI capabilities (HLE)." arXiv:2501.14249, 2026.
- Pan H., et al. "CMT-Benchmark: a benchmark for condensed matter theory built by expert researchers." arXiv:2510.05228, 2026.
- Zhu M., et al. "Probing the critical point (CritPt) of AI reasoning: a frontier physics research benchmark." arXiv:2509.26574, 2026.
- Qiu S., et al. "PHYBench: holistic evaluation of physical perception and reasoning in large language models." arXiv:2504.16074, 2026.
- Xu X., et al. "UGPhysics: a comprehensive benchmark for undergraduate physics reasoning with large language models." arXiv:2502.00334, 2026.
- Zhao W., et al. "PRISM-Physics: causal DAG-based process evaluation for physics reasoning." arXiv:2510.03185, 2026.
- Schwartz M.D. "Vibe physics: the AI grad student." 2026.
- Anthropic. "Claude Fable 5.1 and Claude Mythos 5.1 system card." 2026.
- Northcutt C.G., Athalye A., Mueller J. "Pervasive label errors in test sets destabilize machine learning benchmarks." arXiv:2103.14749, 2021.
#论文 #arXiv #AI #物理基准 #大模型评测 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。