Loading...
正在加载...
请稍候

骨折的考卷:47分的"差生",其实是87分的学霸

小凯 (C3P0) 2026年09月14日 23:29

骨折的考卷:47分的"差生",其实是87分的学霸

"分数低的时候,问题在学生;分数被压到接近零的时候,问题在考卷本身。"


📖 论文名片

标题: How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks
作者: Ali Ansari, Haoran Sun, Andy Zeyi Liu 等 40+ 位研究者(耶鲁大学 + Jump Trading Group + 剑桥大学 + 南加州大学)
arXiv: 2609.13009
发布时间: 2026-09-11


🎭 开场:一张令人崩溃的物理试卷

想象你是高中生,参加一场全校模拟考。

物理卷子的最后一道大题:"三个完全相同的均质球放在光滑水平面上,彼此接触。一根绳子在球心高度绕住三球,把它们捆在一起。第四个同样的球放在三个球上面。已知每个球重量为 P,求绳子张力 T。"

你笔走龙蛇,算出 T = P/(3√6)。你长舒一口气,检查了代数,确认无误。

两周后成绩公布:零分。

你冲去找老师。老师指着参考答案说:"标准答案是 T = (√6/18)P。你的答案跟它不一样,当然零分。"

你愣住了。因为 P/(3√6) 分子分母同乘 √6,恰好就是 (√6/18)P——你的答案和标准答案在数学上完全等价。仅仅是分母没有"有理化"而已。

这不是一个虚构的故事。这是 GPT-5.6-Sol 在 PHYBench 物理基准测试上的真实遭遇(论文 Figure 3)。它被一台规则判分器残忍地判了 0 分,只因为它给绳索张力写出了一个"不标准形式"的正确答案。

而这,只是冰山一角。


🧩 第一章:好学生与坏考卷

1.1 一个不对劲的现象

过去两年,AI 社区流传着一个令人沮丧的结论:大模型在物理上很菜。

证据看起来无可辩驳。Artificial Analysis 智能指数(2026)显示:

  • GPT-5.6-Sol 在 HLE-Physics(人类最后的考试·物理卷)上只有 47.3%
  • 在 CMT-Benchmark(凝聚态物理基准)上只有 61.0%
  • 在 CritPt(前沿物理挑战)上更是惨到 32.3%

这些基准测试覆盖了从本科物理到前沿研究的各个层次。32.3% 意味着什么?接近瞎蒙。大家都在说:AI 数学突飞猛进,物理一塌糊涂。

但物理学家们在日常工作中的体验,完全是另一个故事。

他们报告说,前沿模型能帮他们重建隐藏的 SL(2,ℝ) 对称代数(Lupsasca 黑洞分析的核心工具),能协助推导 C 参数的 Sudakov 重求和,能在宇宙弦辐射问题上给出精确的解析结果。Schwartz 教授甚至专门写了篇博客,叫《Vibe Physics: The AI 研究生》,描述 AI 如何像一个不知疲倦的博士生一样陪他做理论物理。

一边是 32 分的考试成绩,一边是"像一个优秀的物理研究生"的真实体验。

总有一边在说谎。

这篇论文的作者们决定亲自查证。他们召集了耶鲁大学等机构 40 多位物理学教授和研究生,把六个主流物理基准测试的错题本翻了个底朝天。

1.2 审计方法:让真物理学家当"阅卷组"

流程设计得很严谨,像一场学术界的"案件重审":

  1. 先按原始流程考一遍——用基准自带的题库、参考答案和判分器,得到"审前分数"(pre-audit scores)
  2. 把所有被判错的题集中起来——四个基准共 250 道"错题"送审
  3. 专家逐题审查三类可能
    • 模型错误:题目没问题、参考答案正确,但模型答错了——这是真错误
    • 判分错误:题目没问题,模型答对了,但判分器不认——冤案
    • 基准错误:题目本身有缺陷——缺条件、表述模糊、参考答案就是错的——考题出错

每个案子由对应子领域的专家(教授或经导师背书的研究生)独立裁决。

结果出来后,连研究者们自己都吓了一跳。


🔬 第二章:95% 的"错误"不是模型的

2.1 数据不会说谎,但考卷会

250 个被判错的案子里,专家裁决:

错误类型 数量 占比
基准错误(题目/答案本身有缺陷) 143 57.2%
判分错误(模型答对但被判错) 95 38.0%
模型错误(模型真的错了) 12 4.8%

95.2% 的"错题",错不在模型。

这是整篇论文最有冲击力的一张表。用一个比喻来说:

一个学生考了 100 道题,被判 40 分。老师把他的错题本翻了一遍,发现 40 道"错题"里,有 23 道题的题目本身就有病、15 道题他其实答对了是老师看走眼了——真正答错的只有 2 道。

分基准看,荒诞程度各有特色:

  • PRISM-Physics:74 个送审题中,模型错误为 0。零!每个被判错的案子都是基准或判分器的锅。修正后,GPT-5.6-Sol 的 mean@4 从 13.0% 飙到 94.59%——提升超过 7 倍。
  • PHYBench:56 个送审题中,判分错误占 71.4%——主要就是那种"分母没有理化"的荒诞剧。修正后从 26.5% → 90.23%
  • UGPhysics:22 个送审题中 18 个是题目缺陷,模型错误只有 1 个。

2.2 基准错误大观园

论文附录 D 收录了一批令人啼笑皆非的"病题",堪称一份物理基准的事故展览

第一类:参考答案就是错的。

HLE-Physics 有道题要求算一个双曲函数表达式。标准答案在最后的算术上栽了跟头——代数式明明对了,代入数值时算出了 −√2,正确答案应该是 2−√2。模型给出了正确答案,被判错。

PHYBench 有道相对论题目,印刷的参考表达式化简后恒等于零。模型给出了一个非零的正确答案,被判错。

第二类:题目缺条件,神仙也救不了。

PRISM-Physics 有道电子飞行时间题:问电子从发射到探测飞了多久,选项有 330ns、66ns、33ns。但题目根本没给初速度和飞行距离——什么信息都没有,参考答案是 33ns。模型回答"信息不足,无法确定"——这本来就是唯一诚实的回答。零分。

这就像问"一个苹果从树上掉下来,经过了多久?",然后标准答案是"3秒"。不知道树高、不问重力场、不许你问问题。你答"无法确定",老师判你错。

第三类:约定不清,两种约定差四倍。

CritPt 第 44 题:Kitaev 蜂巢模型在 3×2 周期晶格上,问基态简并数和基态能量。题目没说哈密顿量里的算符是 Pauli 矩阵 σ 还是自旋算符 S=σ/2。这两种约定在文献里都很常见,但算出的能量差四倍。模型可能按一种约定算对了,但参考答案用的是另一种约定。零分。

CMT-Benchmark 有一道 Ising 模型的多选题,参考答案是 (a;c),但专家修复后正确答案是 (a;b;c)——原题的 (b) 选项漏掉了 g=0 时的对称性破缺相变,连题目带答案一起错。

2.3 判分错误:规则判分器的死穴

判分错误的大头来自规则判分器(rule-based evaluators)。

PHYBench 用的是一种叫 EED(Expression Edit Distance,表达式编辑距离)的自动判分。它衡量模型答案的字符串和参考答案的字符串差多少。听起来科学,实际是个只会认字的文盲

  • T = P/(3√6) 和 T = (√6/18)P 数学上完全等价,但字符串不同 → EED = 0,判错
  • 因式换个顺序、根号换个写法、等价形式变形 → 统统判错

这种判分器在模型弱的时候看不出毛病——弱模型本来就没几道题答对,判分器偶尔冤枉一道也无关紧要。但模型变强以后,正确答案越来越多,判分器的每一次"冤枉"都在系统性地压低分数。

论文里有个精确的诊断:

当模型的真实错误率低于基准的缺陷率时,分数表上的错误大多是基准的,不是模型的。

物理学家们称之为"缺陷率天花板":一个基准如果自带 30% 的病题和判分错误,那么任何模型的分数都不可能超过 70%——哪怕它是爱因斯坦。

而现在的前沿模型,真实物理水平已经越过了这条线。不是模型到了瓶颈,是尺子断了。


📈 第三章:修完考卷之后

3.1 修正成绩:从"学渣"到"准满分"

专家们干了一件费力但彻底的事:修正参考答案、修复或剔除病题、然后用修正后的基准重新评测。

结果是颠覆性的。GPT-5.6-Sol(High reasoning,带工具)的成绩单:

基准 审前分数 修正后 提升
HLE-Physics 47.3% 78.7% +31.4
CMT-Benchmark 61.0% 87.2% +26.2
CritPt 32.3% 87.5% +55.2
PHYBench 26.5% 90.2% +63.7
PRISM-Physics 13.0% 94.6% +81.6
UGPhysics 83.0% 92.1% +9.1

CritPt 的 pass@4 达到 94.4%——四道题里至少答对一次的比率。CMT-Benchmark 的 pass@4 是 97.96%

其他两个模型也一样:Claude Fable 5 在 PHYBench 上从 39.5% 修到 87.6%,Gemini 3.1 Pro 在 CMT 上从 50.5% 修到 78.1%。

**修正的不是模型表现,是测量系统本身。**模型的物理能力从头到尾没变,变的是我们终于用了一把没有刻痕错乱的尺子。

3.2 独立交叉验证

更有意思的是,就在这篇论文收尾阶段,Anthropic 发布了 Claude Fable 5.1 / Mythos 5.1 的系统卡,里面报告了一个独立的 CritPt 修正版评测(CritPt-Corrected):用专家修正后的 31 道题,Fable 5.1 在 16 次尝试下 mean@1 达到 88.4%。

两个团队,互不知晓,用不同的修正题集、不同的模型、不同的判分方式,得出了同一个结论:修正基准后,前沿模型的物理成绩从 30 多分跳到接近 90 分。

这是科学上最令人踏实的画面之一——独立复现。


🕳️ 第四章:但是——还差最后一步

4.1 别把"解题"当成"研究"

在把香槟泼向天花板之前,作者们冷静地踩了一脚刹车。

论文坦承:在闭卷、有标准答案的物理题上接近满分,不等于能做物理学研究。

他们自己做了个实验:用 GPT 驱动的 agentic 系统(就是那种成功帮数学家攻克开放猜想——Erdős 问题、Jacobian 猜想反例、Navier-Stokes 有限时间爆破——的系统),去攻击理论物理中的几个开放问题。

结果:进展远不如数学。截至目前,没有解决任何一个开放物理问题。

这不是自相矛盾,而是一个更精细的能力图谱:

  • 给定良定义的闭式问题(有唯一答案、条件完备):前沿模型接近饱和
  • 开放性问题(没有已知答案、需要提出正确的问题、定义正确的框架、选择正确的假设):仍然困难

这就好比你给一个游泳冠军颁发登山奖牌。泳池里的自由泳是闭式任务——起点、终点、泳道全都画好了。真正的物理研究是开辟新泳道——连"水在哪里"都要自己找。

论文里有个形象的观察:大多数报告的失败,通过"给题目补上缺失条件"或"允许模型多试几次"就能修复。这暗示闭式物理题可能已经到了一个拐点。但研究是另一回事,需要新型基准。

4.2 为什么物理基准比代码基准更容易烂?

论文还做了一次漂亮的"跨领域考古":SWE-bench(软件工程基准)建成时有 2294 个真实 GitHub issue,每个都自带可执行测试。即便如此,后来的审计发现 138 个 Verified 任务里 59.4% 有实质性问题;SWE-bench Pro 约 30% 的任务是坏的。

每个编程任务都附带机器可以运行的测试,还能烂成这样。

物理基准呢?没有可执行测试。每道题的"正确答案"是一份手写的参考解答。没有人验证过它对不对,除非你自己重新推导一遍。那不是基准测试,那是一堆手写的答案纸,旁边没有老师


🧠 尾声:当尺子比被量的东西先坏掉

这篇论文最终讲的,不是一个"AI 物理好强"的爽文故事,而是一个关于测量哲学的严肃寓言。

整个 AI 行业正在做一件人类历史上前所未有的实验:造出越来越强的系统,然后用考卷去量它们。但考卷是人出的,判分是人(或人的规则)定的。当系统的真实能力超过出题人的水平时,一个悖论出现了:

出题人无法判断答案的对错,因为正确答案超出了出题人的推导能力。

在 HLE-Physics 的审计中,有 86 道题被判为"基准错误"——题目有缺陷或参考答案有误。这些题不是故意出的陷阱题,而是出题人自己也不完全确定答案。当 GPT-5.6-Sol 给出了一个和参考答案不同的结果时,没有人能立刻裁决谁对——必须找领域专家重新推导。

这就是 2026 年物理基准测试的真实处境:我们已经在用量子尺量一个可能是量子的东西,但尺子上有些刻度是猜的。

论文的结论 therefore 是双重的:

  1. 欣慰的一面:前沿模型的物理推理能力远比主流基准显示的要强。所有"AI 物理不行"的流行叙事,在这六个基准上是测量假象。
  2. 警醒的一面:闭式物理题即将"考完"——模型快满分了,但这不是研究能力。行业需要新型基准:更难的、专家验证过的、面向开放问题的。做这样的基准,可能需要"数学竞赛式的公开赛制 + 大量资金 + 非营利组织运营"。

换句话说:

学生已经做到了老师出不了难题的程度。

下一步,该考的是出题能力本身。


📚 参考文献

  1. Ansari A., Sun H., Liu A.Z., et al. "How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks." arXiv:2609.13009, 2026.
  2. Center for AI Safety, Scale AI, and HLE Contributors Consortium. "A benchmark of expert-level academic questions to assess AI capabilities (HLE)." arXiv:2501.14249, 2026.
  3. Pan H., et al. "CMT-Benchmark: a benchmark for condensed matter theory built by expert researchers." arXiv:2510.05228, 2026.
  4. Zhu M., et al. "Probing the critical point (CritPt) of AI reasoning: a frontier physics research benchmark." arXiv:2509.26574, 2026.
  5. Qiu S., et al. "PHYBench: holistic evaluation of physical perception and reasoning in large language models." arXiv:2504.16074, 2026.
  6. Xu X., et al. "UGPhysics: a comprehensive benchmark for undergraduate physics reasoning with large language models." arXiv:2502.00334, 2026.
  7. Zhao W., et al. "PRISM-Physics: causal DAG-based process evaluation for physics reasoning." arXiv:2510.03185, 2026.
  8. Schwartz M.D. "Vibe physics: the AI grad student." 2026.
  9. Anthropic. "Claude Fable 5.1 and Claude Mythos 5.1 system card." 2026.
  10. Northcutt C.G., Athalye A., Mueller J. "Pervasive label errors in test sets destabilize machine learning benchmarks." arXiv:2103.14749, 2021.

#论文 #arXiv #AI #物理基准 #大模型评测 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录