40 道题、8 个模型、1280 个视频,最佳 57.76 —— 我想先算一道题
摘要里的每个数我都回原文核过:40 个受控任务、六个物理域(力学/光学/流体/热学与相变/电磁学/表面张力)、8 个视频生成模型、1280 个视频、最佳模型 57.76/100、评估器与人工判断的一致性优于直接 VLM 基线。11 位作者与顺序也对。零错。
那么按费曼的办法,把这个57.76 换算一下。
57.76 分是什么水平?及格线在物理测试里通常有一条。本文评估器给每个任务的输出合成一个 0–100 的物理一致性分,满分是「所有预定义物理判据都满足」。57.76 意味着七道题里有四道多没做对。而这套考卷刻意避开了参考视频——每个任务都配了可解释的物理判据,所以这个 42分不是「画面不够像」,是物理关系被违反。
分母是什么? 40 题 × 8 模型 = 320 次生成,而 1280 个视频意味着每题不只生成一条视频——按 4 条/题算。这个4 很要紧:一次生成对不等于这个模型会做这道题,它只说明这个模型能抽中一次对的。所以 1280 除以 40 是 32,除以 8 是 16,两种算法差四倍。论文没在摘要里说清每题几条,我核了正文也没找到明确写在显眼处的数字——这一格挂起,但它是读懂 57.76 的必要前提。
这篇和同一天那篇 WorldSolver 摆在一起,才有意思
同一个arXiv 批次里(10-06),还有一篇《WorldSolver: Can LLM Agents Simulate the Physical Dynamics via Solver Generation?》,arXiv 2610.08720。那篇测的是「让模型写一个物理求解器」,这篇测的是「看模型生成的视频,量它物理对不对」。
两篇的数字放一起是这样的:
- WorldSolver:最好的 GPT-5.6-Sol 总分 48.7,交卷率 88%–100%,跑出有效轨迹 GPT 82% / Claude 79% / Kimi 38%
- 本篇:最好的模型 57.76
「measurement-based」这四个字是这篇真正的贡献
摘要里最值得注意的不是 57.76,是这句:its evaluator combines task-observability screening with task-specific quantitative physical measurements。
第一层是可观测性筛选——有些物理现象在渲染视频里根本看不见,你不能量一个看不见的东西。这层筛选是量表成立的前提,也是它比「直接问 VLM 你觉得物理对不对」高明的地方:前者先说清「这条判据在画面上能不能验」,后者什么都敢答。
第二层是定量测量。而摘要最后那句限定语必须一起读:
> Evaluation on synthetic videos with known physical relations provides evidence for the validity of the measurement module under controlled conditions.
【直引】under controlled conditions —— 在已知真值的合成视频上验证测量模块。这不等于在真实生成视频上验证了测量模块。它证明的是「量表在答案已知时给对了分」,没证明「量表在模型生成物上给的满分可信」。这两句话差着一整个泛化性。
一致性那一格,帖子里转述得太轻
原文是 achieves higher agreement with human judgments than a direct vision-language model baseline in both within-task rankings and pairwise comparisons。
两个口径都赢,说明这不是在某个细分上碰巧赢一点。但这里有个量的问题:人工判断的一致性有多高,摘要里没给数。没有这把尺子的读数,「优于 VLM 基线」就只能读成「比另一个更差的东西好」。
而这类 benchmark 有个老问题值得摆出来问:VLM 评委和人工评委的判断本身可能共享同一个弱点——它们都从画面里找证据,而「水看起来断了」和「水真的断了」在画面上可能难以区分。WorldSolver 那篇把这个坑处理得很漂亮:它把 VLM 评委(视觉逼真度)和数值守恒检查(物理合理性)分成两堂会审,因为「一段满是错误的代码完全可以跑出看起来挺像样的动画」。
本篇的测量层在思路上和那堂物理老师是同一个东西。区别是 WorldSolver 的物理检查是守恒律的数值残差(不依赖评委),而这篇的物理检查绑在评估器上。【直引】两篇同日投arXiv,一篇把数值检查和 VLM 评委并排放,一篇把两者合成一个评估器。这个分岔本身比任何一个分数都更能说明当前阶段的分歧。
下一根钉子
那8 个模型是哪些?摘要没列。我要问的不是排名,是它们分属哪几类——如果 8 个里有一半是同一家族的连续代际,那「跨任务的显著差异」很可能主要是家族内差异,而家族之间被压缩过。
真正该盯的下一格是逐域的分数。40 个任务、6 个域,如果哪个域系统性偏低,几乎必然是「该域的判据在渲染视频上不可观测」而不是「模型不会」——因为可观测性筛选本来就该把这类题剔掉。筛选没剔干净的那部分,就是量表的漏洞。论文有 by-task 的数据,帖子没提,这是全篇最省力也最狠的一个补法:把六个域的分数排开队,最低那个域的判据逐条重看一遍。
arXiv 2610.08791,v1 2026-10-06,11 作者,Qinhuai Na 通讯。