画面很真,物理很假:529 个真实场景给视频生成模型出的考卷
你答不了。你不知道视频的帧率,不知道画面里一像素对应现实多少厘米,不知道相机怎么摆的,不知道那个球多重。弹起高度看起来是原来的一半,可只要帧率被改过,落体时间就跟着变,重力加速度怎么算都算不准。
画面很真,物理很假:529 个真实场景给视频生成模型出的考卷
先看一个判断不了的问题
一段两秒的视频,一个球从高处落下、砸到地面、弹起来一半高。问它物理对不对。
你答不了。你不知道视频的帧率,不知道画面里一像素对应现实多少厘米,不知道相机怎么摆的,不知道那个球多重。弹起高度看起来是原来的一半,可只要帧率被改过,落体时间就跟着变,重力加速度怎么算都算不准。
这是评测视频生成模型物理正确性时撞上的第一堵墙。
绕墙的办法:不测绝对值,测关系
来自印度科学理工学院(IISc)与约翰霍普金斯大学的一组研究者想了个绕法。一段视频里放两个遵守同一条定律的物体,只看它们之间的关系。
两个质量不同的方块,放在两条完全一样的斜面上,必须同时滑到底端。这条判据不依赖尺度,不依赖相机标定,不依赖帧率。它只要求模型让两个物体遵守同一条规律。
这个方法叫 Principia,论文挂在 arXiv:2609.04200,项目页公开。
考卷长什么样
八类牛顿力学现象进了卷子:重力、恢复系数、摩擦、转动惯量、抛体运动、动量、单摆、质量弹簧振荡。
数据是自己拍的。401 个真实受控场景,每个取首帧配上文本提示作为生成条件。首帧先过一遍图像编辑模型,把做实验的人和器材抹掉,再做增强增广,最终 529 个场景。原始素材大约七百五十多个视频。
分数怎么打出来的
物体位置靠 SAM3 逐帧追踪质心或底边。落地的判据是质心越过地面阈值且竖直速度由正转负;回弹最高点是竖直速度由负转正的那一帧。单摆的周期从摆锤轨迹估,半周期是摆锤越过锚线后水平速度反向的位置,翻倍得全周期。方块质量按边长立方估,假定密度恒定。
打分量分两步。先用方向一致性分数把连基本运动方向都搞反的视频滤掉,再算连续的关系一致性得分。
结果:0.8 与 0.42 是两条平行线
论文附录列了六个被评的生成模型:Wan2.2-5B、Wan2.2-14B、Cosmos-2.5-2B、Cosmos-2.5-14B、Veo-3.1、Omni。有一条资讯聚合写的是五个模型,以论文附录为准。
VBench 是通用的视频生成质量基准,六个模型都拿到 0.8 上下。Principia 上没有一个超过 0.42。论文的说法是,这两个分数衡量的是不同的能力。
还有一个更扎眼的观察:把模型规模往上堆,物理一致性没有稳定提高。
VLM 也被拉来考了一次。任务是判断一段视频里有没有物理违规,再跟二元的 ground truth 对照。最好的视觉语言模型准确率只有 67%,多数模型接近随机水平,平均一致度没有超过 0.7。
这份考卷的成本
生成完整评测语料烧掉大量 A100 小时。论文附录给了单条视频的墙钟时间(A100 80GB):Wan2.2-5B 七分钟,Wan2.2-14B 六十六分钟,Cosmos-2.5-2B 十五分钟,Cosmos-2.5-14B 七十四分钟。Veo-3.1 与 Omni 走公开 API。
复现这套评测的现实成本,本身就解释了为什么此前没人做。
三条边界
第一,529 个场景、八条定律,全部是牛顿力学,且以成对物体为主。多物体交互、接触、流体、形变都不在卷子里。这个覆盖面能支持的结论是高中物理这一层没过关,推不到更远。
第二,测量管线里用了 SAM3,一个模型评另一个模型。追踪出错会被记成物理违规,这类误差论文没有单独量化。
第三,关系不变量能挡住一部分投机。模型有可能学到了看起来合理的视觉先验而不是规律本身,这个可能性没被排除。【判断】
为什么这条值得记一笔
视频生成模型这两年被当成世界模型的候选。机器人、自动驾驶、仿真环境都在指望一件事:模型在海量视频里学会了物体怎么动,就能拿来当中继,预测动作之后的画面。
这份基准测的正是这个指望的地基。画面逼真与物理一致之间,目前是两条近乎平行的线。【直引,论文结论与作者公开表述】
顺带说一句,同一周还有一项叫 TrackEverything 的工作,来自卡内基梅隆与 Meta,把计算量绑到场景里独特的三维内容上,在超过一千帧的片段里以世界坐标追踪所有点。评测侧的 tooling 正在变密,这是能开始认真讨论世界模型到底学到了什么的前提。【转述,资讯聚合,未见一手论文】
观察线
- 分数能不能被训练修上来:把关系不变量写进奖励或损失函数,0.42 能升到多少。
- 覆盖面扩展:从八条牛顿定律扩到接触、流体、柔性体,模型会不会掉得更狠。
- 追踪误差的量化:换一套追踪器,分数变不变。
- 与机器人策略的相关性:物理一致性分数高的生成器,做成世界模型之后任务成功率是不是也高。这条如果不成立,这份基准的工程价值就要打折。
- VLM 判官这条路:67% 这个上限,决定了自动评审还能不能继续用模型当裁判。
参考来源
1. Principia: Relational Physics Tests for Video Models, arXiv:2609.04200 2. principiabench.github.io 项目页 3. Anand Bhattad 在 Bluesky 的五段项目说明,2026-09-08 4. AGI Hunt 关于 Principia 的条目,2026-09 5. FutureX / AGI Hunt 关于 TrackEverything 的转述,2026-09-26(二手,未见一手论文)