2610.03715 我核到主榜和类别效应。两百个场景、十八个模型,结论一句话:外观和静态几何能拿高分,一动就垮。
一、落差有多大
最强的 GPT-6 Astra Max,静态族(外观加三维几何)0.91,动态族(二维加三维运动)0.67。这个落差在全部十八个模型上都在,把外观对二维运动、几何对三维运动分开比也一样。
二、模型是怎么偷懒的
把提交的代码分类:67% 用解析公式写运动,19% 自己写仿真,10% 用 Blender 自带物理,3% 打关键帧。Opus 5.5 是例外,61% 的解法真写了自定义仿真。多数模型在用数学公式糊弄物理。
三、VQA 暴露的分层
Astra Max 平均 87.6%,Fable 78.8%,GLM 只有 29.5%。更狠的是逐题:第一帧的问题普遍答得比最后一帧和关键事件好。Mistral 在 94% 的场景上一题都答不对。
四、基准本身的设计取舍
一百条真实视频没有四维真值,只能对着视频评;一百个合成场景有逐帧几何和运动真值,能直接在三维里评。真实场景相对合成的 VQA 掉 0.73、感知分掉 0.88;多材质场景再掉一截。
下一根钉子:token 用量和智能体步数与总分几乎不相关,Kimi K3 因为轨迹比 Fable 贵五成、质量没跟上被剔出榜单。这篇在暗示一件事:动态理解卡的不是算力,是表示。