第一次有人给视频生成模型出了一张「程序说了什么,你画没画出来」的对账单
这篇的切口很准。可编程世界模型把「可执行动力学」与「视觉生成」分开——引擎算规则,模型出画面。看起来很美,但没有人测过:程序规定的那些细粒度事件,模型到底画出来了没有。
我把全文读了,数字比帖子的摘要更值得说。
先说那个 600 到底是什么
摘要里的「170 个剧集 + 600 条代理视频」,很容易被读成「600 条生成视频」。不是。
- 170 个评估用例,按四个集合拆:多场景 130 + 多人 10 + 事件驱动 20 + 长时程 10。
- 200 个选中视角(173 个第三人称 86.5%,27 个第一人称 13.5%)。
- 600 条输入给模型的代理视频——200 个视角 × 3 种同步表示(粗粒度 3D、CWM proxy、Colored-OBB)。
- 130×1×3 + 10×4×3 + 20×1×3 + 10×1×3 = 390 + 120 + 60 + 30 = 600,自洽。
规格也报得很细:3 种表示共 37,500 条视角帧观测、112,500 帧代理视频,总时长 62.5 分钟。
真正的贡献:可重放世界记录
这是我认为全文最硬的东西。
同一份状态记录,可以渲染出三套同步的条件表示。于是「表示」这个变量,被从模型、数据、任务里干净地剥了出来。而且这份记录还包含视野外事件——以及离开视野之后又回来的实体。
这两件事别的 benchmark 做不到。记录是可重放的,所以「生成的视频」可以拿来跟「程序执行的可观察结果」逐条对账;不是问「画得好不好看」,而是问「该发生的那件事,在那个时间窗里发生了没有」。
指标与分数:最好的模型也只有 0.85
两个指标都是二值判定再平均,裁判是 Qwen3.6-27B:
- LRA(逻辑-渲染对齐):每个时间线段,判「规定的动作有没有出现在它的窗口里」。
- ISR(交互成功率):每个事件,判「规定动作 + 预期终态」是否同时在场。
但用 BBox IoU 加权之后(gLRA / gISR),全部掉到 0.33–0.43。 也就是说:模型大致知道该出现什么,但放在哪儿,差得远。
长时程那组更难看:30 秒全程 BBox IoU 只有 0.175–0.280;离开视野又回来的实体,重现值只有 0.053–0.131——几乎记不住。50 组方法-录制配对里,42 组低于 0.3。
论文对此很坦白:*「这些数字只指示倾向,不是稳定的排名。」*
该泼的三盆冷水(论文自己先泼了两盆)
第一盆,也是最重的一盆:判卷老师没跟人类对过答案。 论文原句:*「交互成功率、逻辑-渲染对齐和外观指标,依赖一个尚未与人类标注校准过的 VLM 裁判。」* 全文没有任何 VLM-人类一致率的百分比。它做了一个「错配时间线」的健全性检验(把时间线打乱,分数从 0.46–0.85 掉到 0.07–0.20),但那只能证明裁判看了提示词,不能证明它判得准。最好的模型 LRA 0.852,那剩下的 0.148 到底是模型没画,还是裁判没看见?分不出来。
第二盆:数据集里有一条 MiniMax-H3 的循环。 Unverified-FF 那 90 对(占主赛道七成)的场景筛选本身用 MiniMax-H3 的输出做的,所有方法的首帧也都是它生成的。而榜单前列恰恰是 LynnReal-Omni、MiniMax-H3、CWM——后两个都是 MiniMax-H3 系。论文自己写:*「涉及 MiniMax-H3 的结果,请带着这个潜在偏置来读。」*
第三盆是我加的:分数没有标尺。 全文没有人类上限,也没有引擎真值的上界数值。所以「LRA 0.852 算好还是坏」根本无从判断。另外被测的 11 个模型里,没有 Sora、Veo、Kling、Wan、HunyuanVideo——通用视频基座只测了 MiniMax-H3 与 Seedance 2.5 两家。结论的覆盖面有限。
值得肯定
- 把「程序执行的可观察后果」当成真值,这个切入点是真空白。
- 数据引擎可扩展:场景、行为、表示三者解耦;CC BY 4.0,代码仓库可访问。
- Limitations 写得比绝大多数 benchmark 论文诚实:裁判未校准、MiniMax-H3 偏置、挑战集太小(各十个录制)、位姿估计器自身就有 1.1°–2.7° 的误差——该认的账一条条列出来了。
- 指标的正交性有论证:BBox IoU 与 ISR 在场景内的 Spearman 相关只有 0.05;同时指出 CLIP-Score 跨方法只波动 4.5–5.6%,而 BBox IoU 波动 53–79%——用一个反例坐实了旧指标失效。
一句话
它第一次给视频生成模型出了一张对账单:程序写了什么,你到底画没画出来。
可重放世界记录 + 三种配对表示,是真正的方法论贡献。缺的那一把尺子,论文自己承认还没校准——判卷的是个没跟人类对过答案的裁判。这句自曝,反而让这份 benchmark 显得可信。