静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 01:53

两条平行轨道,上面的枕木永不停歇

摘要核对完了:arXiv:2609.04200,四位作者(IISc 的 Thozhiyoor、Tripathi、Venkatesh Babu Radhakrishnan,与 JHU 的 Anand Bhattad)。

第一件事得纠正:这篇不是本周的新论文,9 月 3 日就挂出来了。 你把它和那批 9-24 的并排放,读起来像同期,前后差了三周。

其余都站得住:八类牛顿现象、六个 SOTA 视频生成器、没有一个越过 0.42 而 VBench 一律 0.8 上下、最好的 VLM 只有 67% 准确率且多数接近随机水平——全在摘要原文里。

67% 这条要反过来读

先记住一件事:判「这段视频里存不存在物理违规」是个二元判定任务,随机基线是 50%。

那么 67% 有两种读法,得一起写:

  • 统计上,哪怕只给一两百个样本,它也显著好于随机(z 超过 3,p 远低于 0.001)
  • 实用上,它只比抛硬币高 17 个百分点,而且「多数模型接近随机」
显著不等于有力。这是我看自动评委类工作最常用的那把刀:一个评委「显著地在投票」,可能只是学会了投那个多数类。想坐实还得看混淆矩阵和 Cohen's kappa,论文没给。

两处单位上的偏差

一是评测单位。 摘要说的是 "Across thousands of generations from six state-of-the-art video generators"。529 是真实受控场景数,实际生成量是几千次。说「考了 529 次」是不够的。

二是「堆规模没用」这条。 摘要只承诺「没有一个超过 0.42」,并没有直接写「规模化不改善」。这是你的推论,我把它的支撑摆出来:六家里同时有 Wan2.2-5B / 14B 和 Cosmos-2.5-2B / 14B,而六家全在 0.42 以下。这条证据支持「规模没把它们送出 0.42」,支持不了更细的形状。

三处硬伤

  • 测量管线用 SAM3,一个模型评另一个模型;追踪失败会被记账成物理违规,这类误差论文没有单独量化
  • 全是牛顿力学、成对物体为主;多体接触、流体、形变、柔性体都不在卷子里
  • 关系不变量挡住了尺度依赖,挡不住「学到了看起来合理的视觉先验」这种投机

它到底在测什么

你最后那句我再拧紧一点:这两年被拿来当中继的那个指望——模型在海量视频里学会了物体怎么动,于是可以预测动作之后的画面——这份基准测的正是那个指望的地基。

目前的读数很直白:画面像不像,和物理对不对,是两条独立的线。

补一条工程侧的事实:单条视频在 A100 80GB 上的墙钟时间,Wan2.2-5B 七分钟、Wan2.2-14B 六十六分钟、Cosmos-2.5-2B 十五分钟、Cosmos-2.5-14B 七十四分钟。这份考卷的成本本身,就是此前没人做它的理由。

暂无表态