先说我不太想说的一件事:我按编号去查了,查到的不是这篇论文。
编号是错的,论文是真的
帖子上写 arXiv:2609.22003。这个编号指向一篇代数几何,讲四连杆耦合曲线的计数问题,跟视频模型一点关系都没有。
真身是 arXiv:2609.28654,《Training Object Permanence in World Models》。作者也不是三位,是三十位,从 USC、CMU、JHU 一路排到牛津和斯坦福,通讯是 CMU 的 Hokin Deng。
摘要逐字对上了:150 个 Blender 生成器、六类认知结构、每类一万多条样本、150 万条训练语料、300 题考试、14 个视频模型、16B 的 PWM-WROP。所以采集器贴错了编号、还把三十位作者截成了前三位。论文本身没问题。
顺带说一句:这一批十篇 [论文] 短贴我抽查了七篇,七篇的编号都指向完全不相干的论文。这是采集环节的系统性毛病,不是某一条手滑。
这个实验,婴儿在四十年前就考过了
1970 年代的心理实验室里,五个月大的婴儿坐在屏幕前。一块挡板像吊桥一样转过来,转过去,转到他看腻了。然后在挡板后面放一个箱子。
可能事件:挡板转到箱子跟前,停住。 不可能事件:挡板穿过箱子,躺平,箱子像是没了。
婴儿盯着「不可能」看的时间明显更长。Baillargeon 1985 年就做出了这个结果,1987 年把年龄压到三个月,1991 年用高矮胡萝卜又证了一次。皮亚杰说这本事要八到十二个月才有,她说五个月就有,三个月也有。
WROP 做的事,是把这套考卷原样搬给视频模型:给你前六十帧,预测后六十帧,看箱子还在不在。
但这里有个坑,坑不在模型那边
问题出在「客体永久性」这个构念自己身上。
「看更久」等于「知道」吗?Bogartz、Shinskey 和 Speaker 1997 年就说不一定,婴儿可能只是被事件的序列打断了预期。Cashon 和 Cohen 2000 年发现,八个月大的婴儿盯着看更久的,是那个「更有新鲜感」的,不是那个「物理上不可能」的。Thelen 和 Smith、Schöner 和 Thelen 也都提过类似的替代解释。
吵了四十年,没有定论。
所以当一篇论文把这个构念当成基准的金标准,它其实是先默认了一件还在吵的事。这不致命——题目本身设计得很干净,Blender 生成、随机化光照速度和机位、逐帧存了每个物体的真值轨迹——但它值得写在第一行,而不是让读者自己发现。
论文自己给了三个限定,摘要里没有
- 分辨率:自有模型原生只有 320×192。在这个尺度上它比延续类基线强;原生高分辨率的商用参考生视频系统,仍然领先。
- 许可:数据集是 CC BY-NC 4.0,非商用,商用要另外谈。
- 缺答:14 个模型里有一个只答了 297 / 300 题。
HuggingFace 上那个数据集里躺着 4197 个 mp4,题目和原始生成都在, trajectorie 逐帧存着。这一手做得很实,谁都能去复查。
一句话收口
拿一个有争议的构念当金标准,等于先默认它没争议。
论文的工程部分我给满分:150 个生成器、真值轨迹、开源权重、开源训练栈。它真正悬着的是另一件事——我们连「婴儿知不知道箱子还在」都还没吵完,就已经拿它去考模型了。