[论文] Training Object Permanence in World Models

研究领域: CV 作者: Haotian Zhang, Fengyuan Yu, Dezhi Luo 发布时间: 2026-09-25 arXiv: 2609.28654

论文概要

研究领域: CV 作者: Haotian Zhang, Fengyuan Yu, Dezhi Luo 发布时间: 2026-09-25 arXiv: 2609.28654

中文摘要

客体永久性和实体性是人类认知先验的标志。近期研究表明,视频生成模型——当前世界模型的范式代表——已开始展现涌现的推理能力,使其成为构建类人物理智能的理想候选。视频模型是否拥有涌现的客体永久性?我们引入WROP(客体永久性世界推理),一个包含150个手工设计的认知科学启发任务的数据基础设施,分为六个认知类别。我们构建Blender生成器,在保持每个任务认知结构的同时随机化速度、光照、相机角度等干扰参数,每个任务产生超10,000个样本,发布150万样本训练语料库和300题考试。在考试上评估14个视频模型,包括我们的16B世界模型PWM-WROP。在盲测成对Elo研究中,PWM-WROP在延续模型中排名第一,总排名第三。数据、考试、模型答案、分数、权重及原生PyTorch训练堆栈均已开源。

原文摘要

Object permanence and solidity are hallmarks of human cognitive priors. Recent studies show that video generation models have begun to show emerged reasoning abilities, making them ideal candidates for building human-like physical intelligence. We introduce WROP (World Reasoning with Object Permanence), a data infrastructure of 150 hand-designed cognitive science inspired tasks, divided into six cognitive categories, yielding 10,000+ samples per task.


*自动采集于 2026-09-26*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

一块挡板,一个箱子,和一个五个月大的婴儿

先说我不太想说的一件事:我按编号去查了,查到的不是这篇论文。

编号是错的,论文是真的

帖子上写 arXiv:2609.22003。这个编号指向一篇代数几何,讲四连杆耦合曲线的计数问题,跟视频模型一点关系都没有。

真身是 arXiv:2609.28654,《Training Object Permanence in World Models》。作者也不是三位,是三十位,从 USC、CMU、JHU 一路排到牛津和斯坦福,通讯是 CMU 的 Hokin Deng。

摘要逐字对上了:150 个 Blender 生成器、六类认知结构、每类一万多条样本、150 万条训练语料、300 题考试、14 个视频模型、16B 的 PWM-WROP。所以采集器贴错了编号、还把三十位作者截成了前三位。论文本身没问题。

顺带说一句:这一批十篇 [论文] 短贴我抽查了七篇,七篇的编号都指向完全不相干的论文。这是采集环节的系统性毛病,不是某一条手滑。

这个实验,婴儿在四十年前就考过了

1970 年代的心理实验室里,五个月大的婴儿坐在屏幕前。一块挡板像吊桥一样转过来,转过去,转到他看腻了。然后在挡板后面放一个箱子。

可能事件:挡板转到箱子跟前,停住。 不可能事件:挡板穿过箱子,躺平,箱子像是没了。

婴儿盯着「不可能」看的时间明显更长。Baillargeon 1985 年就做出了这个结果,1987 年把年龄压到三个月,1991 年用高矮胡萝卜又证了一次。皮亚杰说这本事要八到十二个月才有,她说五个月就有,三个月也有。

WROP 做的事,是把这套考卷原样搬给视频模型:给你前六十帧,预测后六十帧,看箱子还在不在。

但这里有个坑,坑不在模型那边

问题出在「客体永久性」这个构念自己身上。

「看更久」等于「知道」吗?Bogartz、Shinskey 和 Speaker 1997 年就说不一定,婴儿可能只是被事件的序列打断了预期。Cashon 和 Cohen 2000 年发现,八个月大的婴儿盯着看更久的,是那个「更有新鲜感」的,不是那个「物理上不可能」的。Thelen 和 Smith、Schöner 和 Thelen 也都提过类似的替代解释。

吵了四十年,没有定论。

所以当一篇论文把这个构念当成基准的金标准,它其实是先默认了一件还在吵的事。这不致命——题目本身设计得很干净,Blender 生成、随机化光照速度和机位、逐帧存了每个物体的真值轨迹——但它值得写在第一行,而不是让读者自己发现。

论文自己给了三个限定,摘要里没有

  • 分辨率:自有模型原生只有 320×192。在这个尺度上它比延续类基线强;原生高分辨率的商用参考生视频系统,仍然领先。
  • 许可:数据集是 CC BY-NC 4.0,非商用,商用要另外谈。
  • 缺答:14 个模型里有一个只答了 297 / 300 题。
「总榜第三、延续组第一」这句话是真的。它同时是「在 320×192 这个尺度上、和另外两个系统统计上并列之后」的第三。

HuggingFace 上那个数据集里躺着 4197 个 mp4,题目和原始生成都在, trajectorie 逐帧存着。这一手做得很实,谁都能去复查。

一句话收口

拿一个有争议的构念当金标准,等于先默认它没争议。

论文的工程部分我给满分:150 个生成器、真值轨迹、开源权重、开源训练栈。它真正悬着的是另一件事——我们连「婴儿知不知道箱子还在」都还没吵完,就已经拿它去考模型了。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens