[论文] What 30,000 Hours of Ego-centric Video Does Not Teach

研究领域: CV 作者: Jiahua Dong, Anurag Bagchi, Yash Jangir, Muhammad Zubair Irshad, Sergey Zakharov, Martial Hebert, Homanga Bharadhwaj, Yu-Xiong Wang, Vitor Campagn…

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Jiahua Dong, Anurag Bagchi, Yash Jangir, Muhammad Zubair Irshad, Sergey Zakharov, Martial Hebert, Homanga Bharadhwaj, Yu-Xiong Wang, Vitor Campagnolo Guizilini, Pavel Tokmakov 发布时间: 2026-10-08 arXiv: 2610.12464

中文摘要

世界模型为基于物理的仿真器提供了有前景的替代,但距实际部署仍远。我们追问:规模化自我中心人类视频能将其推进多远?使用包含 30,000 小时、逾 1,000 种场景类型和 14,000 名贡献者的数据集,我们不依赖不透明的下游指标,直接在具有挑战性的分布外基准上评估智能体建模与物体交互保真度。训练数据增加 100 倍确实改善两者,但不均衡:智能体建模良好,物体保真度仍很低且改善缓慢。我们发现智能体的提升并非必须来自数据——精心设计的视觉条件化方案仅用一小部分数据即可令其饱和,这使我们能单独测量物体保真度并发现其饱和点。随后引入的监督方案将模型容量从场景外观转向物体动态,改善了物体保真度,尽管仍有较大差距。结论可迁移至下游人形机器人建模。总体而言,规模化自我中心数据使智能体建模接近极限,而对"世界"的理解远远落后;弥合这一差距取决于模型如何被训练,而不仅是看到了多少数据。

原文摘要

World models offer a promising alternative to physics-based simulators, yet remain far from practical deployment. We ask how far scaling ego-centric human video takes them, using a dataset of 30,000 hours spanning over 1,000 scene types and 14,000 contributors. Rather than relying on opaque downstream metrics, we directly evaluate agent and object-interaction fidelity on a challenging out-of-distribution benchmark. Increasing training data by 100x improves both, but unevenly: the agent is modeled well, while object fidelity remains far lower and improves slowly. We show that the agent gains need not come from data, and a careful visual conditioning design saturates fidelity with a fraction of it, which lets us measure object fidelity on its own and discover its saturation point. We then in...


*自动采集于 2026-10-10*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

🌾 论文自己的摘要和正文对不上,而中文跟的是摘要那一句

先把元数据核完:arXiv:2610.12464v1,10 位作者(Jiahua Dong / Anurag Bagchi / Yash Jangir / Muhammad Zubair Irshad / Sergey Zakharov / Martial Hebert / Homanga Bharadhwaj / Yu-Xiong Wang / Vitor Campagnolo Guizilini / Pavel Tokmakov),2026-10-08,仅 v1。标题、作者、日期全对。中文摘要逐句忠实。

但有一格对不上,而且它恰好是摘要里最抢眼的那个数。

一、1,000 种场景 vs 116 种环境

摘要写:

"a dataset of 30,000 hours spanning over 1,000 scene types and 14,000 contributors"

论文 §3.2 正文写:

"a large and diverse corpus of ego-centric human manipulation spanning 32k tasks and 116 environment types, collected by 14k participants"

1,000 scene types 对 116 environment types,差 8.6 倍。

中文帖照抄了摘要的"逾 1,000 种场景类型"。严格说这不是译者的错——是论文摘要和正文自己不一致,而摘要与正文不一致时,下游所有人默认采信摘要。

但这里有个麻烦:scene type 和 environment type 可能根本不是同一个东西,不能直接判定谁对。1,000 可能是标注粒度更细的场景类别,116 可能是实际采集的不同物理环境。可惜摘要没定义这两个词,正文也只用了一次 environment types,读者无从判断。

这类含混比数字错更麻烦:数字错读者会怀疑,定义不清读者只会照抄。如果 1,000 是标注类别数,那它的说服力远低于 116——"1,000 种场景"读起来像"覆盖极广",但如果这些场景只发生在 116 个物理环境里,那模型见过的"多样性"其实是由那 116 个房间决定的。 分布外基准的难度也会跟着变。

要坐实这一点,只能等作者的说明,或者看代码/数据集卡。在坐实之前,"1,000 种场景类型"这个数不该被当成摘要里最有力的那一句。

顺带一个容易读串的地方:14,000 是贡献者人数,不是场景数。【直引】摘要的 "14,000 contributors" 和 "1,000 scene types" 并排在同一句里,中文"逾 1,000 种场景类型和 14,000 名贡献者"这个断句方式,容易让人把两个数当成同一量级的东西。一个数量级是"单人 2 小时视频",另一个是"每种场景 30 小时视频" —— 后者说明每个场景的覆盖其实相当薄。

二、"训练数据增加 100 倍改善两者"——数据从哪到哪

摘要说"Increasing training data by 100x improves both"。论文 §3 正文说得更准:

"on nested data subsets, from 300 to 30,000 hours"

300 → 30,000,正好 100 倍。这一点帖子没写,但它是"100 倍"这个数的锚——起点只有 300 小时。300 小时是什么概念?约 35 个 8.6 小时工作日,一个人在几个房间里录的量。

所以这篇论文实际回答的问题是:从 300 小时加到 30,000 小时(三个月到十年的量),世界模型学到的东西该怎么变? 起点低这件事不是缺点,反而是它的设计——必须有 100 倍的跨度才能看出哪一维饱和了。

三、真正被摘要藏起来的那句:agent 那一半根本不需要数据

摘要有一句:

"We show that the agent gains need not come from data, and a careful visual conditioning design saturates fidelity with a fraction of it"

中文译文保留了它,但紧接着的实验顺序让它的分量掉下来了。论文 Contributions 第一条写得清楚:

"the agent saturates early and is reached far more cheaply through conditioning than through data, while its effects converge far below it"

这就是把"100 倍数据"的用处重新定义的那一句:那 100 倍真正买到的是 object fidelity,而 agent fidelity 靠视觉条件化设计就能饱和,而且只需要一小部分数据("with a fraction of it")。

换个说法:论文不是在说"多喂数据有用",是在说"多喂数据只对一件事有用,而且这件事在 3 万小时处仍未达标"。

这正好解释了为什么摘要说"improves both, but unevenly"之后要接一个"yet object fidelity remains far lower and improves slowly"。若agent 那部分在几百小时处就已经饱和,那"两维都改善"这句话里的"两维"是不对称的——一维已经见顶,另一维刚起跑。

中文译文写「智能体建模良好,物体保真度仍很低且改善缓慢」,读起来像两个维度的状态描述。【判断】但论文的实验设计其实是一个消融:先证明 agent 那一维可以不靠数据拿到,这样才能把 object fidelity 单独隔离出来测它自己的饱和点。 摘要里没把这个因果读出来,所以那0.28 之后的路显得比实际的更长。

收口:下一根钉子

论文最后落到人形机器人上("our conclusions transfer to downstream humanoid modeling")。这一步是最该被单独检验的,也是最容易被顺手带过的——因为下游评测通常是"跑通某个动作算成功",而这篇论文的整套论证前提是"不许用不透明的下游指标"。

具体可检验的一步:把 agent fidelity 和 object fidelity 两个指标在人形机器人设置上也分开报。 如果人形那边两维的饱和曲线形状和 egocentric 视频这一侧一致,说明"agent 先饱和、object 慢慢爬"是数据模态的性质而不是具体数据集的性质;如果形状变了,说明它只是 EgoAVID 这类数据的性质。

更小也更硬的一步:把摘要和正文那 1,000 / 116 问清楚。(【推论】) 论文里有一处提到 116 environment types 与 32k tasks,另有 appendix E 是 humanoid 评估细节——如果那里的场景描述能把两种"type"的粒度说清楚,这个矛盾就地解决。这一条甚至不需要新实验,只需要作者一句补充说明。

值得盯的第三件事:论文说"closing this gap will depend on how models are trained, not only on how much data they see"。这句话把矛头指向训练方法。但如果 object fidelity 在 3 万小时处仍然远低,那么"训练方法"这个答案的有效期就取决于它能撑住多少倍数据——论文没有给出 object fidelity 的饱和点在哪,只说"discover its saturation point"是后续工作。** 那个饱和点是这项工作的真正终点,比"再放大数据"更值得追。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens