[论文] PointZero: 3D Point Track Completion for Learning Transferable 3D Dyna...

研究领域: CV 作者: Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung, Bowen Wen, Stan Birchfield, Yunzhu Li, Deva Ramanan, Jeffrey Ichnowski 发布时间: 2026-09-16 arXiv…

论文概要

研究领域: CV 作者: Bardienus P. Duisterhof, Kaifeng Zhang, Adam Hung, Bowen Wen, Stan Birchfield, Yunzhu Li, Deva Ramanan, Jeffrey Ichnowski 发布时间: 2026-09-16 arXiv: 2609.19142

中文摘要

世界模型赋予感知系统预测场景在交互下如何演化的能力。当在多样化的大规模数据上训练时,它们最有价值——可为下游应用注入丰富的先验。现有方法通常需要机器人动作标签来学习动作条件化的 3D 动态,这排除了网页视频数据作为训练来源。我们研究以 3D 点轨迹补全作为预训练目标,在没有机器人数据的情况下学习可迁移的 3D 动态:给定单个 RGB-D 观测和稀疏的部分 3D 轨迹,预测所有观测点的未来 3D 轨迹。我们表明该目标产生丰富的 3D 动态先验,且无需机器人动作标签。我们贡献了一个含 290 万帧合成数据的多样化数据集,涵盖可变形、关节与刚体物体,并据此训练 PointZero。这一灵活而富有表达力的 transformer 在相同数据上优于先前方法。我们通过两个下游应用展示预训练目标的效用:(1)动作条件化的 3D 动态预测;(2)模仿学习。微调以条件化于末端执行器位姿时,PointZero 在最新的 PGND 3D 动态基准上优于基线;微调以联合预测机器人动作与 3D 轨迹时,在 6/7 个模拟与真实机器人操作任务上优于或持平基线。我们还评估了从零训练 PointZero,以区分所提架构与预训练目标及数据集各自的贡献。数据集、检查点与完整训练方案均已发布。

原文摘要

World models endow perceptual systems with the ability to predict how scenes evolve under interaction. They are most beneficial when trained on diverse volumes of data, to instill a rich prior into downstream applications. Existing methods typically require robot action labels to learn action-conditioned 3D dynamics, which excludes web video data from the training pool. We study 3D point track completion as a pre-training objective for learning transferable 3D dynamics without robot data. Given a single RGB-D observation and sparse partial 3D trajectories (tracks), we predict future 3D tracks of all observed points. We show this objective produces a rich 3D dynamics prior, without requiring robot action labels. We contribute a diverse dataset of 2.9 million synthetic frames spanning deform...


*自动采集于 2026-09-18*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens