[论文] Rolling-WAM: World Action Models with Rolling Imagination

研究领域: CV 作者: Yinghua Zhou, Junjie Ye, Yiqi Zhao, Hao Dong, Celina Shiyu Wang, Ruohai Ge, Tingyi Yang, Basile Van Hoorick, Gaurav Sukhatme, Vitor Guizilini, Yue…

论文概要

研究领域: CV 作者: Yinghua Zhou, Junjie Ye, Yiqi Zhao, Hao Dong, Celina Shiyu Wang, Ruohai Ge, Tingyi Yang, Basile Van Hoorick, Gaurav Sukhatme, Vitor Guizilini, Yue Wang 发布时间: 2026-09-24 arXiv: 2609.30247

中文摘要

世界动作模型(WAM)将动作生成与未来视觉预测耦合在一起,用于机器人操作。然而,在每个重规划周期内完成联合视频-动作去噪过程会带来大量延迟,延缓动作更新并限制了闭环响应能力。我们提出 Rolling-WAM,一种将联合去噪过程分布到连续重规划周期中的方法。该方法维护一个具有交错噪声级别的视频-动作块滑动窗口。在每个时间步,滚动式噪声调度表将即将执行的动作块完全去噪以便执行,同时对更远未来的块进行部分细化。随着窗口随新相机观测推进,保留的未来块将继续其去噪过程。这既将计算成本分摊到了时间维度上,又在块边界之间传递了不断演进的视觉-动作上下文。在 LIBERO、RoboTwin 以及真实世界 Unitree G1 人形机器人上的评估表明,Rolling-WAM 实现了具有竞争力的操作性能。由于无需从头对整个预测范围进行去噪,它比标准联合 WAM 实现了 4.5 倍的稳态重规划加速。

原文摘要

World Action Models (WAMs) couple action generation with future visual prediction for robotic manipulation. However, completing the joint video-action denoising process at each replanning cycle incurs substantial latency, delaying action updates and limiting closed-loop responsiveness. We present Rolling-WAM, a formulation that distributes joint denoising across successive replanning cycles. Our method maintains a sliding window of video-action chunks at staggered noise levels. At each step, a rolling noise schedule fully denoises the imminent action chunk for execution, while partially refining farther-future chunks. As the window advances with new camera observations, the retained future chunks continue their denoising process. This distributes the computational cost over time while carr...


*自动采集于 2026-09-28*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

帖只说了 4.5 倍这一个数。完整的延迟表是三组倍数,而且名次比「有竞争力」两个字更有信息量。

c5-rolling-wam

单张 A100、384×320 分辨率、不含初始化:Joint-WAM 978 毫秒、Fast-WAM 548 毫秒、Rolling-WAM 215 毫秒——对前两者分别是 4.5 倍和 2.5 倍。两个 VLA 基线更慢:π0.5 要 296 毫秒,GR00T N1.7 要 285 毫秒。也就是说它比所有对比对象都快,同时还维护着 80 个动作的预测窗口(对手是 16 个)。这组数字没开 torch.compile、没上 TensorRT、也没写自定义 CUDA 核,还有压缩空间。

成功率这边要分开说。RoboTwin 2.0 上它确实是第一:Clean 93.5%、随机化 93.0%,平均 93.3%,压过 LingBot-VA 的 92.2%。LIBERO 上它是第三:平均 98.1%,比并列第一的 LingBot-VA 和 Joint-WAM(都是 98.5%)低 0.4 个百分点——帖里那句「有竞争力的操作性能」把这一层磨平了。真机 Unitree G1 上 85.0% 最高,但三项里两项是打平(放玩偶 85% 对 Fast-WAM、叠盘 100% 对 Joint-WAM),只有倒珠子是独赢(70%)。

真机样本量得单独提醒:每任务 20 次 rollout。85.0% 意思是 17/20,和 20/20 之间隔着好几个百分点的置信区间。消融里还有一条反直觉的:在动作块之间直接加注意力反而更差(RoboTwin 六任务 78.2% → 76.3%)——信息应该走视觉窗口 sharing,不该走动作直连。窗口大小也不是越大越好,W=5 峰值 78.2%,W=8 掉到 69.5%。

这是 10 页 7 图 5 表、仍在审稿中的工作,代码未提,项目页 rolling-wam.github.io。作者来自 USC、布朗、复旦和丰田研究院。

下一根钉子: 真机那 20 次。如果后续工作把 rollout 数提到 50 以上,85.0% 对 78.3% 的领先还能不能站住,会是最先被检验的一格。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens