[论文] Rethinking Representations for World-Action Modeling

研究领域: CV 作者: Haoyi Jiang, Liu Liu, Xinjiang Wang, Zhihao Sun, Zequn Chen, Sen Wang, Xinjie Wang, Xia Chen, Jingfeng Yao, Weiheng Zhao, Shanglin Yuan, Zhizhong…

论文概要

研究领域: CV 作者: Haoyi Jiang, Liu Liu, Xinjiang Wang, Zhihao Sun, Zequn Chen, Sen Wang, Xinjie Wang, Xia Chen, Jingfeng Yao, Weiheng Zhao, Shanglin Yuan, Zhizhong Su, Wei Sui, Wenyu Liu, Xinggang Wang 发布时间: 2026-09-29 arXiv: 2609.38163

中文摘要

世界-动作模型(World-action model)联合学习机器人策略和预测未来观测,使表示空间成为控制与预测之间的接口。我们通过受控对比研究该空间的设计,发现重建保真度和预训练感知特征都不能单独保证有效的策略学习。这些发现推动了ReWAM——一个以表示为中心的世界-动作模型,构建于预训练DINO特征之上。特征校准和时间表示瓶颈将这些特征组织为适合动力学建模的紧凑世界状态。动作锚定表示整形仅将动作损失梯度路由到瓶颈,从而让策略塑造表示编码的内容,同时世界模型学习其演化方式。无需生成视频预训练,ReWAM在RoboTwin 2.0上实现了93.6%的成功率。在RoboDojo上,使用约600小时的具身预训练数据,实现了平均12.29分和8.28%的成功率。

原文摘要

World-action models jointly learn robot policies and predict future observations, making the representation space an interface between control and prediction. We study the design of this space through controlled comparisons, finding that neither reconstruction fidelity nor pre-trained perceptual features alone ensure effective policy learning. These findings motivate ReWAM, a representation-centric world-action model built on pre-trained DINO features. Feature Calibration and a Temporal Representation Bottleneck organize these features into compact world states suited to dynamics modeling. Action-Grounded Representation Shaping routes only action-loss gradients to the bottleneck, thereby letting the policy shape what the representation encodes while the world model learns how it evolves. W...


*自动采集于 2026-10-01*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

93.6% 是并列第一,clean 上只领先 0.2 分;8.28% 是榜眼,而且对手用了 20 倍数据。

先说真贡献,这条被帖子埋掉了。表 3 里 Fast-WAM 去掉生成式视频预训练之后,从 87.78/86.43 掉到 66.10/62.32;ReWAM 不带这项预训练却有 93.6%。等于用更少的先验打赢了带视频预训练的系统。这个对照做得干净。§1、§4.3 还有一条更硬的证据:DINO 特征的 SSIM 0.70 低于 Video-VAE 的 0.91,成功率反高 4.90/9.22 分——"重建保真度不等于策略学习"这句话,在表 4 里是有数的(DINO 重建 codec 85.58/86.08 vs RGB codec 71.04/70.48)。

但两个数字的读法都得改。

  • 93.6% 的领先极小。 表 1 里最强对手 AHA-WAM 是 93.4/92.2(均值 92.8)。ReWAM 只在 clean +0.2、random +1.4。50 个任务 × 每任务 100 episode 平均下来,任务级标准误约 0.7 分——clean 上那 +0.2 完全在噪声里。说"并列第一"比说"SOTA"贴切。
  • 8.28% 不是第一。 表 2 具身预训练组里 HyVLA-0.5 是 13.07 分 / 8.80%,两项都更高;Spatial Forcing 12.38 分也高于 12.29。论文自己只宣称"Generalization 最高、Long-Horizon SR 最高"(14.65/10.50 与 16.25),这是属实的。而 8.28% 的绝对值低,是因为 RoboDojo 本身极难,全表最好方法也不到 9%——所以它是接近榜首,不是"很差"。帖子两个方向都读歪了。
  • 数据量不对等。 表 8 里 π0/π0.5/HyVLA-0.5 是 10,000+ 小时,LingBot-VLA 约 20,000 小时;ReWAM 自报约 600 小时。唯一对等的是 Fast-WAM\*(同为 600 小时,表 2 注),结果是 12.29/8.28 vs 10.95/6.80,增益 +1.34 分 / +1.48 分。要引用就引用这个数据效率,别引用那个看上去更大的 8.28%。
  • 消融阶梯到不了 93.6%。 表 3–6 全是 1 epoch 预算(§4.1),AGRS 最好 90.70/89.12;主表那个 93.6 是 5 epoch。差的约 2.9 分来自训练量,不是方法。
帖子没提的:Memory 被 HyVLA 明显甩开(9.05 vs 13.37),Open 指令跟随 0.25 几乎垫底(π0.5 是 1.98),论文自己归因于缺生成式视频预训练。真机只有 3 个任务 ×20 次 = 60 次,55 vs 48,两比例检验 z≈1.86、p≈0.06,未达显著——而且全部优势来自 Fold Clothes +3 次与 Unpack Lunchbox +4 次,Collect Objects 是 20/20 打平。另外全文没有 limitation 章、没有随机种子、没有标准差,RoboDojo 的评估 episode 数没给,也没有推理延迟和 FLOPs——冻结 DINOv3 ViT-L/16 加 3.58B 双 DiT 的部署代价没有被计量。

可复算:表 3 累计 3.92+1.41+6.87=12.20 分,与 §1 一致;表 4 的 AGRS 减无 TRB 得 +6.80/+6.09,也对得上。但表 6 出现反直觉结果:AGRS 在 dim 128(90.70)优于 dim 512(89.08),而 64 维也有 89.90——维度扫描的波动(1.6 分)已经接近它宣称的消融增益量级。

一句话:值得引的是"600 小时对上两万小时"和表 3 那条"无视频预训练反超有视频预训练",不是 93.6% 和 8.28% 这两个看起来最大的数。

+0.2 分,和两个不等于第一的第一

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens