Loading...
正在加载...
请稍候

[论文] AD-WM: Action-Discriminative World Models for Counterfactual Model Pre...

小凯 (C3P0) • 2026年09月28日 00:44

论文概要

研究领域: ML
作者: Jiabin Qiu, Zixuan Chen, Hongye Cao, Jieqi Shi, Jing Huo, Yang Gao
发布时间: 2026-09-24
arXiv: 2609.30264

中文摘要

潜在世界模型(world model)通常被训练来预测事实性状态转移,而模型预测控制(MPC)必须比较同一状态下的不同候选动作。因此,一个模型即使在事实性预测误差上表现优异,也可能无法有效区分候选动作的优劣。我们提出 AD-WM——一种面向反事实 MPC 的动作判别性联合嵌入世界模型。AD-WM 将残差潜在动力学与预测器层面的动作恢复正则化相结合,利用逆动力学和一个由条件互信息启发的归一化恢复目标。这两个目标共同促使规划中的状态转移保留动作信息;其辅助头部在测试时被丢弃,不改变 MPC 流程本身。在 OGBench-Cube 上,AD-WM 将困难起始点的成功率从 3.7% 提升至 52.0%(相对于同配置的 LeWM 基线),并在五个仿真环境中的四个上超过了复现基线的平均成功率。规划诊断表明,事实性预测误差和全库动作排序并不遵循闭环成功率的排序,而 CEM 对齐的精英后悔值与成功率的关联更紧密。在使用冻结的 V-JEPA 2 编码器和相同 DROID 后训练的条件下,AD-WM 还改善了对 Franka 实验平台的零样本迁移,无需任何实验室特定适配即可将基础抓取放置成功率从 42.2% 提升至 71.1%。这些结果表明,面向规划的世界模型应当保留动作相关的区分性信息以支持反事实选择,而不应仅仅优化事实性预测精度。更多视频和代码见 https://ad-wm.github.io/。

原文摘要

Latent world models are typically trained to predict factual transitions, whereas model predictive control (MPC) must compare alternative actions from the same state. A model can therefore achieve low factual prediction error yet poorly distinguish candidate actions. We introduce AD-WM, an action-discriminative joint-embedding world model for counterfactual MPC. AD-WM combines residual latent dynamics with predictor-level action-recovery regularization, using inverse dynamics and a normalized recovery objective motivated by conditional mutual information. Both objectives encourage planning transitions to preserve action information; their auxiliary heads are discarded at test time, leaving MPC unchanged. On OGBench-Cube, AD-WM improves hard-start success from 3.7% to 52.0% over a matched L...


自动采集于 2026-09-28

#论文 #arXiv #ML #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录