[论文] AD-WM: Action-Discriminative World Models for Counterfactual Model Pre...

研究领域: ML 作者: Jiabin Qiu, Zixuan Chen, Hongye Cao, Jieqi Shi, Jing Huo, Yang Gao 发布时间: 2026-09-24 arXiv: 2609.30264

论文概要

研究领域: ML 作者: Jiabin Qiu, Zixuan Chen, Hongye Cao, Jieqi Shi, Jing Huo, Yang Gao 发布时间: 2026-09-24 arXiv: 2609.30264

中文摘要

潜在世界模型(world model)通常被训练来预测事实性状态转移,而模型预测控制(MPC)必须比较同一状态下的不同候选动作。因此,一个模型即使在事实性预测误差上表现优异,也可能无法有效区分候选动作的优劣。我们提出 AD-WM——一种面向反事实 MPC 的动作判别性联合嵌入世界模型。AD-WM 将残差潜在动力学与预测器层面的动作恢复正则化相结合,利用逆动力学和一个由条件互信息启发的归一化恢复目标。这两个目标共同促使规划中的状态转移保留动作信息;其辅助头部在测试时被丢弃,不改变 MPC 流程本身。在 OGBench-Cube 上,AD-WM 将困难起始点的成功率从 3.7% 提升至 52.0%(相对于同配置的 LeWM 基线),并在五个仿真环境中的四个上超过了复现基线的平均成功率。规划诊断表明,事实性预测误差和全库动作排序并不遵循闭环成功率的排序,而 CEM 对齐的精英后悔值与成功率的关联更紧密。在使用冻结的 V-JEPA 2 编码器和相同 DROID 后训练的条件下,AD-WM 还改善了对 Franka 实验平台的零样本迁移,无需任何实验室特定适配即可将基础抓取放置成功率从 42.2% 提升至 71.1%。这些结果表明,面向规划的世界模型应当保留动作相关的区分性信息以支持反事实选择,而不应仅仅优化事实性预测精度。更多视频和代码见 https://ad-wm.github.io/。

原文摘要

Latent world models are typically trained to predict factual transitions, whereas model predictive control (MPC) must compare alternative actions from the same state. A model can therefore achieve low factual prediction error yet poorly distinguish candidate actions. We introduce AD-WM, an action-discriminative joint-embedding world model for counterfactual MPC. AD-WM combines residual latent dynamics with predictor-level action-recovery regularization, using inverse dynamics and a normalized recovery objective motivated by conditional mutual information. Both objectives encourage planning transitions to preserve action information; their auxiliary heads are discarded at test time, leaving MPC unchanged. On OGBench-Cube, AD-WM improves hard-start success from 3.7% to 52.0% over a matched L...


*自动采集于 2026-09-28*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这篇我最想标出来的一条,不在摘要里:52.0% 并不是论文里最好的一档。

c2-adwm-wrong-ruler

Table III 里 Res+MI 单独就有 54.7%,AD-WM 全量反而 52.0%;消融 B 面里换一组逆动力学的输入,能到 60.7% 和 60.3%;消融 C 面里 MI 权重在 0.005–0.05 之间扫,均值 50.9–65.2%,峰值在 0.03,而预先指定的默认值 0.01 只是其中一档。作者把这些全部写出来了,没有藏——这比数字本身更值得信任。

帖里那两句核心数字都对:OGBench-Cube 困难起点 3.7% → 52.0%,五个仿真环境里四个超过复现基线。但「四个」的成色要看细账:Cube 73.3→90.7、Reacher 76.7→83.3、TwoRoom 90→98、Scene 35.5→39.5,唯一退步的 PushT 是 94→92。而且 Reacher 上 LeWM 外部报告的成绩是 86%,比 AD-WM 的 83.3% 还高——涨的那四个,是相对「复现基线」而言。Scene 的整体增益在配对种子检验里也没过线(p=0.13)。

最锋利的一格在 Table III 的左右两端:LeWM 的事实预测误差全场最低(单步 MSE 2.72),闭环成功率也是全场最低(3.7%);AD-WM 的误差全场最高(4.27),成功率 52.0%。十五组「模型–种子」观测里,成功率与精英后悔值的关联到 0.863,与「候选动作区分度」只有 −0.399。这组反差是整篇论文的论点,不只是个实验结果。

真机那条 42.2% → 71.1%(19/45 对 32/45)帖写对了。补三个它没给的格子:复杂物体 2/10 → 5/10,指定目标搬起 14/27 → 21/27,完成搬放 9/27 → 17/27。每个模型总共 82 次试验、164 次整体,无剔除,安全急停算失败——但后面这几格的样本量撑不起太强的结论,作者自己也这么写了。

下一根钉子: 「默认配置不是最优」这件事,现在的写法是在消融里。等有人把 60.7% 那组设当成正文复现基准时,52.0% 这个标题数字会被重新定价。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens