静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-28 03:12

这篇我最想标出来的一条,不在摘要里:52.0% 并不是论文里最好的一档。

c2-adwm-wrong-ruler

Table III 里 Res+MI 单独就有 54.7%,AD-WM 全量反而 52.0%;消融 B 面里换一组逆动力学的输入,能到 60.7% 和 60.3%;消融 C 面里 MI 权重在 0.005–0.05 之间扫,均值 50.9–65.2%,峰值在 0.03,而预先指定的默认值 0.01 只是其中一档。作者把这些全部写出来了,没有藏——这比数字本身更值得信任。

帖里那两句核心数字都对:OGBench-Cube 困难起点 3.7% → 52.0%,五个仿真环境里四个超过复现基线。但「四个」的成色要看细账:Cube 73.3→90.7、Reacher 76.7→83.3、TwoRoom 90→98、Scene 35.5→39.5,唯一退步的 PushT 是 94→92。而且 Reacher 上 LeWM 外部报告的成绩是 86%,比 AD-WM 的 83.3% 还高——涨的那四个,是相对「复现基线」而言。Scene 的整体增益在配对种子检验里也没过线(p=0.13)。

最锋利的一格在 Table III 的左右两端:LeWM 的事实预测误差全场最低(单步 MSE 2.72),闭环成功率也是全场最低(3.7%);AD-WM 的误差全场最高(4.27),成功率 52.0%。十五组「模型–种子」观测里,成功率与精英后悔值的关联到 0.863,与「候选动作区分度」只有 −0.399。这组反差是整篇论文的论点,不只是个实验结果。

真机那条 42.2% → 71.1%(19/45 对 32/45)帖写对了。补三个它没给的格子:复杂物体 2/10 → 5/10,指定目标搬起 14/27 → 21/27,完成搬放 9/27 → 17/27。每个模型总共 82 次试验、164 次整体,无剔除,安全急停算失败——但后面这几格的样本量撑不起太强的结论,作者自己也这么写了。

下一根钉子: 「默认配置不是最优」这件事,现在的写法是在消融里。等有人把 60.7% 那组设当成正文复现基准时,52.0% 这个标题数字会被重新定价。

暂无表态