93.6% 是并列第一,clean 上只领先 0.2 分;8.28% 是榜眼,而且对手用了 20 倍数据。
先说真贡献,这条被帖子埋掉了。表 3 里 Fast-WAM 去掉生成式视频预训练之后,从 87.78/86.43 掉到 66.10/62.32;ReWAM 不带这项预训练却有 93.6%。等于用更少的先验打赢了带视频预训练的系统。这个对照做得干净。§1、§4.3 还有一条更硬的证据:DINO 特征的 SSIM 0.70 低于 Video-VAE 的 0.91,成功率反高 4.90/9.22 分——"重建保真度不等于策略学习"这句话,在表 4 里是有数的(DINO 重建 codec 85.58/86.08 vs RGB codec 71.04/70.48)。
但两个数字的读法都得改。
- 93.6% 的领先极小。 表 1 里最强对手 AHA-WAM 是 93.4/92.2(均值 92.8)。ReWAM 只在 clean +0.2、random +1.4。50 个任务 × 每任务 100 episode 平均下来,任务级标准误约 0.7 分——clean 上那 +0.2 完全在噪声里。说"并列第一"比说"SOTA"贴切。
- 8.28% 不是第一。 表 2 具身预训练组里 HyVLA-0.5 是 13.07 分 / 8.80%,两项都更高;Spatial Forcing 12.38 分也高于 12.29。论文自己只宣称"Generalization 最高、Long-Horizon SR 最高"(14.65/10.50 与 16.25),这是属实的。而 8.28% 的绝对值低,是因为 RoboDojo 本身极难,全表最好方法也不到 9%——所以它是接近榜首,不是"很差"。帖子两个方向都读歪了。
- 数据量不对等。 表 8 里 π0/π0.5/HyVLA-0.5 是 10,000+ 小时,LingBot-VLA 约 20,000 小时;ReWAM 自报约 600 小时。唯一对等的是 Fast-WAM\*(同为 600 小时,表 2 注),结果是 12.29/8.28 vs 10.95/6.80,增益 +1.34 分 / +1.48 分。要引用就引用这个数据效率,别引用那个看上去更大的 8.28%。
- 消融阶梯到不了 93.6%。 表 3–6 全是 1 epoch 预算(§4.1),AGRS 最好 90.70/89.12;主表那个 93.6 是 5 epoch。差的约 2.9 分来自训练量,不是方法。
可复算:表 3 累计 3.92+1.41+6.87=12.20 分,与 §1 一致;表 4 的 AGRS 减无 TRB 得 +6.80/+6.09,也对得上。但表 6 出现反直觉结果:AGRS 在 dim 128(90.70)优于 dim 512(89.08),而 64 维也有 89.90——维度扫描的波动(1.6 分)已经接近它宣称的消融增益量级。
一句话:值得引的是"600 小时对上两万小时"和表 3 那条"无视频预训练反超有视频预训练",不是 93.6% 和 8.28% 这两个看起来最大的数。