静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-01 01:56

93.6% 是并列第一,clean 上只领先 0.2 分;8.28% 是榜眼,而且对手用了 20 倍数据。

先说真贡献,这条被帖子埋掉了。表 3 里 Fast-WAM 去掉生成式视频预训练之后,从 87.78/86.43 掉到 66.10/62.32;ReWAM 不带这项预训练却有 93.6%。等于用更少的先验打赢了带视频预训练的系统。这个对照做得干净。§1、§4.3 还有一条更硬的证据:DINO 特征的 SSIM 0.70 低于 Video-VAE 的 0.91,成功率反高 4.90/9.22 分——"重建保真度不等于策略学习"这句话,在表 4 里是有数的(DINO 重建 codec 85.58/86.08 vs RGB codec 71.04/70.48)。

但两个数字的读法都得改。

  • 93.6% 的领先极小。 表 1 里最强对手 AHA-WAM 是 93.4/92.2(均值 92.8)。ReWAM 只在 clean +0.2、random +1.4。50 个任务 × 每任务 100 episode 平均下来,任务级标准误约 0.7 分——clean 上那 +0.2 完全在噪声里。说"并列第一"比说"SOTA"贴切。
  • 8.28% 不是第一。 表 2 具身预训练组里 HyVLA-0.5 是 13.07 分 / 8.80%,两项都更高;Spatial Forcing 12.38 分也高于 12.29。论文自己只宣称"Generalization 最高、Long-Horizon SR 最高"(14.65/10.50 与 16.25),这是属实的。而 8.28% 的绝对值低,是因为 RoboDojo 本身极难,全表最好方法也不到 9%——所以它是接近榜首,不是"很差"。帖子两个方向都读歪了。
  • 数据量不对等。 表 8 里 π0/π0.5/HyVLA-0.5 是 10,000+ 小时,LingBot-VLA 约 20,000 小时;ReWAM 自报约 600 小时。唯一对等的是 Fast-WAM\*(同为 600 小时,表 2 注),结果是 12.29/8.28 vs 10.95/6.80,增益 +1.34 分 / +1.48 分。要引用就引用这个数据效率,别引用那个看上去更大的 8.28%。
  • 消融阶梯到不了 93.6%。 表 3–6 全是 1 epoch 预算(§4.1),AGRS 最好 90.70/89.12;主表那个 93.6 是 5 epoch。差的约 2.9 分来自训练量,不是方法。
帖子没提的:Memory 被 HyVLA 明显甩开(9.05 vs 13.37),Open 指令跟随 0.25 几乎垫底(π0.5 是 1.98),论文自己归因于缺生成式视频预训练。真机只有 3 个任务 ×20 次 = 60 次,55 vs 48,两比例检验 z≈1.86、p≈0.06,未达显著——而且全部优势来自 Fold Clothes +3 次与 Unpack Lunchbox +4 次,Collect Objects 是 20/20 打平。另外全文没有 limitation 章、没有随机种子、没有标准差,RoboDojo 的评估 episode 数没给,也没有推理延迟和 FLOPs——冻结 DINOv3 ViT-L/16 加 3.58B 双 DiT 的部署代价没有被计量。

可复算:表 3 累计 3.92+1.41+6.87=12.20 分,与 §1 一致;表 4 的 AGRS 减无 TRB 得 +6.80/+6.09,也对得上。但表 6 出现反直觉结果:AGRS 在 dim 128(90.70)优于 dim 512(89.08),而 64 维也有 89.90——维度扫描的波动(1.6 分)已经接近它宣称的消融增益量级。

一句话:值得引的是"600 小时对上两万小时"和表 3 那条"无视频预训练反超有视频预训练",不是 93.6% 和 8.28% 这两个看起来最大的数。

+0.2 分,和两个不等于第一的第一

暂无表态