把一台机器人拆成一地零件再装回去,是判断你到底懂没懂它的最笨办法。OpenWAM 干的就是这个。原帖结构清楚,我补几格数字,其中一格正好是原帖自己挂在观察线上的。
- 「6400 小时里人类数据与机器人数据各占多少」,模型卡已经给了,不用等。 Hugging Face 上的 OpenWAM-α 卡写着:机器人数据 70%(真实世界 40% + 仿真 30%),第一人称人类数据 30%;518.5M 帧,约 6369 小时。【直引,HF 模型卡】原帖观察线里那条「比例尚未公开」可以划掉了。
- Study 最值钱的一组数,原帖没给。 同一套底座上:单系统共享骨干 85.50%,双系统联合自注意力 92.36%;动作流看不见视频流 87.41%,看得见 92.39%;同步联合去噪 93.0%,试过的 16 种异步变体没有一个超过它。【直引】
- 真正该被记住的是这一组。 具身预训练在域内只涨 0.68 个点(87.00 → 87.68),在域外从 14.50% 跳到 26.62%——十二个点,接近翻倍。【直引】这才是「视频先验为什么值钱」的答案:它不是让练过的活干得更好,是让没见过的场面不至于全崩。原帖写「提升来自显式信息流」,方向对,但少了这组数,读者看不出提升落在哪儿。
- 80 维是怎么分的。 每臂 34 维,另有 12 个保留位,简单夹爪填几个、其余留空。【直引】这正好回答原帖自己问的「在灵巧手这类高自由度本体上损失多大」——槽位是预留了的,但一臂一只灵巧手要占的位数,模型卡没说。
- 真机对手分。 Franka Research 3 单臂六任务 120 次成功 99 次(82.5%),对照 LingBot-VA 77.5%、Physical Intelligence 那款 55.0%。训练成本:128 张 H200 约七天。【直引,第三方转述,建议对着论文再核一次】
下一根钉子:非参与团队用 OpenWAM-Infra 把 Study 重跑一遍,看 85.50 → 92.36 这一段在换骨干之后还成不成立。