十九点二秒的回忆:世界动作模型能不能真的记住过去
这是 Long-WAM 论文里最该记住的一个数字。在 RoboCasa GR-1 基准上,把上下文从 0 秒拉到 19.2 秒,成功率从 63.3% 涨到 78.7%,十五个百分点。
⏱️ 十九秒的回忆:机器人把动作往前推了多远
十九点二秒。
这是 Long-WAM 论文里最该记住的一个数字。在 RoboCasa GR-1 基准上,把上下文从 0 秒拉到 19.2 秒,成功率从 63.3% 涨到 78.7%,十五个百分点。
同一篇论文里还有另一个数字:同样的 19.2 秒,如果视频底座是双向预训练的,净增益为零。
arXiv 2610.10528,10 月 7 日 17:58 UTC 提交,15 位作者。摘要里那句写得直接:access to history is not the same as using it。拿到历史和用上历史是两件事。
🔁 分岔点在预训练,不在上下文长度
【推论】这解释了为什么很多团队单纯加长历史窗口没效果。窗口是容器,预训练方式决定容器里装的是因果链还是一张快照。
论文的做法是先从机器人与第一视角视频里学因果预测,不用动作标签,再在世界动作适配阶段保留这种历史到未来的结构。论文把这条归为核心发现:更长的历史在视频底座自回归预训练时回报高得多。
⏱️ 十五点四毫秒的硬约束
真机部署要卡在动作块的时间上。Long-WAM 用流式观测编码、异步执行加硬件特定加速,在 RTX 5090 上跑通了,DGX Spark 与 Jetson AGX Thor 同样跑通,且不丢未来预测。
| 平台与基准 | 数字 |
|---|---|
| RTX 5090 每个动作块(含未来视频潜变量预测) | 107.4 毫秒 |
| RoboCasa GR-1 上下文 0.0 秒 | 63.3% |
| RoboCasa GR-1 上下文 19.2 秒 | 78.7% |
| Unitree G1 与 YAM 动态叠杯 | 95% |
| 同一叠杯任务上的 Pi0.5 与 Fast-WAM | 20 次全 0 |
论文把 Long-WAM 定位成 memory-informed executor,说它能在复合任务里补上高层规划。
🔁 同一天的三篇
🌾 这条线的来路
世界动作模型(WAM)这条路近期很挤。10 月 7 日同一天至少还有几篇:Juno(arXiv 2610.09940)用一个动作条件的 JEPA 同时当控制表征骨干、预测教师和可适应动力学模型,SimplerEnv 上把 Qwen3GR00T 的 60.9% 抬到 68.5%,测试时适应再到 72.7%;Event-Aligned Visual Action Reasoning(2610.09427)在 DOMINO 上比基线高 10.26 个百分点;RoboJEPA(2610.10515)在 12 种机器人本体上训练,8B 参数,给出想象误差随算力的二阶幂律。
Long-WAM 的位置很清楚:它不谈架构新颖,只谈一件事,在真机上能记多久。
信源与限定:全部数字取自 arXiv 2610.10528 摘要,论文为 v1 预印本,未经同行评审。摘要未给出置信区间、试验次数与各基准的方差。真实机器人实验只在 Unitree G1 与 YAM 两个本体上,95% 的试验次数摘要未给。RTX 5090 的 107.4 毫秒为单平台数字,DGX Spark 与 Jetson AGX Thor 的延迟摘要未给。另外三篇是同属 10 月 7 日的预印本,分别是 Juno、Event-Aligned 与 RoboJEPA。此处只作同期对照,不作论据。
一句话:记住更久有用,前提是你一开始就把「先有过去再有未来」这件事学会了。