十九点二秒的回忆:世界动作模型能不能真的记住过去

这是 Long-WAM 论文里最该记住的一个数字。在 RoboCasa GR-1 基准上,把上下文从 0 秒拉到 19.2 秒,成功率从 63.3% 涨到 78.7%,十五个百分点。

目录
  1. ⏱️ 十九秒的回忆:机器人把动作往前推了多远
  2. 🔁 分岔点在预训练,不在上下文长度
  3. ⏱️ 十五点四毫秒的硬约束
  4. 🔁 同一天的三篇
  5. 🌾 这条线的来路

⏱️ 十九秒的回忆:机器人把动作往前推了多远

十九点二秒。

这是 Long-WAM 论文里最该记住的一个数字。在 RoboCasa GR-1 基准上,把上下文从 0 秒拉到 19.2 秒,成功率从 63.3% 涨到 78.7%,十五个百分点。

同一篇论文里还有另一个数字:同样的 19.2 秒,如果视频底座是双向预训练的,净增益为零。

arXiv 2610.10528,10 月 7 日 17:58 UTC 提交,15 位作者。摘要里那句写得直接:access to history is not the same as using it。拿到历史和用上历史是两件事。

🔁 分岔点在预训练,不在上下文长度

【推论】这解释了为什么很多团队单纯加长历史窗口没效果。窗口是容器,预训练方式决定容器里装的是因果链还是一张快照。

论文的做法是先从机器人与第一视角视频里学因果预测,不用动作标签,再在世界动作适配阶段保留这种历史到未来的结构。论文把这条归为核心发现:更长的历史在视频底座自回归预训练时回报高得多。

⏱️ 十五点四毫秒的硬约束

真机部署要卡在动作块的时间上。Long-WAM 用流式观测编码、异步执行加硬件特定加速,在 RTX 5090 上跑通了,DGX Spark 与 Jetson AGX Thor 同样跑通,且不丢未来预测。

平台与基准数字
RTX 5090 每个动作块(含未来视频潜变量预测)107.4 毫秒
RoboCasa GR-1 上下文 0.0 秒63.3%
RoboCasa GR-1 上下文 19.2 秒78.7%
Unitree G1 与 YAM 动态叠杯95%
同一叠杯任务上的 Pi0.5 与 Fast-WAM20 次全 0
对比的方法清单有三个基准。LIBERO-Long、RoboTwin 2.0 与 DOMINO 上,Long-WAM 在被比较方法中结果最好。动态叠杯那 95% 的对照最扎眼,两个基线 20 次尝试一次没成。

论文把 Long-WAM 定位成 memory-informed executor,说它能在复合任务里补上高层规划。

🔁 同一天的三篇

🌾 这条线的来路

世界动作模型(WAM)这条路近期很挤。10 月 7 日同一天至少还有几篇:Juno(arXiv 2610.09940)用一个动作条件的 JEPA 同时当控制表征骨干、预测教师和可适应动力学模型,SimplerEnv 上把 Qwen3GR00T 的 60.9% 抬到 68.5%,测试时适应再到 72.7%;Event-Aligned Visual Action Reasoning(2610.09427)在 DOMINO 上比基线高 10.26 个百分点;RoboJEPA(2610.10515)在 12 种机器人本体上训练,8B 参数,给出想象误差随算力的二阶幂律。

Long-WAM 的位置很清楚:它不谈架构新颖,只谈一件事,在真机上能记多久。

信源与限定:全部数字取自 arXiv 2610.10528 摘要,论文为 v1 预印本,未经同行评审。摘要未给出置信区间、试验次数与各基准的方差。真实机器人实验只在 Unitree G1 与 YAM 两个本体上,95% 的试验次数摘要未给。RTX 5090 的 107.4 毫秒为单平台数字,DGX Spark 与 Jetson AGX Thor 的延迟摘要未给。另外三篇是同属 10 月 7 日的预印本,分别是 Juno、Event-Aligned 与 RoboJEPA。此处只作同期对照,不作论据。

一句话:记住更久有用,前提是你一开始就把「先有过去再有未来」这件事学会了。

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens