静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨
✨步子哥 @steper · 2026-10-03 02:17

让机器人"做梦"复习旧技能:REGEN 用世界动作模型实现持续学习

灾难性遗忘:机器人学习的阿喀琉斯之踵

想象你教一个机器人臂做三件事:先学抓杯子,再学开门,最后学叠衣服。训练完叠衣服后,你让它抓杯子——它不会了。

这就是灾难性遗忘(Catastrophic Forgetting)。神经网络在新任务上微调时,会覆盖旧任务学到的权重。对机器人来说,每学一个新技能就可能丢掉一个旧技能,这在实际部署中是不可接受的。

传统的解法是经验回放(Experience Replay):把旧任务的训练数据存下来,学新任务时混着旧数据一起练。但机器人场景下这几乎不可行——一条机械臂的演示轨迹包含多视角 RGB 图像 + 关节状态 + 动作序列,一条轨迹可能几百 MB。存 10 个任务、每个任务 50 条演示,就是几百 GB 的存储。更别提隐私和版权问题。

REGEN(Recurrent Generative Replay)提出了一个大胆的替代方案:不存旧数据,让模型自己"做梦"生成旧任务的演示。

世界动作模型(WAM):会预测未来的策略

要理解 REGEN,先得理解它的基础——世界动作模型(World Action Model, WAM)。

普通机器人策略只做一件事:看到当前画面,输出下一步动作。WAM 做两件事:看到当前画面,同时输出下一步动作和下一帧画面。它不仅决定"做什么",还预测"会发生什么"。

WAM 建立在视频生成模型(如 Cosmos-Predict2)之上。在时间步 t,给定当前观测 o_t 和语言指令 l,WAM 预测:

  • 动作块 ã_{t:t+H}(未来 H 步的动作序列)
  • 未来观测 õ_{t+H}(H 步之后的画面)
  • 任务进度 r̃_t ∈ [0,1](离完成还有多远)
这三个输出中,"未来观测"是关键——它让 WAM 具备了"想象力"。

REGEN 的核心机制:用想象力替代存储

REGEN 的思路是这样的:既然 WAM 能预测未来画面,那给它一个旧任务的语言指令 + 一个初始观测,让它自己"演"一遍旧任务的轨迹不就行了?

具体流程分三阶段:

阶段一:初始化(0 ≤ t < H)

从当前任务的真实演示中取一个观测作为起点。WAM 在这个真实观测上预测一个动作块 ã_{0:H}。这 H 步用真实观测做条件,确保起步有据。

阶段二:循环生成(H ≤ t ≤ T_max)

H 步之后,真实观测用完了。WAM 开始"自食其力"——用自己上一步预测的观测 õ_t 作为下一步的输入,继续预测 ã_{t:t+H} 和 õ_{t+H}。这就像一个人闭着眼睛走路:每一步都基于上一步自己想象的位置。

这种递归反馈让 WAM 能从初始观测一直"演"到任务完成,生成一条完整的伪演示轨迹 τ̃_i。

阶段三:终止

什么时候停?WAM 的任务进度头 r̃_t 预测离完成还有多远。当 r̃_t 连续 3 步超过 0.99 且至少一次达到 1.0 时,认为任务完成,停止生成。

生成的伪轨迹 τ̃_i = {(õ_t, ã_t)} 被加入伪演示集 R_k。对所有旧任务都做一遍,然后把伪演示集和当前任务的真实演示合并训练。

为什么这招能行:WAM 的"梦境质量"

REGEN 能不能防遗忘,取决于生成的伪轨迹质量。如果 WAM "做梦"时生成的动作和真实演示差太远,训练反而会引入噪声。

作者用表示分析(Representation Analysis)评估了伪轨迹质量。结果显示,WAM 生成的伪轨迹在特征空间中与真实轨迹的分布高度重叠——模型"想象"出来的动作序列和人类演示者在统计意义上难以区分。

这背后有一个关键设计:WAM 的训练目标是联合优化的——动作预测损失 + 未来观测生成损失 + 任务进度回归损失。这三个目标互相约束。如果模型只学动作不学预测画面,它可能记住动作序列但不理解物理后果。如果只学预测画面不学动作,它可能生成好看但不一致的视频。联合训练让 WAM 同时理解"做什么"和"会发生什么",这正是高质量"梦境"的基础。

实验结果:LIBERO 基准上的全面验证

REGEN 在 LIBERO 仿真基准上测试,包含三个任务套件:

  • LIBERO-Spatial:测试空间泛化能力
  • LIBERO-Object:测试对不同物体的泛化
  • LIBERO-Goal:测试对不同目标的泛化
每个套件 10 个任务,6 个用于预训练,4 个用于持续学习。评估三个指标:
  • FWT(Forward Transfer):学新任务的能力
  • NBT(Negative Backward Transfer):遗忘程度(越低越好)
  • AUC(Area Under the Curve):整体持续学习性能
对比基线:
  • Seq-FT(顺序微调):直接在新任务上微调,不做任何遗忘防护
  • ER(Experience Replay):存旧数据混合训练
REGEN 在所有三个套件上的 AUC 都显著优于 Seq-FT,且不需要存储任何旧任务数据。与 ER 相比,REGEN 在某些套件上甚至更好——因为 WAM 生成的伪轨迹比原始演示更多样化(每次生成都从不同的初始观测出发,自然产生变化)。

代码分析:基于 Cosmos-Policy 的实现

REGEN 的实现基于 NVIDIA 的 Cosmos-Policy(一个 WAM 实现),后者又基于 Cosmos-Predict2-2B 视频生成模型。

关键架构参数:

  • 动作块长度 H = 16(一次预测 16 步动作)
  • 输入:第三人称 RGB + 手腕相机 RGB + 机器人本体感知状态 + 语言指令
  • 预训练 10K iterations,每个持续学习阶段 22K iterations
  • 每个旧任务生成 10 条伪轨迹
Cosmos-Predict2 仓库(nvidia-cosmos/cosmos-predict2)提供了视频生成的基础设施,Cosmos-Policy 在其上添加了动作预测头和任务进度头。REGEN 的核心贡献是利用这个已有的"想象力"基础设施来实现持续学习,而不需要设计新的网络结构。

为什么这件事重要

1. 机器人持续学习的实用化路径

工业场景中机器人需要不断学习新任务——产线换了产品、仓库换了货物、厨房换了菜品。存储所有历史演示数据不现实,REGEN 提供了一个"不存数据也能不忘"的方案。

2. "做梦"作为学习机制的工程实现

人类睡眠时的梦境被认为有记忆巩固功能——海马体在睡眠中重放白天的经历,强化记忆。REGEN 是这个机制在机器人上的工程实现:WAM 的循环生成 = 海马体的重放,伪轨迹 = 梦境中的记忆。这不是牵强附会——作者明确讨论了这个类比。

3. 世界模型作为"记忆载体"

REGEN 揭示了一个更深的洞察:世界模型本身就是一种记忆。WAM 学会了"抓杯子时画面会怎么变化",这个知识编码在它的权重里。当需要"回忆"抓杯子的动作时,不需要原始数据,只需要让世界模型"演"一遍。这比存原始数据高效得多——几百 GB 的演示轨迹,被压缩成了模型权重中的结构化知识。

局限性

1. 生成质量依赖 WAM 能力:如果 WAM 在旧任务上训练不充分,生成的伪轨迹可能偏离真实分布,导致持续学习效果退化。 2. 初始观测依赖当前任务:REGEN 需要从当前任务的真实观测启动生成。如果旧任务和新任务的初始状态差异太大,生成的伪轨迹可能不具代表性。 3. 长时序漂移:循环生成中,每一步的预测误差会累积。轨迹越长,伪演示越可能偏离真实分布。作者用 T_max 限制最大长度,但这是一个工程妥协。

一句话总结

REGEN 让机器人通过世界动作模型的"想象力"生成旧任务的伪演示,在不存储任何历史数据的情况下实现持续学习——把"做梦复习"从生物学隐喻变成了工程实现。

---

*深度研究回复 | 论文 arXiv: 2606.27374 | REGEN: Recurrent Generative Replay* *代码基础:Cosmos-Policy / Cosmos-Predict2 (nvidia-cosmos/cosmos-predict2)*

暂无表态