让机器人"做梦"复习旧技能:REGEN 用世界动作模型实现持续学习
灾难性遗忘:机器人学习的阿喀琉斯之踵
想象你教一个机器人臂做三件事:先学抓杯子,再学开门,最后学叠衣服。训练完叠衣服后,你让它抓杯子——它不会了。
这就是灾难性遗忘(Catastrophic Forgetting)。神经网络在新任务上微调时,会覆盖旧任务学到的权重。对机器人来说,每学一个新技能就可能丢掉一个旧技能,这在实际部署中是不可接受的。
传统的解法是经验回放(Experience Replay):把旧任务的训练数据存下来,学新任务时混着旧数据一起练。但机器人场景下这几乎不可行——一条机械臂的演示轨迹包含多视角 RGB 图像 + 关节状态 + 动作序列,一条轨迹可能几百 MB。存 10 个任务、每个任务 50 条演示,就是几百 GB 的存储。更别提隐私和版权问题。
REGEN(Recurrent Generative Replay)提出了一个大胆的替代方案:不存旧数据,让模型自己"做梦"生成旧任务的演示。
世界动作模型(WAM):会预测未来的策略
要理解 REGEN,先得理解它的基础——世界动作模型(World Action Model, WAM)。
普通机器人策略只做一件事:看到当前画面,输出下一步动作。WAM 做两件事:看到当前画面,同时输出下一步动作和下一帧画面。它不仅决定"做什么",还预测"会发生什么"。
WAM 建立在视频生成模型(如 Cosmos-Predict2)之上。在时间步 t,给定当前观测 o_t 和语言指令 l,WAM 预测:
- 动作块 ã_{t:t+H}(未来 H 步的动作序列)
- 未来观测 õ_{t+H}(H 步之后的画面)
- 任务进度 r̃_t ∈ [0,1](离完成还有多远)
REGEN 的核心机制:用想象力替代存储
REGEN 的思路是这样的:既然 WAM 能预测未来画面,那给它一个旧任务的语言指令 + 一个初始观测,让它自己"演"一遍旧任务的轨迹不就行了?
具体流程分三阶段:
阶段一:初始化(0 ≤ t < H)
从当前任务的真实演示中取一个观测作为起点。WAM 在这个真实观测上预测一个动作块 ã_{0:H}。这 H 步用真实观测做条件,确保起步有据。
阶段二:循环生成(H ≤ t ≤ T_max)
H 步之后,真实观测用完了。WAM 开始"自食其力"——用自己上一步预测的观测 õ_t 作为下一步的输入,继续预测 ã_{t:t+H} 和 õ_{t+H}。这就像一个人闭着眼睛走路:每一步都基于上一步自己想象的位置。
这种递归反馈让 WAM 能从初始观测一直"演"到任务完成,生成一条完整的伪演示轨迹 τ̃_i。
阶段三:终止
什么时候停?WAM 的任务进度头 r̃_t 预测离完成还有多远。当 r̃_t 连续 3 步超过 0.99 且至少一次达到 1.0 时,认为任务完成,停止生成。
生成的伪轨迹 τ̃_i = {(õ_t, ã_t)} 被加入伪演示集 R_k。对所有旧任务都做一遍,然后把伪演示集和当前任务的真实演示合并训练。
为什么这招能行:WAM 的"梦境质量"
REGEN 能不能防遗忘,取决于生成的伪轨迹质量。如果 WAM "做梦"时生成的动作和真实演示差太远,训练反而会引入噪声。
作者用表示分析(Representation Analysis)评估了伪轨迹质量。结果显示,WAM 生成的伪轨迹在特征空间中与真实轨迹的分布高度重叠——模型"想象"出来的动作序列和人类演示者在统计意义上难以区分。
这背后有一个关键设计:WAM 的训练目标是联合优化的——动作预测损失 + 未来观测生成损失 + 任务进度回归损失。这三个目标互相约束。如果模型只学动作不学预测画面,它可能记住动作序列但不理解物理后果。如果只学预测画面不学动作,它可能生成好看但不一致的视频。联合训练让 WAM 同时理解"做什么"和"会发生什么",这正是高质量"梦境"的基础。
实验结果:LIBERO 基准上的全面验证
REGEN 在 LIBERO 仿真基准上测试,包含三个任务套件:
- LIBERO-Spatial:测试空间泛化能力
- LIBERO-Object:测试对不同物体的泛化
- LIBERO-Goal:测试对不同目标的泛化
- FWT(Forward Transfer):学新任务的能力
- NBT(Negative Backward Transfer):遗忘程度(越低越好)
- AUC(Area Under the Curve):整体持续学习性能
- Seq-FT(顺序微调):直接在新任务上微调,不做任何遗忘防护
- ER(Experience Replay):存旧数据混合训练
代码分析:基于 Cosmos-Policy 的实现
REGEN 的实现基于 NVIDIA 的 Cosmos-Policy(一个 WAM 实现),后者又基于 Cosmos-Predict2-2B 视频生成模型。
关键架构参数:
- 动作块长度 H = 16(一次预测 16 步动作)
- 输入:第三人称 RGB + 手腕相机 RGB + 机器人本体感知状态 + 语言指令
- 预训练 10K iterations,每个持续学习阶段 22K iterations
- 每个旧任务生成 10 条伪轨迹
nvidia-cosmos/cosmos-predict2)提供了视频生成的基础设施,Cosmos-Policy 在其上添加了动作预测头和任务进度头。REGEN 的核心贡献是利用这个已有的"想象力"基础设施来实现持续学习,而不需要设计新的网络结构。为什么这件事重要
1. 机器人持续学习的实用化路径
工业场景中机器人需要不断学习新任务——产线换了产品、仓库换了货物、厨房换了菜品。存储所有历史演示数据不现实,REGEN 提供了一个"不存数据也能不忘"的方案。
2. "做梦"作为学习机制的工程实现
人类睡眠时的梦境被认为有记忆巩固功能——海马体在睡眠中重放白天的经历,强化记忆。REGEN 是这个机制在机器人上的工程实现:WAM 的循环生成 = 海马体的重放,伪轨迹 = 梦境中的记忆。这不是牵强附会——作者明确讨论了这个类比。
3. 世界模型作为"记忆载体"
REGEN 揭示了一个更深的洞察:世界模型本身就是一种记忆。WAM 学会了"抓杯子时画面会怎么变化",这个知识编码在它的权重里。当需要"回忆"抓杯子的动作时,不需要原始数据,只需要让世界模型"演"一遍。这比存原始数据高效得多——几百 GB 的演示轨迹,被压缩成了模型权重中的结构化知识。
局限性
1. 生成质量依赖 WAM 能力:如果 WAM 在旧任务上训练不充分,生成的伪轨迹可能偏离真实分布,导致持续学习效果退化。 2. 初始观测依赖当前任务:REGEN 需要从当前任务的真实观测启动生成。如果旧任务和新任务的初始状态差异太大,生成的伪轨迹可能不具代表性。 3. 长时序漂移:循环生成中,每一步的预测误差会累积。轨迹越长,伪演示越可能偏离真实分布。作者用 T_max 限制最大长度,但这是一个工程妥协。
一句话总结
REGEN 让机器人通过世界动作模型的"想象力"生成旧任务的伪演示,在不存储任何历史数据的情况下实现持续学习——把"做梦复习"从生物学隐喻变成了工程实现。
---
*深度研究回复 | 论文 arXiv: 2606.27374 | REGEN: Recurrent Generative Replay* *代码基础:Cosmos-Policy / Cosmos-Predict2 (nvidia-cosmos/cosmos-predict2)*