世界动作模型被拆成了零件:OpenWAM 开源全栈与那份设计规律清单

一个机器人要把桌上的杯子挪到水槽边,它得先回答两个问题:接下来画面会怎么变,以及我做什么能让画面朝我想要的那个方向变。

一个机器人要把桌上的杯子挪到水槽边,它得先回答两个问题:接下来画面会怎么变,以及我做什么能让画面朝我想要的那个方向变。

第一个问题属于视频生成模型,第二个属于机器人策略。过去几年这两件事大多分开做,或者硬塞进一个网络里一起训,塞法各家不同,谁也说不清到底哪一部分在起作用。

9 月 7 日,来自新加坡国立大学、清华大学、北京大学、上海交通大学等七所高校、二十四位成员组成的联合团队发布《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》(arXiv:2609.07398),把这条路线拆成可替换的零件,并附上一份受控实验得出的设计规律。代码、权重、数据配方已开源。

🧱 三层结构:Infra、Study 与 α

OpenWAM 由三块组成,分工明确。

OpenWAM-Infra 是模块化基础设施,把模型、训练运行时、部署运行时、评测协议四层拆开,各自有显式接口。模型层由视觉编码器、可换的数据流骨干、可见性注意力掩码拼装而成。统一运行时管预训练、微调与断点恢复,并保存完整配置、模块重建信息与动作归一化统计量。部署侧只有一个 policy server,支持同步与异步推理、多种去噪调度与加速手段。评测侧用轻量客户端连服务器,仿真与真机的输入输出接口保持一致。

OpenWAM-Study 是在 RoboTwin2.0 上、固定训练预算与评测口径做出来的一组受控实验,回答三个问题:该继承什么世界知识,世界建模与动作学习怎么协同,这种协同怎么跨数据域与具身形态扩展。

OpenWAM-α 是把 Study 的结论实例化出来的基座模型。它用约 6400 小时的第一人称人类数据与机器人数据,采用 80 维统一动作表示与双系统架构。

🔩 三种架构族:单系统、双系统、三系统

Infra 支持三类拼装方式。

单系统给视频与动作共用一条骨干。双系统把两条骨干分开,再用联合自注意力、交叉注意力或逆动力学三种方式之一连起来。三系统在双系统之上再加一路视觉语言理解流。三种架构都通过统一配置与注册表机制组装,训练器与策略服务器不需要知道当前装的是哪一种。

这层设计的意义在控制变量:同一个实验换骨干、换编码器、换信息流方式,其余全部锁死。在此之前,不同论文的世界动作模型连骨架都不一样,结果差异无法归因。

📐 规律一:先验要强,潜空间要紧凑

Study 第一条结论落在"继承什么"上。

团队比了四个视频生成骨干,平均成功率依次是:Wan2.1-VACE-1.3B 90.14%,Cosmos-Predict2.5-2B 91.64%,Wan2.2-TI2V-5B 92.39%,Wan2.1-I2V-14B 93.79%。容量越大表现越好,但团队最终选 5B 作默认,理由是它与 14B 只差 1.40%,成本效率更划算。

论文自己给了一句限定:这四个模型在架构、数据、训练目标上都不一样,增益不能单独归因于参数量。【直引】

视觉表征那一组实验更有意思。关键不在编码器是重建式还是表征式,而在潜空间是否在时间与 token 两个维度上都紧凑、同时保留足够的世界信息。DINOv3 与 V-JEPA 2.1 直接产出高维特征,初期表现反而差;经 S-VAE 压缩到与 DiT 兼容的空间后性能显著上升,DINOv3 加 S-VAE 的组合已经接近 Wan2.2-VAE。

视频生成骨干平均成功率备注
Wan2.1-VACE-1.3B90.14%容量最小
Cosmos-Predict2.5-2B91.64%英伟达系
Wan2.2-TI2V-5B92.39%选为默认
Wan2.1-I2V-14B93.79%最好的一组,代价最高
这张表要读的是成本曲线上的那一段:在 5B 这一档,再往上多花的算力买到的只有 1.40 个百分点。【判断】

🔁 规律二:世界到动作的信息流要显式建起来

第二条结论落在"怎么协同"上。

架构消融显示,从单系统走到双系统、再走到三系统,平均成功率逐档提升。提升来自训练期显式建立的世界到动作信息流。推理侧则用同步联合去噪,让未来预测与动作生成在同一节奏上互相约束。

这条规律的解释力在于它把"世界模型有没有用"这种笼统争论,换成了"信息从哪一层流向哪一层"的可调参数。【判断】

🧪 八个基准与四种本体

评测协议覆盖八个仿真基准:LIBERO、LIBERO-Plus、VLABench、RoboTwin2.0、RoboDojo、RoboCasa365、EBench、RoboCasa-GR1。本体覆盖单臂、双臂、移动操作与灵巧手四类。

开源内容包括基础设施、评测协议、预训练与微调权重、数据配方。团队对外给出的定位是:供研究者检验"哪一种世界模型设计选择能改善域外机器人行为"。

📼 数据不对称,与这条路线走过的路

世界动作模型这条路线有一个绕不开的现实:两类数据的量级差得太远。互联网上的视频以亿小时计,机器人轨迹以万小时计。机器人策略直接从示范里学,能学到的世界知识上限被第二种数据卡住;把视频生成预训练的视觉动态先验先继承过来,再用具身经验学怎么在这个世界里动手,是这条路线的核心赌注。

论文把问题拆成三层的顺序,正好对应这个赌注:先问什么知识值得继承,再问世界建模和动作学习怎么协同,最后问这种协同怎么跨数据域和具身形态扩展。

从 UniPi 提出"策略即视频"算起,这条线走过解耦、对齐、联合、大规模预训练几个节点,在 VLA 盛行期仍在推进。进入 2026 年,研究重心从"能否预测未来"挪到"什么样的未来对行动真正有用"。

🧭 放在哪条线上看

2026 年关于世界动作模型的研究重心,已经从"能不能预测未来"挪到"什么样的未来对行动真正有用"。OpenWAM 的位置在这个转折点上:它没有宣称新的规模纪录,而是交出一套别人能拆开重装的实验装置。

这件事的价值取决于后续有多少团队真的用它跑控制变量实验。【判断】模块化基础设施的收益是复利型的,装机量不够就只是又一份开源仓库。

对国内团队另有一层现实含义。论文列出的骨干里有 Wan2.1、Wan2.2 这类国产视频生成模型,默认档 5B 的性能与 14B 只差 1.40%,说明这条路线对算力预算中等的团队是够得着的。【推论】

🔭 观察线

  • 第三方复跑:非参与团队用 OpenWAM-Infra 跑出的结论是否与 Study 一致,是这套设计规律能否成立的第一道关。
  • 骨干换代的收益曲线:下一代视频生成模型出来后,90.14% 到 93.79% 这段区间会不会整体平移。
  • 跨本体迁移的代价:80 维统一动作空间在灵巧手这类高自由度本体上的信息损失有多大。
  • 真机数据占比:6400 小时里人类第一人称与机器人轨迹的比例尚未公开,这个比例直接决定"世界先验"与"可执行性"的配比。
  • 三系统架构的性价比:多加一路视觉语言流换来的提升,值不值多出来的推理开销。

参考来源

1. OpenWAM 团队,《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》,arXiv:2609.07398 2. 项目主页 openwam-official.github.io;代码 github.com/OpenWAM-Official/OpenWAM;模型与数据 huggingface.co/OpenWAM 3. 机器之心 Pro《七校联合开源 OpenWAM:机器人的"世界模拟器"来了》,2026-09-25 4. 对话 OpenWAM 团队:具身模型的设计洞察,2026-09 5. BestHub 对 OpenWAM-Infra 与 OpenWAM-Study 的技术拆解,2026-09-25

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

把一台机器人拆成一地零件再装回去,是判断你到底懂没懂它的最笨办法。OpenWAM 干的就是这个。原帖结构清楚,我补几格数字,其中一格正好是原帖自己挂在观察线上的。

  • 「6400 小时里人类数据与机器人数据各占多少」,模型卡已经给了,不用等。 Hugging Face 上的 OpenWAM-α 卡写着:机器人数据 70%(真实世界 40% + 仿真 30%),第一人称人类数据 30%;518.5M 帧,约 6369 小时。【直引,HF 模型卡】原帖观察线里那条「比例尚未公开」可以划掉了。
  • Study 最值钱的一组数,原帖没给。 同一套底座上:单系统共享骨干 85.50%,双系统联合自注意力 92.36%;动作流看不见视频流 87.41%,看得见 92.39%;同步联合去噪 93.0%,试过的 16 种异步变体没有一个超过它。【直引】
  • 真正该被记住的是这一组。 具身预训练在域内只涨 0.68 个点(87.00 → 87.68),在域外从 14.50% 跳到 26.62%——十二个点,接近翻倍。【直引】这才是「视频先验为什么值钱」的答案:它不是让练过的活干得更好,是让没见过的场面不至于全崩。原帖写「提升来自显式信息流」,方向对,但少了这组数,读者看不出提升落在哪儿。
  • 80 维是怎么分的。 每臂 34 维,另有 12 个保留位,简单夹爪填几个、其余留空。【直引】这正好回答原帖自己问的「在灵巧手这类高自由度本体上损失多大」——槽位是预留了的,但一臂一只灵巧手要占的位数,模型卡没说。
  • 真机对手分。 Franka Research 3 单臂六任务 120 次成功 99 次(82.5%),对照 LingBot-VA 77.5%、Physical Intelligence 那款 55.0%。训练成本:128 张 H200 约七天。【直引,第三方转述,建议对着论文再核一次】
顺手记个工程量:代码仓 9-6 建,Apache 2.0,HF 上 46 个 checkpoint,现在 884 星。二十四位作者的名单在 BibTeX 里是齐的,和原帖对得上——账能对上的地方值得专门夸一句,它是「数据真跑过」最便宜的证据。

下一根钉子:非参与团队用 OpenWAM-Infra 把 Study 重跑一遍,看 85.50 → 92.36 这一段在换骨干之后还成不成立。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens