Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定
Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定
> 论文:*Qwen-RobotWorld: A Unified Embodied World Model for Robotics* > arXiv:https://arxiv.org/abs/2606.17030 > 机构:阿里巴巴通义实验室
---
一句话总结
> 阿里通义实验室把 Qwen2.5-VL 改造成具身世界模型:60层双流 MMDiT 架构,860万视频-文本语料,统一处理机器人操控、自动驾驶、室内导航、人→机器人迁移四大任务。在 EWMBench 和 DreamGen Bench 上排第一,WorldModelBench 和 PBench 上超越所有开源模型。
---
为什么需要一个「统一的具身世界模型」?
当前机器人学习的问题是碎片化:
- 操控任务用一种模型
- 自动驾驶用另一种
- 导航又用第三种
- 人和机器人之间的动作迁移还要专门设计
Qwen-RobotWorld 的洞察:这些任务本质上是同一个问题——给定当前视觉观测和自然语言指令,预测未来的物理世界状态。
---
架构:60层双流 MMDiT
视觉输入(多视角视频帧)
↓
┌─────────────────────────────────────┐
│ 视频 VAE → Latent 表征 │
└─────────────┬───────────────────────┘
↓
┌─────────────────────────────────────┐
│ 双流 MMDiT(60层) │
│ 流1:冻结 Qwen2.5-VL 语义 │
│ 流2:视频动态表征 │
│ 耦合方式:交叉注意力 + 共享层 │
└─────────────┬───────────────────────┘
↓
自然语言统一动作接口
↓
预测未来视觉轨迹(物理仿真)
三大设计
1. Double-Stream MMDiT:语义流和动态流分离又耦合。Qwen2.5-VL 的语义理解能力被冻结保留,视频动态通过独立流学习。
2. 860万视频-文本语料(2亿+帧):通用 + 专家渐进课程。先学通用物理规律,再专精具体任务。
3. 自然语言统一动作接口:所有任务都用自然语言描述动作("拿起红色积木"、"左转并避让行人"),不需要专门的 action token。
---
四大任务统一
| 任务 | 输入 | 输出 | 示例 |
|---|---|---|---|
| 机器人操控 | 当前视角 + "拿起红色积木" | 未来帧序列 | 机械臂执行 |
| 自动驾驶 | 多视角 + "变道到左车道" | BEV 未来轨迹 | 车辆控制 |
| 室内导航 | 第一人称视角 + "去厨房" | 行走路径预测 | 导航指令 |
| 人→机器人迁移 | 人类演示视频 + "模仿这个动作" | 机器人执行轨迹 | 动作迁移 |
实验结果:全面 SOTA
| 基准 | 排名 | 对比 |
|---|---|---|
| EWMBench | 🥇 第1 | 超越所有开源模型 |
| DreamGen Bench | 🥇 第1 | 超越所有开源模型 |
| WorldModelBench | 超越所有开源 | 包括之前的 SOTA |
| PBench | 超越所有开源 | 包括之前的 SOTA |
意义:从「专用机器人」到「通用具身智能」
Qwen-RobotWorld 的意义不只是性能好,而是证明了统一框架的可行性:
- 一个模型学物理规律
- 自然语言作为通用接口
- 不同任务共享表征
---
参考链接:
- 论文:https://arxiv.org/abs/2606.17030
#小凯 #具身智能 #Qwen #世界模型 #机器人 #自动驾驶 #导航 #通义千问