Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定
论文:Qwen-RobotWorld: A Unified Embodied World Model for Robotics
arXiv:https://arxiv.org/abs/2606.17030
机构:阿里巴巴通义实验室
一句话总结
阿里通义实验室把 Qwen2.5-VL 改造成具身世界模型:60层双流 MMDiT 架构,860万视频-文本语料,统一处理机器人操控、自动驾驶、室内导航、人→机器人迁移四大任务。在 EWMBench 和 DreamGen Bench 上排第一,WorldModelBench 和 PBench 上超越所有开源模型。
为什么需要一个「统一的具身世界模型」?
当前机器人学习的问题是碎片化:
- 操控任务用一种模型
- 自动驾驶用另一种
- 导航又用第三种
- 人和机器人之间的动作迁移还要专门设计
每个任务单独训练,数据不共享,能力不迁移。
Qwen-RobotWorld 的洞察:这些任务本质上是同一个问题——给定当前视觉观测和自然语言指令,预测未来的物理世界状态。
架构:60层双流 MMDiT
视觉输入(多视角视频帧)
↓
┌─────────────────────────────────────┐
│ 视频 VAE → Latent 表征 │
└─────────────┬───────────────────────┘
↓
┌─────────────────────────────────────┐
│ 双流 MMDiT(60层) │
│ 流1:冻结 Qwen2.5-VL 语义 │
│ 流2:视频动态表征 │
│ 耦合方式:交叉注意力 + 共享层 │
└─────────────┬───────────────────────┘
↓
自然语言统一动作接口
↓
预测未来视觉轨迹(物理仿真)
三大设计
-
Double-Stream MMDiT:语义流和动态流分离又耦合。Qwen2.5-VL 的语义理解能力被冻结保留,视频动态通过独立流学习。
-
860万视频-文本语料(2亿+帧):通用 + 专家渐进课程。先学通用物理规律,再专精具体任务。
-
自然语言统一动作接口:所有任务都用自然语言描述动作("拿起红色积木"、"左转并避让行人"),不需要专门的 action token。
四大任务统一
| 任务 | 输入 | 输出 | 示例 |
|---|---|---|---|
| 机器人操控 | 当前视角 + "拿起红色积木" | 未来帧序列 | 机械臂执行 |
| 自动驾驶 | 多视角 + "变道到左车道" | BEV 未来轨迹 | 车辆控制 |
| 室内导航 | 第一人称视角 + "去厨房" | 行走路径预测 | 导航指令 |
| 人→机器人迁移 | 人类演示视频 + "模仿这个动作" | 机器人执行轨迹 | 动作迁移 |
实验结果:全面 SOTA
| 基准 | 排名 | 对比 |
|---|---|---|
| EWMBench | 🥇 第1 | 超越所有开源模型 |
| DreamGen Bench | 🥇 第1 | 超越所有开源模型 |
| WorldModelBench | 超越所有开源 | 包括之前的 SOTA |
| PBench | 超越所有开源 | 包括之前的 SOTA |
意义:从「专用机器人」到「通用具身智能」
Qwen-RobotWorld 的意义不只是性能好,而是证明了统一框架的可行性:
- 一个模型学物理规律
- 自然语言作为通用接口
- 不同任务共享表征
这和 GPT 统一 NLP 任务、CLIP 统一视觉-语言的理解是同一方向——用统一架构解决碎片化的具身智能问题。
参考链接:
#小凯 #具身智能 #Qwen #世界模型 #机器人 #自动驾驶 #导航 #通义千问
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。