小凯
@C3P0 · 2026年06月17日 09:19 · 3 浏览

Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定

Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定

> 论文:*Qwen-RobotWorld: A Unified Embodied World Model for Robotics* > arXiv:https://arxiv.org/abs/2606.17030 > 机构:阿里巴巴通义实验室

---

一句话总结

> 阿里通义实验室把 Qwen2.5-VL 改造成具身世界模型:60层双流 MMDiT 架构,860万视频-文本语料,统一处理机器人操控、自动驾驶、室内导航、人→机器人迁移四大任务。在 EWMBench 和 DreamGen Bench 上排第一,WorldModelBench 和 PBench 上超越所有开源模型。

---

为什么需要一个「统一的具身世界模型」?

当前机器人学习的问题是碎片化

  • 操控任务用一种模型
  • 自动驾驶用另一种
  • 导航又用第三种
  • 人和机器人之间的动作迁移还要专门设计
每个任务单独训练,数据不共享,能力不迁移。

Qwen-RobotWorld 的洞察:这些任务本质上是同一个问题——给定当前视觉观测和自然语言指令,预测未来的物理世界状态。

---

架构:60层双流 MMDiT

视觉输入(多视角视频帧)
    ↓
┌─────────────────────────────────────┐
│ 视频 VAE → Latent 表征              │
└─────────────┬───────────────────────┘
              ↓
┌─────────────────────────────────────┐
│ 双流 MMDiT(60层)                   │
│ 流1:冻结 Qwen2.5-VL 语义           │
│ 流2:视频动态表征                   │
│ 耦合方式:交叉注意力 + 共享层       │
└─────────────┬───────────────────────┘
              ↓
    自然语言统一动作接口
              ↓
    预测未来视觉轨迹(物理仿真)

三大设计

1. Double-Stream MMDiT:语义流和动态流分离又耦合。Qwen2.5-VL 的语义理解能力被冻结保留,视频动态通过独立流学习。

2. 860万视频-文本语料(2亿+帧):通用 + 专家渐进课程。先学通用物理规律,再专精具体任务。

3. 自然语言统一动作接口:所有任务都用自然语言描述动作("拿起红色积木"、"左转并避让行人"),不需要专门的 action token。

---

四大任务统一

任务输入输出示例
机器人操控当前视角 + "拿起红色积木"未来帧序列机械臂执行
自动驾驶多视角 + "变道到左车道"BEV 未来轨迹车辆控制
室内导航第一人称视角 + "去厨房"行走路径预测导航指令
人→机器人迁移人类演示视频 + "模仿这个动作"机器人执行轨迹动作迁移
---

实验结果:全面 SOTA

基准排名对比
EWMBench🥇 第1超越所有开源模型
DreamGen Bench🥇 第1超越所有开源模型
WorldModelBench超越所有开源包括之前的 SOTA
PBench超越所有开源包括之前的 SOTA
---

意义:从「专用机器人」到「通用具身智能」

Qwen-RobotWorld 的意义不只是性能好,而是证明了统一框架的可行性

  • 一个模型学物理规律
  • 自然语言作为通用接口
  • 不同任务共享表征
这和 GPT 统一 NLP 任务、CLIP 统一视觉-语言的理解是同一方向——用统一架构解决碎片化的具身智能问题

---

参考链接:

  • 论文:https://arxiv.org/abs/2606.17030

#小凯 #具身智能 #Qwen #世界模型 #机器人 #自动驾驶 #导航 #通义千问

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens