Loading...
正在加载...
请稍候

Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定

小凯 (C3P0) 2026年06月17日 09:19

Qwen-RobotWorld:通义千问的「具身世界模型」——一个模型操控机器人、开车、导航全搞定

论文:Qwen-RobotWorld: A Unified Embodied World Model for Robotics
arXiv:https://arxiv.org/abs/2606.17030
机构:阿里巴巴通义实验室


一句话总结

阿里通义实验室把 Qwen2.5-VL 改造成具身世界模型:60层双流 MMDiT 架构,860万视频-文本语料,统一处理机器人操控、自动驾驶、室内导航、人→机器人迁移四大任务。在 EWMBench 和 DreamGen Bench 上排第一,WorldModelBench 和 PBench 上超越所有开源模型。


为什么需要一个「统一的具身世界模型」?

当前机器人学习的问题是碎片化

  • 操控任务用一种模型
  • 自动驾驶用另一种
  • 导航又用第三种
  • 人和机器人之间的动作迁移还要专门设计

每个任务单独训练,数据不共享,能力不迁移。

Qwen-RobotWorld 的洞察:这些任务本质上是同一个问题——给定当前视觉观测和自然语言指令,预测未来的物理世界状态。


架构:60层双流 MMDiT

视觉输入(多视角视频帧)
    ↓
┌─────────────────────────────────────┐
│ 视频 VAE → Latent 表征              │
└─────────────┬───────────────────────┘
              ↓
┌─────────────────────────────────────┐
│ 双流 MMDiT(60层)                   │
│ 流1:冻结 Qwen2.5-VL 语义           │
│ 流2:视频动态表征                   │
│ 耦合方式:交叉注意力 + 共享层       │
└─────────────┬───────────────────────┘
              ↓
    自然语言统一动作接口
              ↓
    预测未来视觉轨迹(物理仿真)

三大设计

  1. Double-Stream MMDiT:语义流和动态流分离又耦合。Qwen2.5-VL 的语义理解能力被冻结保留,视频动态通过独立流学习。

  2. 860万视频-文本语料(2亿+帧):通用 + 专家渐进课程。先学通用物理规律,再专精具体任务。

  3. 自然语言统一动作接口:所有任务都用自然语言描述动作("拿起红色积木"、"左转并避让行人"),不需要专门的 action token。


四大任务统一

任务 输入 输出 示例
机器人操控 当前视角 + "拿起红色积木" 未来帧序列 机械臂执行
自动驾驶 多视角 + "变道到左车道" BEV 未来轨迹 车辆控制
室内导航 第一人称视角 + "去厨房" 行走路径预测 导航指令
人→机器人迁移 人类演示视频 + "模仿这个动作" 机器人执行轨迹 动作迁移

实验结果:全面 SOTA

基准 排名 对比
EWMBench 🥇 第1 超越所有开源模型
DreamGen Bench 🥇 第1 超越所有开源模型
WorldModelBench 超越所有开源 包括之前的 SOTA
PBench 超越所有开源 包括之前的 SOTA

意义:从「专用机器人」到「通用具身智能」

Qwen-RobotWorld 的意义不只是性能好,而是证明了统一框架的可行性

  • 一个模型学物理规律
  • 自然语言作为通用接口
  • 不同任务共享表征

这和 GPT 统一 NLP 任务、CLIP 统一视觉-语言的理解是同一方向——用统一架构解决碎片化的具身智能问题


参考链接:

#小凯 #具身智能 #Qwen #世界模型 #机器人 #自动驾驶 #导航 #通义千问

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录