给机器人一个可以反复查询的梦境:Pelican-Sim 1.0 的 28 维动作与四步生成

教机器人叠衣服,做对了 70%,做砸了剩下的。中间那段灰地带最难办:动作看着对,手也伸对了位置,夹爪也合上了,可轨迹偏了几厘米,衣服滑出去了。这段灰地带占掉的分量比成功还大。

目录
  1. 🧩 一个动作,两种写法
  2. 🏥 挂一个分诊台
  3. ⚡ 把 35 步压成 4 步
  4. 📐 生成一条轨迹要多久
  5. 📈 三个数据集上的画质
  6. 🎯 四个下游用法
  7. 📉 论文自陈的限制
  8. 📌 值得关注的地方

教机器人叠衣服,做对了 70%,做砸了剩下的。中间那段灰地带最难办:动作看着对,手也伸对了位置,夹爪也合上了,可轨迹偏了几厘米,衣服滑出去了。这段灰地带占掉的分量比成功还大。

要缩小这段灰地带,主流做法是采更多真机数据,或者把仿真器做得更真。2026 年 9 月 11 日,北京人形机器人创新中心(X-Humanoid)放出了一条另一条路:让一个生成模型当"梦境",在里面反复练。

  • 论文:Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence,arXiv:2609.12036
  • 作者机构:Beijing Innovation Center of Humanoid Robotics (X-Humanoid),WFM System Group
  • 通讯署名含 jack.zou、vito.dai、jian.tang、jason.ju;开源仓库 Open-X-Humanoid/Pelican-Sim1.0

🧩 一个动作,两种写法

问题出在动作怎么表示。机械臂的动作是一串精确数字:每个关节转几度、夹爪开多大。这套数字严谨,可模型盯着数字看,并不知道手臂在画面里会划出什么样的弧线。反过来,把动作画成骨架视频让它"看图",画面直观,可一张末端执行器的图只说得出手在哪,说不出整条手臂是怎么弯的。

Pelican-Sim 两边都要。

  • 统一动作表示:28 维,左右各 14 维,每侧是 7 维手臂关节角、1 维夹爪开合、6 维灵巧手关节值
  • 缺位填零。六轴机械臂的第 7 个关节维度填 0,单臂机器人缺失那一侧 14 维全填 0
  • 动作视频:用机器人 URDF 与相机标定,把这串数字做正向运动学再投影,栅格化成与 RGB 严格对齐的全身骨架视频;夹爪连杆按 open、transitional、closed 涂三种颜色
两路信息注入同一个 Video DiT 的不同层,没有各自独立的预测网络。Video DiT 一共 28 层。

层(零基索引)注入什么方式
1、3、5 … 27(14 层)数值动作scale-and-shift 调制
0、2、4 … 26(14 层)动作视频Context Block 残差
消融结果支持这个克制。两种条件每个 block 都同时注入,PSNR 只比交替注入高 0.075 dB(AgiBotWorld Beta)与 0.051 dB(RoboMIND)。论文的判断是交替注入已经够用。

动作条件本身的消融差距更大:什么都不给 PSNR 17.684,只给数值 19.238,只给视频 21.276,两者都给 22.276。

🏥 挂一个分诊台

机器人型号多到能把单一网络撑坏。六轴臂和人形双臂的运动逻辑不是一回事,抓葡萄和抓酒瓶的手法不是一回事。一个统一网络硬扛,容易变成"一招鲜吃遍天,哪个都不精"。

Pelican-Sim 在每个 Video DiT block 的 dense FFN 位置换成稀疏 MoE。

  • 共享专家 1 个,路由专家 8 个,每个 token 激活 top-2
  • 路由用 sigmoid token-choice routing,带 selection bias
  • 路由分支在前 2000 步从 0 线性升到 1
  • MoE 覆盖全部 28 层
效果:FVD 从 17.380 降到 10.850,降 6.530。训练数据与优化步数完全相同。

⚡ 把 35 步压成 4 步

世界模型要真当模拟器用,采样速度就变成了地板。动作筛选、RL 训练环境,都是要成百上千次调用。

分两步走。第一步因果适配,把双向注意力改成块因果注意力,每个时间 chunk 只能看自己和历史 chunk,得到一个 35 步的因果教师。第二步少步蒸馏,用分布匹配蒸馏(DMD)训练一个 4 步的学生,训练中保留少量 teacher-forced 更新以稳住动作可控性。

  • 21 帧基准上,4 步模型 2.2 秒出结果,5.67 倍加速
  • 推理时每个 latent chunk 走 4 步去噪,结果追加进滚动上下文窗口并用 KV 缓存

📐 生成一条轨迹要多久

方式秒/轨迹轨迹/小时重置(分钟/轨迹)
人工采集60600.4
Pelican-Sim 1.0241500
RoboTwin 仿真器5565.50
Pelican-Sim 1.0(仿真对比口径)19189.50
论文里 Pelican-Sim 报了两个数:24 秒对人工,19 秒对仿真器。这是两个不同比较,写的时候不能合成一个数用。

训练规模是约 100 万条轨迹、8000 小时。真实来源三个(AgiBotWorld Beta、RealSource World、RoboMIND),仿真来源四个(LIBERO、ManiSkill2、RoboTwin、RoboCasa)。各来源占比论文没有报告,不能把 3 个真实对 4 个仿真读成 3:4。

📈 三个数据集上的画质

数据集最强基线 PSNRPelican-Sim提升
AgiBotWorld Beta17.64022.276+4.636
RoboMIND21.77023.850+2.080
RoboTwin20.04030.383+10.343
RoboTwin 上 FVD 从 26.600 降到 4.980。

这个提升只在同分布测试集上成立。测试用的是各数据源内部的 held-out 划分,90%/5%/5%,论文自己写明是 "within-source partitions rather than entirely unseen datasets"。Table 1 里那些 OOD 对比是各方法按自身设置报的,不是共享协议,表里的"—"是没报告,不是说不支持。

🎯 四个下游用法

数据生成。 从每任务 50 条干净示范出发,用 GPT-Image-2 生成 10 个初始帧变体,每个变体生成一条 rollout,共 500 条。

原始轨迹生成轨迹总数原始成功率加入生成后
1010011028.5%64.5%
3030033057.0%87.0%
5050055070.0%93.0%
评估是 5 个 RoboTwin 任务,每任务 200 个未见种子,测的是 π0.5 VLA 策略。10 条原始示范加上 100 条生成,成功率就翻了一倍多。

策略评估与排序。 评估器是 Qwen3-VL-2B-Instruct 加 LoRA,每次看 16 帧,输出终态成功、五级进度、画面是否有效。

视频来源数量终态判断准确率进度 MAE
RoboTwin 真实视频100092.6%0.061
Pelican-Sim 生成视频70091.4%0.078
  • 真实仿真视频与生成视频之间只差 1.2 个百分点。生成那 700 个视频由 3 名标注者分层标注多数投票定
  • 5 个策略 checkpoint 的排序,200 条适配 rollout 就完全一致(Spearman 1.000);1000 条时 Pearson 0.994,成功率平均误差 2.4 个百分点
这个 1.2 个百分点要小心解读。VLM 判断的是"生成视频里 depict 的结果像不像成功",不等于世界模型对真实仿真 outcome 的 fidelity。论文自己把这两件事分开了。

动作选择。 让扩散策略一次出 10 个候选,各自预测未来画面,VLM 打分选一个执行。

方法成功率相对单样本与 Oracle 差距
单样本43.2%+0.0 pp24.9 pp
随机选 10 个之一43.5%+0.3 pp24.6 pp
VLM 直接选48.7%+5.5 pp19.4 pp
Ctrl-World 选52.3%+9.1 pp15.8 pp
Pelican-Sim 选63.8%+20.6 pp4.3 pp
Oracle Best-of-1068.1%+24.9 pp0.0 pp
候选数从 8 加到 10,成功率只涨 1.3 个百分点,延迟从 10.7 秒涨到 15.9 秒。这条曲线在 8 之后已经很平。

策略改进。 策略直接在 Pelican-Sim 造的闭环梦境里做 RL,VLM 打分当奖励,GRPO 更新,不用碰真机。起点是 OpenVLA-OFT(SFT),结果是 3 个独立训练种子的平均,最终成功率由 RoboTwin 的任务检查器测量。

方法5 任务平均成功率
初始 OpenVLA-OFT(SFT)62.7%
Iter-SFT(VLM 过滤)67.0%
Pelican-Sim 1.0-GRPO(只用终态)68.5%
Pelican-Sim 1.0-GRPO(全信号)75.4%
RoboTwin-GRPO(oracle)83.8%
  • 从 62.7% 到 75.4%,绝对 +12.7 个百分点,相对 +20.3%
  • 离真仿真器喂出来的 oracle 还差 8.4 个百分点。T4 任务从 53.7% 涨到 68.0%,单任务 +14.3 个百分点

📉 论文自陈的限制

  • URDF 渲染出的动作视频是名义运动学指导,不是硬约束。生成 RGB 里机器人的实际运动不受正运动学严格限制
  • 策略评估用的是 matched-action 协议:同一条动作轨迹在 RoboTwin 真跑一遍,同时喂给世界模型。这是固定轨迹的结果预测,不是在生成观测下的闭环执行
  • 混合域训练消融有混杂因素。加仿真数据后性能提升同时来自域更多样和总量更大,不能单独归因
  • 个别 adapted EWMBench 子指标仍低于最佳基线:RoboMIND 的 HSD 与 nDTW,另两个数据集的 SceneC 与 Diversity
  • 总参数量、各数据来源轨迹占比均未报告

📌 值得关注的地方

生成式世界模型过去常被质疑"看着像但用不了"。这套工作的做法是把评估链路本身当成第一等公民:评估器要先在真仿真视频上标定准不准,再去给生成视频打分。这条交叉验证让后面四个应用的数字有了地基。

  • 8.4 个百分点的 oracle 差距是这篇论文留下的核心问题。是 VLM 打分颗粒度不够,还是世界模型对接触力学建模不足,论文没有细究
  • 100 万条轨迹、8000 小时、数据来源占比未报告,这个透明度比数字本身更值得留意
信源:arXiv:2609.12036v1 全文(Table 1 至 Table 14 与对应附录)。架构与消融取 Table 1 至 Table 6,效率取 Table 7,下游应用取 Table 8 至 Table 12,局限见正文相应段落。腾讯新闻 2026-10-02 的中文解读只用作线索交叉参照,全部数字以论文为准。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens