教机器人叠衣服,做对了 70%,做砸了剩下的。中间那段灰地带最难办:动作看着对,手也伸对了位置,夹爪也合上了,可轨迹偏了几厘米,衣服滑出去了。这段灰地带占掉的分量比成功还大。
要缩小这段灰地带,主流做法是采更多真机数据,或者把仿真器做得更真。2026 年 9 月 11 日,北京人形机器人创新中心(X-Humanoid)放出了一条另一条路:让一个生成模型当"梦境",在里面反复练。
- 论文:Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence,arXiv:2609.12036
- 作者机构:Beijing Innovation Center of Humanoid Robotics (X-Humanoid),WFM System Group
- 通讯署名含 jack.zou、vito.dai、jian.tang、jason.ju;开源仓库 Open-X-Humanoid/Pelican-Sim1.0
🧩 一个动作,两种写法
问题出在动作怎么表示。机械臂的动作是一串精确数字:每个关节转几度、夹爪开多大。这套数字严谨,可模型盯着数字看,并不知道手臂在画面里会划出什么样的弧线。反过来,把动作画成骨架视频让它"看图",画面直观,可一张末端执行器的图只说得出手在哪,说不出整条手臂是怎么弯的。
Pelican-Sim 两边都要。
- 统一动作表示:28 维,左右各 14 维,每侧是 7 维手臂关节角、1 维夹爪开合、6 维灵巧手关节值
- 缺位填零。六轴机械臂的第 7 个关节维度填 0,单臂机器人缺失那一侧 14 维全填 0
- 动作视频:用机器人 URDF 与相机标定,把这串数字做正向运动学再投影,栅格化成与 RGB 严格对齐的全身骨架视频;夹爪连杆按 open、transitional、closed 涂三种颜色
两路信息注入同一个 Video DiT 的不同层,没有各自独立的预测网络。Video DiT 一共 28 层。
| 层(零基索引) | 注入什么 | 方式 |
|---|---|---|
| 1、3、5 … 27(14 层) | 数值动作 | scale-and-shift 调制 |
| 0、2、4 … 26(14 层) | 动作视频 | Context Block 残差 |
消融结果支持这个克制。两种条件每个 block 都同时注入,PSNR 只比交替注入高 0.075 dB(AgiBotWorld Beta)与 0.051 dB(RoboMIND)。论文的判断是交替注入已经够用。
动作条件本身的消融差距更大:什么都不给 PSNR 17.684,只给数值 19.238,只给视频 21.276,两者都给 22.276。
🏥 挂一个分诊台
机器人型号多到能把单一网络撑坏。六轴臂和人形双臂的运动逻辑不是一回事,抓葡萄和抓酒瓶的手法不是一回事。一个统一网络硬扛,容易变成"一招鲜吃遍天,哪个都不精"。
Pelican-Sim 在每个 Video DiT block 的 dense FFN 位置换成稀疏 MoE。
- 共享专家 1 个,路由专家 8 个,每个 token 激活 top-2
- 路由用 sigmoid token-choice routing,带 selection bias
- 路由分支在前 2000 步从 0 线性升到 1
- MoE 覆盖全部 28 层
效果:FVD 从 17.380 降到 10.850,降 6.530。训练数据与优化步数完全相同。
⚡ 把 35 步压成 4 步
世界模型要真当模拟器用,采样速度就变成了地板。动作筛选、RL 训练环境,都是要成百上千次调用。
分两步走。第一步因果适配,把双向注意力改成块因果注意力,每个时间 chunk 只能看自己和历史 chunk,得到一个 35 步的因果教师。第二步少步蒸馏,用分布匹配蒸馏(DMD)训练一个 4 步的学生,训练中保留少量 teacher-forced 更新以稳住动作可控性。
- 21 帧基准上,4 步模型 2.2 秒出结果,5.67 倍加速
- 推理时每个 latent chunk 走 4 步去噪,结果追加进滚动上下文窗口并用 KV 缓存
📐 生成一条轨迹要多久
| 方式 | 秒/轨迹 | 轨迹/小时 | 重置(分钟/轨迹) |
|---|---|---|---|
| 人工采集 | 60 | 60 | 0.4 |
| Pelican-Sim 1.0 | 24 | 150 | 0 |
| RoboTwin 仿真器 | 55 | 65.5 | 0 |
| Pelican-Sim 1.0(仿真对比口径) | 19 | 189.5 | 0 |
论文里 Pelican-Sim 报了两个数:24 秒对人工,19 秒对仿真器。这是两个不同比较,写的时候不能合成一个数用。
训练规模是约 100 万条轨迹、8000 小时。真实来源三个(AgiBotWorld Beta、RealSource World、RoboMIND),仿真来源四个(LIBERO、ManiSkill2、RoboTwin、RoboCasa)。各来源占比论文没有报告,不能把 3 个真实对 4 个仿真读成 3:4。
📈 三个数据集上的画质
| 数据集 | 最强基线 PSNR | Pelican-Sim | 提升 |
|---|---|---|---|
| AgiBotWorld Beta | 17.640 | 22.276 | +4.636 |
| RoboMIND | 21.770 | 23.850 | +2.080 |
| RoboTwin | 20.040 | 30.383 | +10.343 |
RoboTwin 上 FVD 从 26.600 降到 4.980。
这个提升只在同分布测试集上成立。测试用的是各数据源内部的 held-out 划分,90%/5%/5%,论文自己写明是 "within-source partitions rather than entirely unseen datasets"。Table 1 里那些 OOD 对比是各方法按自身设置报的,不是共享协议,表里的"—"是没报告,不是说不支持。
🎯 四个下游用法
数据生成。 从每任务 50 条干净示范出发,用 GPT-Image-2 生成 10 个初始帧变体,每个变体生成一条 rollout,共 500 条。
| 原始轨迹 | 生成轨迹 | 总数 | 原始成功率 | 加入生成后 |
|---|---|---|---|---|
| 10 | 100 | 110 | 28.5% | 64.5% |
| 30 | 300 | 330 | 57.0% | 87.0% |
| 50 | 500 | 550 | 70.0% | 93.0% |
评估是 5 个 RoboTwin 任务,每任务 200 个未见种子,测的是 π0.5 VLA 策略。10 条原始示范加上 100 条生成,成功率就翻了一倍多。
策略评估与排序。 评估器是 Qwen3-VL-2B-Instruct 加 LoRA,每次看 16 帧,输出终态成功、五级进度、画面是否有效。
| 视频来源 | 数量 | 终态判断准确率 | 进度 MAE |
|---|---|---|---|
| RoboTwin 真实视频 | 1000 | 92.6% | 0.061 |
| Pelican-Sim 生成视频 | 700 | 91.4% | 0.078 |
- 真实仿真视频与生成视频之间只差 1.2 个百分点。生成那 700 个视频由 3 名标注者分层标注多数投票定
- 5 个策略 checkpoint 的排序,200 条适配 rollout 就完全一致(Spearman 1.000);1000 条时 Pearson 0.994,成功率平均误差 2.4 个百分点
这个 1.2 个百分点要小心解读。VLM 判断的是"生成视频里 depict 的结果像不像成功",不等于世界模型对真实仿真 outcome 的 fidelity。论文自己把这两件事分开了。
动作选择。 让扩散策略一次出 10 个候选,各自预测未来画面,VLM 打分选一个执行。
| 方法 | 成功率 | 相对单样本 | 与 Oracle 差距 |
|---|---|---|---|
| 单样本 | 43.2% | +0.0 pp | 24.9 pp |
| 随机选 10 个之一 | 43.5% | +0.3 pp | 24.6 pp |
| VLM 直接选 | 48.7% | +5.5 pp | 19.4 pp |
| Ctrl-World 选 | 52.3% | +9.1 pp | 15.8 pp |
| Pelican-Sim 选 | 63.8% | +20.6 pp | 4.3 pp |
| Oracle Best-of-10 | 68.1% | +24.9 pp | 0.0 pp |
候选数从 8 加到 10,成功率只涨 1.3 个百分点,延迟从 10.7 秒涨到 15.9 秒。这条曲线在 8 之后已经很平。
策略改进。 策略直接在 Pelican-Sim 造的闭环梦境里做 RL,VLM 打分当奖励,GRPO 更新,不用碰真机。起点是 OpenVLA-OFT(SFT),结果是 3 个独立训练种子的平均,最终成功率由 RoboTwin 的任务检查器测量。
| 方法 | 5 任务平均成功率 |
|---|---|
| 初始 OpenVLA-OFT(SFT) | 62.7% |
| Iter-SFT(VLM 过滤) | 67.0% |
| Pelican-Sim 1.0-GRPO(只用终态) | 68.5% |
| Pelican-Sim 1.0-GRPO(全信号) | 75.4% |
| RoboTwin-GRPO(oracle) | 83.8% |
- 从 62.7% 到 75.4%,绝对 +12.7 个百分点,相对 +20.3%
- 离真仿真器喂出来的 oracle 还差 8.4 个百分点。T4 任务从 53.7% 涨到 68.0%,单任务 +14.3 个百分点
📉 论文自陈的限制
- URDF 渲染出的动作视频是名义运动学指导,不是硬约束。生成 RGB 里机器人的实际运动不受正运动学严格限制
- 策略评估用的是 matched-action 协议:同一条动作轨迹在 RoboTwin 真跑一遍,同时喂给世界模型。这是固定轨迹的结果预测,不是在生成观测下的闭环执行
- 混合域训练消融有混杂因素。加仿真数据后性能提升同时来自域更多样和总量更大,不能单独归因
- 个别 adapted EWMBench 子指标仍低于最佳基线:RoboMIND 的 HSD 与 nDTW,另两个数据集的 SceneC 与 Diversity
- 总参数量、各数据来源轨迹占比均未报告
📌 值得关注的地方
生成式世界模型过去常被质疑"看着像但用不了"。这套工作的做法是把评估链路本身当成第一等公民:评估器要先在真仿真视频上标定准不准,再去给生成视频打分。这条交叉验证让后面四个应用的数字有了地基。
- 8.4 个百分点的 oracle 差距是这篇论文留下的核心问题。是 VLM 打分颗粒度不够,还是世界模型对接触力学建模不足,论文没有细究
- 100 万条轨迹、8000 小时、数据来源占比未报告,这个透明度比数字本身更值得留意
信源:arXiv:2609.12036v1 全文(Table 1 至 Table 14 与对应附录)。架构与消融取 Table 1 至 Table 6,效率取 Table 7,下游应用取 Table 8 至 Table 12,局限见正文相应段落。腾讯新闻 2026-10-02 的中文解读只用作线索交叉参照,全部数字以论文为准。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。