2026 年 9 月 11 日,智元机器人开源 GE-Act 2.0,一个从随机初始化开始、在机器人操作数据上从头预训练的原生世界—动作模型。团队把联合训练数据从 300 小时拉到 30000 小时,人形 G1-OP 的零样本成功率从 17.1% 涨到 44.1%,能拿到非零分数的任务从 39 项涨到 76 项。300 小时是 12 天半,30000 小时是 3.4 年。这条曲线此前在语言模型上被反复验证,在机器人上一直缺一份系统证据。
🧭 先把「世界—动作模型」和 VLA 分开
标准的视觉—语言—动作模型(VLA)把摄像头画面和语言指令直接映射成电机指令,等于把物理交互当成文本续写。它的短板是不显式建模「碰一下世界会变成什么样」。
世界—动作模型(WAM)补的就是这一段:先预测场景接下来应该长什么样,再决定怎么动。可把常规视频生成模型塞进实时控制回路,速度和显存都扛不住。
GE-Act 2.0 把这件事拆成三段:
CoAE 是控制优先的视觉分词器。它把一帧 256×384 的画面压成 24 个视觉 token,是常用表征 DINOv3 的十六分之一,压掉的是背景细节,保留的是几何、边界和运动。在 4000 条机器人操作数据的受控测试里,指令与画面匹配准确率 97.95%,是五种对照表征里最高的。token 越少,推理越快,这是真机闭环的前提。
SVP 一步视觉规划器不做几十轮迭代去噪,单次前推就把未来画面生成出来,近端帧给即时控制用,远端帧用来不跑偏。智元披露在 RTX 5090 上生成一组连续动作约需 104 毫秒。
IDM 逆动力学模型拿到想象出的未来,反推成平滑的关节运动。这一步的意义在后面会展开:它决定了「没有标注的数据」能不能用。
🪤 一个隐蔽的坑:有效性鸿沟
让机器人照着想象出来的未来去行动,有个不容易发现的陷阱,智元叫它有效性鸿沟(validity gap)。
物理操作天生是多解的。让人拿一个杯子,从左逼近和从右逼近都对。可人类示范数据只记录了一条路径。如果视觉规划器想象的是从右逼近,而训练示范恰好是从左,传统训练算法会逼着机器人一边看着从右的想象、一边执行向左的动作。这种监督冲突会把不同策略抹平,学出来的策略常常卡住,或者平均成一段没用的动作。
KASO(知识对齐选择性优化)的处理办法是:训练时视觉规划器一次生成多个可能的未来,动作网络先筛出与真实示范对齐的那个,再拿它更新权重。真机消融里,加了 KASO 之后抓取成功率从 22.5% 涨到 37.5%。
📈 四档数据,三条证据线
同一个训练配方,只在最后一阶段换数据规模:300、1200、5000、30000 小时。
| 训练规模 | G1-OP 成功率 | G2-90D 成功率 | 非零任务数(G1-OP) |
|---|---|---|---|
| 300 小时 | 17.1% | 13.4% | 39 / 100 |
| 1200 小时 | 22.6% | 21.0% | 51 / 100 |
| 5000 小时 | 27.3% | 23.5% | 62 / 100 |
| 30000 小时 | 44.1% | 31.1% | 76 / 100 |
第一条线是技能被逐格点亮。折叠毛巾、嵌套纸杯、拔插笔盖、插花这类精细动作,在小规模数据上完全做不了,到了 3 万小时才出现非零成功率。
第二条线是成功率持续爬,从 5000 到 30000 小时仍然看不出饱和。
第三条线是富本体带动稀缺本体。训练数据里 G1-OP 贡献超过一半,轮式的 G2-90D 占比不到 2%,后者照样涨了 17.7 个百分点。分纸杯、翻杯垫这类 G2 只有不到一小时数据的任务,也靠别的机器人身上学到的空间动力学补上了。
智元还报了一组数据审计结果:零样本成功率与某个技能类别分到的训练时长呈对数线性相关。擦桌面拿到 824 小时,可靠性 76.7%;用扫帚扫地只有 64 小时,停在 3.3%。
🚧 为什么不直接从文生视频模型改
多数同行的路径是拿一个现成的文生视频模型,再接一个动作头。这条路快,起步就有一百万小时互联网视频带来的世界先验。
智元在官方说明里给的反对理由是目标函数不一致:视频生成模型优化的是画面好看、符合真实分布,机器人要的是动作准确、可执行。两个目标在前半段重合,在后半段分岔。画面里手指离杯子差两厘米,对人眼观感几乎没影响,对抓取成败是决定性差别。
从头预训练的代价是要自己攒数据。这正是下面这套三层数据架构的由来。
🗂️ 三层数据架构:连失败的也能吃进去
3 万小时不是天上掉下来的。智元的数据分三层。
第一层 3.9 万小时「指令—视频」,用来预训练世界模型,学的是环境如何变化,其中含 3000 小时无本体数据,即不带动作标注的第一视角视频和人类操作视频。第二层 3.2 万小时机器人轨迹,用来预训练 IDM,学的是画面这样变化时机器人做了什么,其中含 2000 小时失败操作和真实部署回流数据,不要求成功标签。第三层 3 万小时「指令—视频—动作」完整数据做联合训练,把两种能力接起来。
IDM 在这里是枢纽。给定前后两帧画面反推中间发生了什么动作,无指令、无成功标签、甚至失败的轨迹就都能还原出动作监督信号。机器人在真实部署里踩过的坑不用丢掉。
🎬 定性测试里最值得看的两条
30,000 小时模型的压力测试有两条比数字更能说明问题。
一条是中途改指令。命令机器人抓绿色杯子,手臂伸出去,离接触只差几厘米时指令改成「拿蓝色杯子」。手臂停了约 1.5 秒,脱离原轨迹,转向拿蓝色杯子。另一条同类测试在伸手途中换手,右臂收回,左臂完成抓取。
另一条是反常识关联。桌上放一个杯子、一只鞋、一个鞋盒,指令是「把杯子放进鞋盒」。模型没有顺着「鞋该进鞋盒」的视觉联想走,照着字面指令执行了。
两条测试合起来指向一件事,实时语言指令能压过已经形成的物理惯性。对产线上的机器人来说,这一条比成功率数字更直接。
🥊 开源对位:宇树在前一天,智元在后一天
9 月 10 日宇树开源 UnifoLM-WLA-1.0,6B 参数,单模型统筹桌面与全身移动操作,支持跨任务、跨末端执行器泛化。9 月 11 日智元开源 GE-Act 2.0。两家在硬件出货量上一直互有攻守,智元上半年全球人形出货领先,并刚达成 1.5 万台制造里程碑。
| 维度 | 宇树 UnifoLM-WLA-1.0 | 智元 GE-Act 2.0 |
|---|---|---|
| 发布时间 | 9 月 10 日 | 9 月 11 日 |
| 规模口径 | 6B 参数 | 未公开参数,公开数据规模 |
| 覆盖 | 桌面 + 全身移动操作 | 100 项原子任务,20 类技能 |
| 公开重点 | 跨任务、跨末端泛化 | 数据 Scaling 曲线与组件方法 |
评测口径也刻意做严。模型训完不针对测试任务微调、不给示范,直接上真机零样本;测试覆盖 100 项原子任务、20 类技能、两种本体,场景、背景、光照和物体实例都没进过训练集。
🏭 产业侧的对照
开源之外,智元把模型往产线上推的进度也在这个月披露。精灵 G2 已在龙旗科技南昌工厂实现常态化产线运行,被称作全球首个具身智能 3C 精密制造产线的规模化落地,计划 2026 年三季度扩至 100 台。与敏实集团合作的塞尔维亚工厂已于 8 月 29 日投产,规划年产 1000 至 2000 台人形机器人。
衡量标准这一侧,宇树创始人王兴兴此前给具身智能的「ChatGPT 时刻」下过一个判据:在 80% 的陌生场景中通过自然指令完成 80% 的任务,他估计快则 2 至 3 年、慢则 5 至 10 年。
把这两组数字放在一起看,44.1% 距离那个判据还差着一半以上,而产线回流数据正是补这段差距的燃料。智元的第二层数据里那 2000 小时失败操作与部署回流,来源就在这。
⚠️ 44.1% 意味着什么
44.1% 的零样本成功率,放在非受限环境里离「能干活」还远。智元自己在说明里也留了口子:现阶段实验只证明,在该团队设定的模型架构、数据体系和评测范围内,增加训练数据能提高机器人完成陌生任务的能力;能不能扩展到更多本体、长流程任务和非结构化环境,还要更多测试。
值得盯的是三件事。第一,从 5000 小时到 30000 小时曲线没平,下一段数据规模能不能续上。第二,G2-90D 那种不到 2% 数据占比还能涨 17.7 个百分点的迁移,能不能复制到第三、第四种本体。第三,这两家的开源模型扩散之后,中小本体厂的软件壁垒会被压低,数据壁垒会被抬高,上游的数据采集和仿真环节确定性反而更强。
参考信源
- Humanoids Daily《AGIBOT Open-Sources GE-Act 2.0, Challenging Unitree in the Open Embodied AI Race》(2026-09-11):CoAE、SVP、IDM 三段结构,KASO 消融 22.5% 至 37.5%,四档 Scaling 数据与跨本体迁移。
- 深圳商报·读创《智元发布 GE-Act 2.0:训练数据扩大百倍,机器人零样本成功率提升》(2026-09-09):100 项任务、20 类技能、两种本体,未微调未示范的零样本设定。
- 智元机器人官方发布与 GE-Act 2.0 技术论文(arXiv:2609.05588):三层数据架构、CoAE 压缩至 24 token、RTX 5090 上 104 毫秒。
- 宇树科技开源 UnifoLM-WLA-1.0 公告(2026-09-10)与 Humanoids Daily 相关报道:6B 参数、跨任务跨末端泛化。
- 行业日报对 9 月第二周世界模型密集发布的梳理(2026-09-12):GE-Sim 2.0、UnifoLM-X2-1.0、HERON-World Model、VWA 的时间线。
#具身智能 #世界模型 #开源
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。