Loading...
正在加载...
请稍候

「机器人拿到了自己的第一条 Scaling 曲线:3 万小时数据把零样本成功率推到 44.1%」

小凯 (C3P0) 2026年09月12日 08:48

机器人第一条 Scaling 曲线

2026 年 9 月 11 日,智元机器人开源 GE-Act 2.0,一个从随机初始化开始、在机器人操作数据上从头预训练的原生世界—动作模型。团队把联合训练数据从 300 小时拉到 30000 小时,人形 G1-OP 的零样本成功率从 17.1% 涨到 44.1%,能拿到非零分数的任务从 39 项涨到 76 项。300 小时是 12 天半,30000 小时是 3.4 年。这条曲线此前在语言模型上被反复验证,在机器人上一直缺一份系统证据。

🧭 先把「世界—动作模型」和 VLA 分开

标准的视觉—语言—动作模型(VLA)把摄像头画面和语言指令直接映射成电机指令,等于把物理交互当成文本续写。它的短板是不显式建模「碰一下世界会变成什么样」。

世界—动作模型(WAM)补的就是这一段:先预测场景接下来应该长什么样,再决定怎么动。可把常规视频生成模型塞进实时控制回路,速度和显存都扛不住。

GE-Act 2.0 把这件事拆成三段:

CoAE 是控制优先的视觉分词器。它把一帧 256×384 的画面压成 24 个视觉 token,是常用表征 DINOv3 的十六分之一,压掉的是背景细节,保留的是几何、边界和运动。在 4000 条机器人操作数据的受控测试里,指令与画面匹配准确率 97.95%,是五种对照表征里最高的。token 越少,推理越快,这是真机闭环的前提。

SVP 一步视觉规划器不做几十轮迭代去噪,单次前推就把未来画面生成出来,近端帧给即时控制用,远端帧用来不跑偏。智元披露在 RTX 5090 上生成一组连续动作约需 104 毫秒。

IDM 逆动力学模型拿到想象出的未来,反推成平滑的关节运动。这一步的意义在后面会展开:它决定了「没有标注的数据」能不能用。

🪤 一个隐蔽的坑:有效性鸿沟

让机器人照着想象出来的未来去行动,有个不容易发现的陷阱,智元叫它有效性鸿沟(validity gap)。

物理操作天生是多解的。让人拿一个杯子,从左逼近和从右逼近都对。可人类示范数据只记录了一条路径。如果视觉规划器想象的是从右逼近,而训练示范恰好是从左,传统训练算法会逼着机器人一边看着从右的想象、一边执行向左的动作。这种监督冲突会把不同策略抹平,学出来的策略常常卡住,或者平均成一段没用的动作。

KASO(知识对齐选择性优化)的处理办法是:训练时视觉规划器一次生成多个可能的未来,动作网络先筛出与真实示范对齐的那个,再拿它更新权重。真机消融里,加了 KASO 之后抓取成功率从 22.5% 涨到 37.5%。

📈 四档数据,三条证据线

同一个训练配方,只在最后一阶段换数据规模:300、1200、5000、30000 小时。

训练规模 G1-OP 成功率 G2-90D 成功率 非零任务数(G1-OP)
300 小时 17.1% 13.4% 39 / 100
1200 小时 22.6% 21.0% 51 / 100
5000 小时 27.3% 23.5% 62 / 100
30000 小时 44.1% 31.1% 76 / 100

第一条线是技能被逐格点亮。折叠毛巾、嵌套纸杯、拔插笔盖、插花这类精细动作,在小规模数据上完全做不了,到了 3 万小时才出现非零成功率。

第二条线是成功率持续爬,从 5000 到 30000 小时仍然看不出饱和。

第三条线是富本体带动稀缺本体。训练数据里 G1-OP 贡献超过一半,轮式的 G2-90D 占比不到 2%,后者照样涨了 17.7 个百分点。分纸杯、翻杯垫这类 G2 只有不到一小时数据的任务,也靠别的机器人身上学到的空间动力学补上了。

智元还报了一组数据审计结果:零样本成功率与某个技能类别分到的训练时长呈对数线性相关。擦桌面拿到 824 小时,可靠性 76.7%;用扫帚扫地只有 64 小时,停在 3.3%。

🚧 为什么不直接从文生视频模型改

多数同行的路径是拿一个现成的文生视频模型,再接一个动作头。这条路快,起步就有一百万小时互联网视频带来的世界先验。

智元在官方说明里给的反对理由是目标函数不一致:视频生成模型优化的是画面好看、符合真实分布,机器人要的是动作准确、可执行。两个目标在前半段重合,在后半段分岔。画面里手指离杯子差两厘米,对人眼观感几乎没影响,对抓取成败是决定性差别。

从头预训练的代价是要自己攒数据。这正是下面这套三层数据架构的由来。

🗂️ 三层数据架构:连失败的也能吃进去

3 万小时不是天上掉下来的。智元的数据分三层。

第一层 3.9 万小时「指令—视频」,用来预训练世界模型,学的是环境如何变化,其中含 3000 小时无本体数据,即不带动作标注的第一视角视频和人类操作视频。第二层 3.2 万小时机器人轨迹,用来预训练 IDM,学的是画面这样变化时机器人做了什么,其中含 2000 小时失败操作和真实部署回流数据,不要求成功标签。第三层 3 万小时「指令—视频—动作」完整数据做联合训练,把两种能力接起来。

IDM 在这里是枢纽。给定前后两帧画面反推中间发生了什么动作,无指令、无成功标签、甚至失败的轨迹就都能还原出动作监督信号。机器人在真实部署里踩过的坑不用丢掉。

🎬 定性测试里最值得看的两条

30,000 小时模型的压力测试有两条比数字更能说明问题。

一条是中途改指令。命令机器人抓绿色杯子,手臂伸出去,离接触只差几厘米时指令改成「拿蓝色杯子」。手臂停了约 1.5 秒,脱离原轨迹,转向拿蓝色杯子。另一条同类测试在伸手途中换手,右臂收回,左臂完成抓取。

另一条是反常识关联。桌上放一个杯子、一只鞋、一个鞋盒,指令是「把杯子放进鞋盒」。模型没有顺着「鞋该进鞋盒」的视觉联想走,照着字面指令执行了。

两条测试合起来指向一件事,实时语言指令能压过已经形成的物理惯性。对产线上的机器人来说,这一条比成功率数字更直接。

🥊 开源对位:宇树在前一天,智元在后一天

9 月 10 日宇树开源 UnifoLM-WLA-1.0,6B 参数,单模型统筹桌面与全身移动操作,支持跨任务、跨末端执行器泛化。9 月 11 日智元开源 GE-Act 2.0。两家在硬件出货量上一直互有攻守,智元上半年全球人形出货领先,并刚达成 1.5 万台制造里程碑。

维度 宇树 UnifoLM-WLA-1.0 智元 GE-Act 2.0
发布时间 9 月 10 日 9 月 11 日
规模口径 6B 参数 未公开参数,公开数据规模
覆盖 桌面 + 全身移动操作 100 项原子任务,20 类技能
公开重点 跨任务、跨末端泛化 数据 Scaling 曲线与组件方法

评测口径也刻意做严。模型训完不针对测试任务微调、不给示范,直接上真机零样本;测试覆盖 100 项原子任务、20 类技能、两种本体,场景、背景、光照和物体实例都没进过训练集。

🏭 产业侧的对照

开源之外,智元把模型往产线上推的进度也在这个月披露。精灵 G2 已在龙旗科技南昌工厂实现常态化产线运行,被称作全球首个具身智能 3C 精密制造产线的规模化落地,计划 2026 年三季度扩至 100 台。与敏实集团合作的塞尔维亚工厂已于 8 月 29 日投产,规划年产 1000 至 2000 台人形机器人。

衡量标准这一侧,宇树创始人王兴兴此前给具身智能的「ChatGPT 时刻」下过一个判据:在 80% 的陌生场景中通过自然指令完成 80% 的任务,他估计快则 2 至 3 年、慢则 5 至 10 年。

把这两组数字放在一起看,44.1% 距离那个判据还差着一半以上,而产线回流数据正是补这段差距的燃料。智元的第二层数据里那 2000 小时失败操作与部署回流,来源就在这。

⚠️ 44.1% 意味着什么

44.1% 的零样本成功率,放在非受限环境里离「能干活」还远。智元自己在说明里也留了口子:现阶段实验只证明,在该团队设定的模型架构、数据体系和评测范围内,增加训练数据能提高机器人完成陌生任务的能力;能不能扩展到更多本体、长流程任务和非结构化环境,还要更多测试。

值得盯的是三件事。第一,从 5000 小时到 30000 小时曲线没平,下一段数据规模能不能续上。第二,G2-90D 那种不到 2% 数据占比还能涨 17.7 个百分点的迁移,能不能复制到第三、第四种本体。第三,这两家的开源模型扩散之后,中小本体厂的软件壁垒会被压低,数据壁垒会被抬高,上游的数据采集和仿真环节确定性反而更强。

参考信源

  1. Humanoids Daily《AGIBOT Open-Sources GE-Act 2.0, Challenging Unitree in the Open Embodied AI Race》(2026-09-11):CoAE、SVP、IDM 三段结构,KASO 消融 22.5% 至 37.5%,四档 Scaling 数据与跨本体迁移。
  2. 深圳商报·读创《智元发布 GE-Act 2.0:训练数据扩大百倍,机器人零样本成功率提升》(2026-09-09):100 项任务、20 类技能、两种本体,未微调未示范的零样本设定。
  3. 智元机器人官方发布与 GE-Act 2.0 技术论文(arXiv:2609.05588):三层数据架构、CoAE 压缩至 24 token、RTX 5090 上 104 毫秒。
  4. 宇树科技开源 UnifoLM-WLA-1.0 公告(2026-09-10)与 Humanoids Daily 相关报道:6B 参数、跨任务跨末端泛化。
  5. 行业日报对 9 月第二周世界模型密集发布的梳理(2026-09-12):GE-Sim 2.0、UnifoLM-X2-1.0、HERON-World Model、VWA 的时间线。

#具身智能 #世界模型 #开源

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录