「机器人拿到了自己的第一条 Scaling 曲线:3 万小时数据把零样本成功率推到 44.1%」

2026 年 9 月 11 日,智元机器人开源 GE-Act 2.0,一个从随机初始化开始、在机器人操作数据上从头预训练的原生世界—动作模型。团队把联合训练数据从 300 小时拉到 30000 小时,人形 G1-OP 的零样本成功率从 17.1% 涨到 44.1%,能拿到非零分数的任务从 39 项涨到 76 项。30…

机器人第一条 Scaling 曲线

2026 年 9 月 11 日,智元机器人开源 GE-Act 2.0,一个从随机初始化开始、在机器人操作数据上从头预训练的原生世界—动作模型。团队把联合训练数据从 300 小时拉到 30000 小时,人形 G1-OP 的零样本成功率从 17.1% 涨到 44.1%,能拿到非零分数的任务从 39 项涨到 76 项。300 小时是 12 天半,30000 小时是 3.4 年。这条曲线此前在语言模型上被反复验证,在机器人上一直缺一份系统证据。

🧭 先把「世界—动作模型」和 VLA 分开

标准的视觉—语言—动作模型(VLA)把摄像头画面和语言指令直接映射成电机指令,等于把物理交互当成文本续写。它的短板是不显式建模「碰一下世界会变成什么样」。

世界—动作模型(WAM)补的就是这一段:先预测场景接下来应该长什么样,再决定怎么动。可把常规视频生成模型塞进实时控制回路,速度和显存都扛不住。

GE-Act 2.0 把这件事拆成三段:

CoAE 是控制优先的视觉分词器。它把一帧 256×384 的画面压成 24 个视觉 token,是常用表征 DINOv3 的十六分之一,压掉的是背景细节,保留的是几何、边界和运动。在 4000 条机器人操作数据的受控测试里,指令与画面匹配准确率 97.95%,是五种对照表征里最高的。token 越少,推理越快,这是真机闭环的前提。

SVP 一步视觉规划器不做几十轮迭代去噪,单次前推就把未来画面生成出来,近端帧给即时控制用,远端帧用来不跑偏。智元披露在 RTX 5090 上生成一组连续动作约需 104 毫秒。

IDM 逆动力学模型拿到想象出的未来,反推成平滑的关节运动。这一步的意义在后面会展开:它决定了「没有标注的数据」能不能用。

🪤 一个隐蔽的坑:有效性鸿沟

让机器人照着想象出来的未来去行动,有个不容易发现的陷阱,智元叫它有效性鸿沟(validity gap)。

物理操作天生是多解的。让人拿一个杯子,从左逼近和从右逼近都对。可人类示范数据只记录了一条路径。如果视觉规划器想象的是从右逼近,而训练示范恰好是从左,传统训练算法会逼着机器人一边看着从右的想象、一边执行向左的动作。这种监督冲突会把不同策略抹平,学出来的策略常常卡住,或者平均成一段没用的动作。

KASO(知识对齐选择性优化)的处理办法是:训练时视觉规划器一次生成多个可能的未来,动作网络先筛出与真实示范对齐的那个,再拿它更新权重。真机消融里,加了 KASO 之后抓取成功率从 22.5% 涨到 37.5%。

📈 四档数据,三条证据线

同一个训练配方,只在最后一阶段换数据规模:300、1200、5000、30000 小时。

训练规模G1-OP 成功率G2-90D 成功率非零任务数(G1-OP)
300 小时17.1%13.4%39 / 100
1200 小时22.6%21.0%51 / 100
5000 小时27.3%23.5%62 / 100
30000 小时44.1%31.1%76 / 100
第一条线是技能被逐格点亮。折叠毛巾、嵌套纸杯、拔插笔盖、插花这类精细动作,在小规模数据上完全做不了,到了 3 万小时才出现非零成功率。

第二条线是成功率持续爬,从 5000 到 30000 小时仍然看不出饱和。

第三条线是富本体带动稀缺本体。训练数据里 G1-OP 贡献超过一半,轮式的 G2-90D 占比不到 2%,后者照样涨了 17.7 个百分点。分纸杯、翻杯垫这类 G2 只有不到一小时数据的任务,也靠别的机器人身上学到的空间动力学补上了。

智元还报了一组数据审计结果:零样本成功率与某个技能类别分到的训练时长呈对数线性相关。擦桌面拿到 824 小时,可靠性 76.7%;用扫帚扫地只有 64 小时,停在 3.3%。

🚧 为什么不直接从文生视频模型改

多数同行的路径是拿一个现成的文生视频模型,再接一个动作头。这条路快,起步就有一百万小时互联网视频带来的世界先验。

智元在官方说明里给的反对理由是目标函数不一致:视频生成模型优化的是画面好看、符合真实分布,机器人要的是动作准确、可执行。两个目标在前半段重合,在后半段分岔。画面里手指离杯子差两厘米,对人眼观感几乎没影响,对抓取成败是决定性差别。

从头预训练的代价是要自己攒数据。这正是下面这套三层数据架构的由来。

🗂️ 三层数据架构:连失败的也能吃进去

3 万小时不是天上掉下来的。智元的数据分三层。

第一层 3.9 万小时「指令—视频」,用来预训练世界模型,学的是环境如何变化,其中含 3000 小时无本体数据,即不带动作标注的第一视角视频和人类操作视频。第二层 3.2 万小时机器人轨迹,用来预训练 IDM,学的是画面这样变化时机器人做了什么,其中含 2000 小时失败操作和真实部署回流数据,不要求成功标签。第三层 3 万小时「指令—视频—动作」完整数据做联合训练,把两种能力接起来。

IDM 在这里是枢纽。给定前后两帧画面反推中间发生了什么动作,无指令、无成功标签、甚至失败的轨迹就都能还原出动作监督信号。机器人在真实部署里踩过的坑不用丢掉。

🎬 定性测试里最值得看的两条

30,000 小时模型的压力测试有两条比数字更能说明问题。

一条是中途改指令。命令机器人抓绿色杯子,手臂伸出去,离接触只差几厘米时指令改成「拿蓝色杯子」。手臂停了约 1.5 秒,脱离原轨迹,转向拿蓝色杯子。另一条同类测试在伸手途中换手,右臂收回,左臂完成抓取。

另一条是反常识关联。桌上放一个杯子、一只鞋、一个鞋盒,指令是「把杯子放进鞋盒」。模型没有顺着「鞋该进鞋盒」的视觉联想走,照着字面指令执行了。

两条测试合起来指向一件事,实时语言指令能压过已经形成的物理惯性。对产线上的机器人来说,这一条比成功率数字更直接。

🥊 开源对位:宇树在前一天,智元在后一天

9 月 10 日宇树开源 UnifoLM-WLA-1.0,6B 参数,单模型统筹桌面与全身移动操作,支持跨任务、跨末端执行器泛化。9 月 11 日智元开源 GE-Act 2.0。两家在硬件出货量上一直互有攻守,智元上半年全球人形出货领先,并刚达成 1.5 万台制造里程碑。

维度宇树 UnifoLM-WLA-1.0智元 GE-Act 2.0
发布时间9 月 10 日9 月 11 日
规模口径6B 参数未公开参数,公开数据规模
覆盖桌面 + 全身移动操作100 项原子任务,20 类技能
公开重点跨任务、跨末端泛化数据 Scaling 曲线与组件方法
评测口径也刻意做严。模型训完不针对测试任务微调、不给示范,直接上真机零样本;测试覆盖 100 项原子任务、20 类技能、两种本体,场景、背景、光照和物体实例都没进过训练集。

🏭 产业侧的对照

开源之外,智元把模型往产线上推的进度也在这个月披露。精灵 G2 已在龙旗科技南昌工厂实现常态化产线运行,被称作全球首个具身智能 3C 精密制造产线的规模化落地,计划 2026 年三季度扩至 100 台。与敏实集团合作的塞尔维亚工厂已于 8 月 29 日投产,规划年产 1000 至 2000 台人形机器人。

衡量标准这一侧,宇树创始人王兴兴此前给具身智能的「ChatGPT 时刻」下过一个判据:在 80% 的陌生场景中通过自然指令完成 80% 的任务,他估计快则 2 至 3 年、慢则 5 至 10 年。

把这两组数字放在一起看,44.1% 距离那个判据还差着一半以上,而产线回流数据正是补这段差距的燃料。智元的第二层数据里那 2000 小时失败操作与部署回流,来源就在这。

⚠️ 44.1% 意味着什么

44.1% 的零样本成功率,放在非受限环境里离「能干活」还远。智元自己在说明里也留了口子:现阶段实验只证明,在该团队设定的模型架构、数据体系和评测范围内,增加训练数据能提高机器人完成陌生任务的能力;能不能扩展到更多本体、长流程任务和非结构化环境,还要更多测试。

值得盯的是三件事。第一,从 5000 小时到 30000 小时曲线没平,下一段数据规模能不能续上。第二,G2-90D 那种不到 2% 数据占比还能涨 17.7 个百分点的迁移,能不能复制到第三、第四种本体。第三,这两家的开源模型扩散之后,中小本体厂的软件壁垒会被压低,数据壁垒会被抬高,上游的数据采集和仿真环节确定性反而更强。

参考信源

1. Humanoids Daily《AGIBOT Open-Sources GE-Act 2.0, Challenging Unitree in the Open Embodied AI Race》(2026-09-11):CoAE、SVP、IDM 三段结构,KASO 消融 22.5% 至 37.5%,四档 Scaling 数据与跨本体迁移。 2. 深圳商报·读创《智元发布 GE-Act 2.0:训练数据扩大百倍,机器人零样本成功率提升》(2026-09-09):100 项任务、20 类技能、两种本体,未微调未示范的零样本设定。 3. 智元机器人官方发布与 GE-Act 2.0 技术论文(arXiv:2609.05588):三层数据架构、CoAE 压缩至 24 token、RTX 5090 上 104 毫秒。 4. 宇树科技开源 UnifoLM-WLA-1.0 公告(2026-09-10)与 Humanoids Daily 相关报道:6B 参数、跨任务跨末端泛化。 5. 行业日报对 9 月第二周世界模型密集发布的梳理(2026-09-12):GE-Sim 2.0、UnifoLM-X2-1.0、HERON-World Model、VWA 的时间线。

#具身智能 #世界模型 #开源

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

先把结论摆前面:这篇的骨架我核过了,站得住。下面按轻重排几条偏差。

一、日期有三个版本,原帖那个我核不到

论文 arXiv:2609.05588,9 月 4 日提交,署名 AgiBot Research Team 加 44 位作者。智元官网的英文稿写 9 月 10 日、上海。中文媒体那版写 9 月 9 日发布。原帖写的「2026 年 9 月 11 日开源」,我在哪个一手出处里都没找到。论文 9 月 4 日就挂出来了,差着整整一周。

二、「CoAE 理解力不降反升」只对了一半

升的那半是指令—画面匹配:97.95%,五种对照表征里最高,错误率 2.05%,比次优的 DC-AE 低 24%。降的那半原帖没说:CoAE 的动作反推 MAE 比 DINOv3、V-JEPA 2.1 差 13%–31%。

这不算挑刺。这就是这笔交易的标价:用十六分之一的 token 数,换 13%–31% 的动作精度折价。对要进实时控制回路的模块划算;对吃精细接触力的任务,这个折价得重新估一遍。

三、别把「单次前推」读成全链路单步

「单步」在论文里只指视觉未来的生成。动作侧仍是 5 步 Euler 积分,执行稠密动作块的前 30 个动作后重新预测。动作窗口 52 帧,30 Hz 下覆盖约 1.73 秒。整条链路不是一次前推跑完的。

四、22.5% → 37.5% 那张表,论文自己贴了限制

KASO 消融的样本量:四物体抓取每目标 10 次,单物体 25 次。论文原话是这张表不该被当作最终性能解读。消融里还有一列更有意思——指令跟随率 KASO 和 E2E+PT 打平,都是 95%。增益全部落在「已经选对目标之后能不能抓到」这一段:单物体抓取 12% → 40%。所以 KASO 治的不是理解,是手。

五、三层数据不能相加

3.9 万小时「指令—视频」、3.2 万小时机器人轨迹、3 万小时联合训练。论文明确写了三个阶段存在数据重用,不能相加理解为互不重复的总量。原帖把三个数并排罗列,读起来像 10 万小时。真实去重之后是多少,论文没给。

六、同批评测里还有一张表是落后的

原帖说 RoboTwin 陌生环境 60.52%、GenieSim 0.770,超过 π0.5 和 GR00T N1.7,这句对。同一批里的 LIBERO-Plus,GE-Act 2.0 是 80.4%,低于 π0.5 的 84.4%。

补几个原帖漏掉的数

模型规模:SVP 的 DiT 2.51B(36 块,宽 2048),IDM 0.56B(28 块,宽 1152),理解模块是冻结的 Qwen3.5-2B。原帖写「未公开参数」,论文里有。

技能覆盖的相关性:Pearson r = 0.80,Spearman ρ = 0.85,大约每十倍数据提升 1.94 个 logit。原帖说的「对数线性相关」,把系数补上更硬。Wipe 拿到 824.1 小时、76.7%;Sweep 只有 64.6 小时、3.3%。有些技能难,难在数据长尾没盖到它,跟动作本身没关系。

还有一句得说明白:44.1% 是 100 项任务、每项 10 次试验的经验成功率。G2-90D 的 100 条轨迹里,有 22 条是下降的。

顺带一句宇树

9 月 10 日那版 UnifoLM-WLA-1.0,项目页上线了,Code / Models / Datasets 三栏当时挂的还是 Coming soon。真机数据约 2500 小时。跟智元这边 3 万小时的联合训练规模摆在一起,两家的公开口径根本不在一个量级——一家先把权重给出去,一家先把曲线画出来。

下一根钉子

论文自己指了方向:第一视角人类视频目前只用了 3000 小时,不到 SVP 语料的 8%。下一个十倍的原料几乎还没动。

我更想盯的是 G2-90D 上那 6 个数据不足 2 小时的技能组,现在有 5 个从 0% 变成了非零。这种「蹭别人数据学会自己那手活」的迁移,能不能复制到第三种、第四种本体上。能,具身数据就不再是各家自攒的家底;不能,这仍然只是一条单本体的曲线。

3 万小时,换算过来是 3.4 年,一个人不吃不喝不睡连轴转。换来的,是 100 项陌生任务里 44 项能做成。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens