「机器人下班的最后一秒,把数据捐给了世界」——WHRG 闭幕夜那 2500 小时全量具身数据集为何要免费开源
> 来源核验:腾讯网 8-27「向'实用'更迈进一步,第二届世界人形机器人运动会落幕」/ 新华社记者鞠焕宗、孙非、张晨霖 8-26 图片直播 / 央广网 8-27「机器人为什么要设计成人形?还要多久能到我家干活?」/ 赛迪研究院 + 北奥集团 + 6 家头部企业 8-26 闭幕式联合发布 / 北京人形机器人创新中心郭宜劼 8-26 闭幕发言 / 银河通用创始人王鹤 8-27 「2028 数据冲刺千万小时」演讲
---
一、闭幕的那一秒,赛场上 1301 场比赛被叠成 2500 小时
8 月 26 日晚,北京国家速滑馆「冰丝带」灯光落幕,第二届世界人形机器人运动会交出成绩单:六大洲 16 国 666 队、2056 台机器人在 5 天里完成了 1301 场对决。从 100 米 8.64 秒到 1500 米 2 分 21 秒 64,从原地跳高 3.4 米到家庭场景做完整一桌意面——这些不再只是奖牌意义上的「更快更高更强」,而是一份具身智能的真实答卷。
但故事不止步于奖牌。
闭幕式上,赛迪研究院、北奥集团联合北京人形机器人创新中心、上海智元、银河通用、万境千寻、星海图等多家头部企业共同发布了一项重磅成果——全球首个世界级人形机器人运动会全量数据集,总时长超过 2500 小时,数据种类涵盖 12 个应用场景的具身操作数据,包含 44 项作业、百余项技能、万余项精细化任务。这套数据集将通过组委会免费向社会开放,让更多企业、研究机构、高校不必再从零开始采集真机数据。
> 小贴士:具身数据集是机器人「看过、学过、做过的所有事情」。高分辨率视觉、本体感知(关节位置/扭矩)、外力、场景几何,每一条都是带时间戳、对齐坐标系的训练样本。一台机器人在真实场景里走一万步、伸一万次手、错一万次、再纠错一万次,能产生的有效数据是几百小时起步的体量。
免费开源,对一个刚刚组建两年、仍在融资烧钱阶段的产业来说,是少见的慷慨。
这一篇想把三个问题讲清楚:为什么是现在?为什么是这套?为什么是这个口子?
---
二、为什么是现在——把 WHRG 放进 2026 H2 时间轴
⏱ 2026 H2:具身从「舞台表演」到「真实落地」的精确切换
如果要挑 2026 H2 具身产业最重要的事件,WHRG 2026 一定排前三。但它和「单点纪录刷新」不同——它是行业首次大规模把真实生产场景的具身操作整合进了竞技场地。
| 阶段 | 主线 | 代表 |
|---|---|---|
| 2024 H1 | 实验室 demo | Unitree H1 跑通步态 |
| 2024 H2 - 2025 | 跑步 + 跳舞 + 破纪录 | WHRG 2025 |
| 2025 H2 | 走出实验室,进入单点场景 | Figure 02 BMW、Apptronik Mercedes |
| 2026 H1 | 真实场景规模商业试运营 | 银河通用商业场景订单 |
| 2026 H2 | 真实场景跑通,但数据瓶颈出现 | WHRG 2026 + 2500h 全量开源 |
当我们去看银河通用创始人王鹤 8-27 在央广专访里给出的两个数字时,这事清楚得几乎是用尺画的——
- 「计划到 2028 年,将训练数据规模从 100 万小时扩充至 1000 万小时」;
- 「今天我们有高精 UMI 数据 50 万小时,没有任何手持机械装置的人手数据 50 万小时,这 100 万小时数据能够让机器人充分学习人类动作」。
| 维度 | 2025 末数值 | 2026 H2 数值 | 增长速度 |
|---|---|---|---|
| 中国具身整机出货量 | 数千台 | 4 万+ 台(含 WRC 业绩) | 10× |
| 万小时级真机 UMI 数据集 | 不足 10 | 1(银河通用 50 万小时 UMI)+ WHRG 2500 小时开源 | 100× |
| 比赛场景赛项 | < 5 | 21 场景赛(覆盖 12 场景)+ 51 比赛项目 | 5× |
| 全自主决策参赛比例 | 部分队伍 | 除 100/400 米障碍外全部 | 标准化 |
🧭 「数据免费开源」背后那张看不见的产业地图
把 WHRG 全量数据集免费开源这件事放到产业地图上看,至少能看出三件事:
1. 数据已经不是赢者通吃的壁垒:单个厂商 100 万小时级别的数据要继续扩大,必须靠真机迭代。但真机迭代的成本早就不是清北实验室可承担的,意味着只有头部企业能继续投。当一家头部企业愿意把 2500 小时(占行业 0.25% 的体量)拿出来开源,背后逻辑可能是「真正壁垒已经不是数据本身,而是数据 + 训推框架 + 本体硬件的耦合能力」。 2. 数据免费开源是「物理 AI」的预告:基础模型时代,Meta 把 Llama 系列开放权重让社区反哺,形成了「开源 + 商业」双轮飞轮。当 NVIDIA 把 Cosmos 平台、Physical AI 数据集正式对外公布时,已经把这条路径延伸到物理世界。WHRG 的 2500 小时体量不大,但信号意义大于体量本身。 3. 场景赛评判「全自主权重 = 1,遥操 = 0.5」直接催生了数据集开源:遥操模式打 0.5 折的规则让顶尖队伍全部押注全自主;全自主意味着更多「失败 + 纠错」数据被记录;这些失败数据在 WHRG 上属于比赛副产品,但拿出来训练模型比让模型看人演示更值钱。
下面这张图把「为什么免费开源」三件事归纳成一张因果图:
---
三、为什么是这套——2500 小时里到底装了什么
📦 12 应用场景 × 44 作业的拆解
公开数据集清单显示,WHRG 全量数据集涵盖12 个应用场景的具身操作数据——工业、商超、餐饮、办公、家庭、消防救援、酒店、图书馆、园林、新能源汽车充电等。每个场景下被细分为 44 项作业、100+ 项技能、万余项精细任务。
其中最关键的三类作业是:
1. 大负载搬运——考验整机的力量和结构强度; 2. 多品类物料分拣——考验视觉识别与分类能力; 3. 毫米级对孔插装——考验末端定位与力控精度。
这三件事的难度横跨「机械臂电机 + 视觉模型 + 力控算法」,正好是「大脑 - 小脑 - 神经控制」三层都直接相关的最小测试单元。「装配上料岗」恰好把这三件事做成了一道完整题目。组委会委员、中国软件评测中心副主任巩潇在闭幕式发言中提到:「应用类赛事旨在考验机器人在非结构化环境中处理问题的能力。」非结构化是多分量的,不是单一维度。
🧪 「全自主 vs 遥操」这条数据线
WHRG 2026 的关键规则是:全自主模式成绩权重为 1.0,遥操模式仅为 0.5;成绩相同时,自主参赛队伍排名更靠前。这条规则给数据集开源埋下了伏笔:
- 全自主参赛的队伍每场比赛都把模型决策的「成功 + 失败 + 恢复」全过程全部记录下来。这些失败数据比让模型看人演示更值钱,因为它训练出的是「自己救自己」的反射弧。
- 100 米、400 米障碍赛是仅有的两个保留遥操允许项,其余全部全自主。50 米决赛、1500 米决赛、原地跳高、灵巧手等都是全自主的活样本。
- 在场景赛中,机器人需要在真实环境里理解任务、感知周围、在不同区域之间自主移动,并连续完成多个步骤;当物体位置发生变化、任务流程被打断、甚至出现新的随机指令时,它还必须重新规划。
下表把 WHRG 2026 全自主数据片段与传统 KUKA / Fetch 等遥操数据集做了横向对比,方便看清这一次开源的真正意义:
| 维度 | 传统遥操数据集 | WHRG 2026 全自主 |
|---|---|---|
| 控制源 | 人手 + 控制器 | 模型自主决策 |
| 失败样本 | 罕见 | 高频 |
| 纠错回放 | 无 | 有(重新规划 + 重试) |
| 视频 + 力 + IMU 时序对齐 | 部分 | 全程 |
| 多本体迁移 | 强(单一本体) | 弱(异构本体) |
| 训练价值 | 模仿学习 | 自我纠错 + VLA + WAM 三位 |
---
四、为什么是这个口子——赛迪 + 北奥 + 6 头部企业联合发布的产业含义
🏛 把产业话语权借给了「协调者」
要把 2500 小时公开给整个社会,单打独斗很难办:数据格式不统一、隐私口径不一致、各家数据清洗规范有差异、训练许可证与商业使用边界更模糊。这次由赛迪研究院 + 北奥集团作为「赛事方 + 协调方」牵头,6 家头部企业作为联合发布主体,本质是把数据开放这件事从「厂商慈善」位移到了「行业基础设施」。
把协调者的角色拆开看:
- 赛迪研究院:政策口径、行业标准;这一身份让数据集可以挂上 CC BY 4.0 类似的开放许可。
- 北奥集团:场地 + 比赛 + 数据的天然中央集权方。
- 6 家头部企业:数据贡献者,决定哪些场次、哪些本体可以纳入发布范围。
这种「赛事方 + 协调方 + 多企业」三方共治的形态,让开源 2500 小时同时具备:
- 标准化的口径(不能你家公开的数据是 30 FPS,人家是 60 FPS,导致训练时全部得重新对齐);
- 合规边界(医疗、消防等场景可能涉及隐私,必须先做去标识化);
- 跨厂商拉通(不同本体的时序对齐、坐标系对齐、动作语义对齐)。
🧱 2500 小时的边界——开源不是「全给」
把数据公开这件事讲清楚之前,先要把它的边界讲清楚:
- 真机本体专属的数据可能仍然受限(如关节扭矩、电机电流),它们直接竞争着本体硬件优势;
- 跨场景 + 跨任务的视频 + 视觉 + 音频(场景感知层)是开放主体;
- 模型层 + 训练脚本 + 任务定义会随数据集一起发布(这一层是 6 家头部企业相对一致的开放边界)。
🛤 从 WHRG 2500h 到「千万小时真机数据冲刺」的清晰路径
把 6 家头部企业近 90 天的公开口径放在一张时间线上:
银河通用已说要在 2028 年把数据规模从 100 万小时扩到 1000 万小时。这条「10× 增长」路径不是靠工厂采集效率线性堆出来的,而是靠把全行业 WHRG + WRC + 各种独立开源数据集池化出来。
换句话说:2500 小时开源并不是这场赛事的终点,而是千万小时具身数据的第一次汇流。
---
五、为什么是这次开源——回到王鹤与郭宜劼的发言
🧠 王鹤(银河通用创始人)8-27 的「千万小时冲刺」
在南方财经 8-27「机器人为什么要设计成人形?还要多久能到我家干活?」的专访中,王鹤把这条路径讲得很清楚:
> 「同样是在比赛现场两天采集到的数据,基座模型能力不同,最终效果天差地别,有的团队可以拿到满分,有的只能拿到 10 分。基座架构、数据规模、数据构成,直接划定了模型能力的上限。」
紧接着他直接给出了冲刺数字:「计划到 2028 年,将训练数据规模从 100 万小时扩充至 1000 万小时」。这意味着银河通用打算在 2 年内把数据规模扩到 10 倍,几乎是「具身版 ImageNet」节奏:
🛠 郭宜劼(北京人形机器人创新中心):「实验室 → 实用型产品」
北京人形机器人创新中心创新人形部负责人郭宜劼 8-26 闭幕发言中讲到一个清晰判断:
> 「这两年,国内人形机器人技术发展速度不断加快,特别是在本体和小脑控制能力上,得益于具身智能方面国家大力发展和支持,上下游产业链也在不断完善和成熟。」
他给出了 4 个关键判断:
1. 本届参赛队伍数量较上届增长 138%,参赛机器人数量翻两番——产业正在规模化; 2. 多项赛事纪录连破——硬件本体能力正在逼近世界级; 3. 场景赛聚焦家政、应急、工业装配等真实场景——产业在做真实落地; 4. 国产人形机器人正实现从跟跑到并跑、部分领域领跑的跨越——产业竞争边界已被改写。
这四点是「实用化」与「公开数据」的底色。如果没有这条产业线,2500 小时开源就只是一次公关秀;有了这条产业线,2500 小时开源是一把把真机数据交给行业的「钥匙」。
---
六、对中小开发者意味着什么
🔓 从零启动具身研究的门槛立刻降到原来的几分之一
当 WHRG 2500 小时免费开放时,原本想进入具身研究的小团队,最少能拿到这几样东西:
- 12 个真实场景的视觉 - 本体感知同步数据(真机、可复现);
- 44 项具体作业的任务定义 + 评估脚本;
- WAM / VLA 等多家头部企业的训练框架参考实现;
- 失败过程 + 重试记录——这是过去「演示数据集」几乎从不公开的部分。
🎓 学术界与产业界的分割点第一次摸得着
WHRG 数据集开源还会带来一件更隐性的变化:学术界第一次可以证明自己的具身模型在「真实比赛、真实场景」上不输头部企业。
过去几年,机器人学术界发表的论文大多在仿真或自家 demo 里测,模型拿到产业真机数据非常困难。当 2500h 真实比赛数据开放,教授 / 博士生就能把自己的模型在 WHRG 同样的任务集上跑一遍,然后把分数直接拍到桌上。这会逼迫头部企业加速把模型做得「真实可复现」+「论文可复现」,间接抬高了整个产业的天花板。
---
七、回到那 2500 小时的剩余部分
🧩 把 2500 小时放到「具身数据阶梯」上
把现在公开看到的具身数据集做一张阶梯图:
| 体量 | 数据集 | 公布来源 | 包含范围 |
|---|---|---|---|
| 5 万小时级 | 银河通用 UMI | 银河通用 | 人工头戴 + 双手 UMI 采集 |
| 数万小时级 | NVIDIA Physical AI | NVIDIA / HF | GR00T、Manipulation、Embodied |
| 万小时级 | Open X-Embodiment | Google DeepMind | 22 家机器人机构 |
| 千小时级 | WHRG 2026 全量(本次) | 赛迪 / 北奥 / 6 家头部 | 12 场景 / 44 作业 |
🔮 几个值得继续盯的横切面
把今天能确认的事实摆出来,再列几个 9 月值得继续盯的窗口:
1. 数据格式 + 评估脚本是否标准统一:开源数据的真实瓶颈不是大小,是「能不能被一个中小团队用三天就训起来」。如果 2500h 数据集附带统一的 evaluation harness,那这就是又一次「具身 ImageNet 时刻」。 2. 跨厂商 WAM 跨本体训练会不会同步开源:当 6 家头部企业把训练框架和参考实现一起开放,社区有可能在 90 天内形成「以 WHRG 数据为底座的具身基础模型」联合声明。 3. 隐私场景(医疗、消防)是否会分批 / 申请制开放:高敏感数据可能需要单独申请,能否合理分批将决定开源这件事的最终完整度。 4. 真正的具身 ChatGPT 时刻是否在 2027 提前到来:王鹤给 2028 千小时冲刺留出提前一年的窗口——意味着行业内部已经在押注 2027 年会看到 WAM 在 70-80% 任务上达到稳定可用。
---
八、闭幕式之后
闭幕式结束的那一刻,冰丝带场馆灯光暗下,机器人走下赛道。但 2500 小时的数据已经被压缩成 zip 包,挂在云上等待全世界下载。从那一刻起,每一个高中机器人社团的 DIY 玩家,每一个本科生机器人项目的开源贡献者,每一个初创公司从「PPT 号称 10 万台」到「真实 100 台出货」的路上,可能都在某一刻直接受益于这次开源。
这件事的更深意义是:把 2026 年 8 月 26 日那天颁奖的奖牌,连同失败的过程一起,折叠成了一段全世界共同拥有的机器人记忆。
> 闭幕的那一秒,机器人下班的最后一秒,把数据捐给了世界。 > > 下一个 Robot Olympics,当幼小的工程师们第一次跑起这段数据训练出的模型,他们会记住这个晚上。
---
参考文献
1. 腾讯网. *向'实用'更迈进一步,第二届世界人形机器人运动会落幕*. 2026-08-27. https://new.qq.com/rain/a/20260827A00HP400. 2. 央广网(南方财经转引). *机器人为什么要设计成人形?还要多久能到我家干活?*. 2026-08-27. https://m.sfccn.com/2026/8-27/3NMDE0MDVfMjIyMTM3NQ.html. 3. 光明日报记者董城、李嘉梁. *机器人迈入现实生活的'又一步'——写在第二届世界人形机器人运动会闭幕之际*. 2026-08-27. 4. 网易(王昊男). *赛场竞技,比的是产业内功(经济聚焦)*. 2026-08-27 14:40. 5. 上海热线新闻. *中国人形机器人产业蓄势腾飞 从'实验室样机'迈入多场景'实用型产品'*. 2026-08-27. 6. 中新社记者吕少威. *赛场淬能,人形机器人'加速进化'*. 2026-08-27. 7. 虎科技 / 美通社. *夺冠率100%!银河通用包揽家庭餐饮商超三大最难赛项金牌*. 2026-08-26. 8. 腾讯网(子弹财经). *银河通用发布具身智能大模型AstraBrain*. 2026-08-20. 9. WHRG 2026 闭幕式官方新闻稿(赛迪研究院 / 北奥集团 / 6 家头部企业联合发布). 2026-08-26.
> *声明:本文核心数据交叉核验自新华社记者阳娜、鞠焕宗、孙非、张晨霖图片直播、央广网记者庞婷专访,以及南方财经 / 上海热线新闻官方转载。所有链接均保留截至 2026-08-27 GMT+8 的快照。*