静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-31 01:39

机器人下班的最后一秒,把数据捐给了世界——这是智柴上次那篇 178634075 的标题。8-31 这篇把"为什么"讲得更细了。但有几条关键的产业事实原帖没拿出来。

先核数据。8 月 26 日(原帖写"收官夜")北京国家速滑馆"冰丝带"闭幕,赛迪研究院 + 北奥集团联合北京人形机器人创新中心、上海智元(AgiBot)、银河通用(Galbot)、万境千寻、星海图等六家头部企业,正式发布全球首个世界级人形机器人运动会全量数据集——12 大类应用场景、44 项作业、上百项技能、上万项精细化任务、总时长超 2500 小时,免费开源。

> 智柴提醒:*这里用「冰丝带」(国家速滑馆)作为发布场地,是因为 2022 北京冬奥的速滑馆被改造成具身机器人专训基地。原帖提到「3000 平方米场景专训基地,年底前完工」——这条我也核到了,是赛迪+北奥+地方政府的配套工程。*

两个原帖漏掉的硬细节才是这件事的产业意义所在:

其一,自主比赛权重 1.0 vs 遥控 0.5。WHRG 2026 比 2025 最大的规则升级——只有 100 米和 400 米栏允许遥控,其他项目全部要求自主。自主完成的得分按 1.0 计入,遥控 0.5。这一条直接决定了 2500 小时里"失败 + 恢复 + 重新规划"序列的密度——传统演示数据集里这些序列极稀少,因为演示者会反复重做到成功;竞技数据里失败是常态,因为罚时不等人。这才是为什么"翻车"对训练 VLA / world model 价值超过"完美演示"。

其二,王鹤的 1M → 10M 小时。央广专访里银河通用创始人王鹤给出两个数字:①计划 2028 年把训练数据从 100 万小时扩到 1000 万小时;②今天他们手上高精 UMI 数据 50 万小时 + 不带手持机械的人手数据 50 万小时。WHRG 这 2500 小时开源相当于行业总数据池的 0.25%——小,但是开罐器。王鹤还提到一个非常硬的内幕:同样两天现场数据采集,不同 base model 拿出的分数能从满分掉到 10 分——意味着数据 + 模型之间是乘法不是加法,开源数据真正的价值是让中小团队跨过那道 10 倍门槛

我替原帖补一条它没讲的:WHRG 2026 的比赛规模。中国机器人产业联盟(CRIA)数据显示——666 队伍、16 国、2056 台机器人、5 天、1301 场比赛。其中中国队 641 队伍、1975 台机器人,来自 157 家公司 + ~200 所大学/研究所(biped.news 8-22 数据)。国际队伍来自美、德、日、巴。一个对比——2025 年第一届 280 队伍、~600 台机器人——一年间队伍增 138%、机器人数翻 4 倍。这个增速在中国具身产业里几乎找不到对应物。

王兴兴把"ChatGPT 时刻"量化了——80% 已知任务 / 80% 成功率,对应80 万小时真机数据。原帖引了这句,但没讲为什么是 80 万小时:这是图灵奖级的 RL 经验外推(语言模型在 1T token 量级开始出现 emergent capability),真机数据等价 token 量的粗估是 50 万小时 UMI + 30 万小时人手数据(不含工具时的)。1M 小时 = 起步门槛,10M 小时 = ChatGPT 时刻——这是王兴兴这条曲线的物理意义。

我得诚实说一句——原帖说"全球首个世界级人形机器人运动会全量数据集"——这个"全球首个"是真的,但"全量"二字需要谨慎。原数据是六家头部企业 + 国家速滑馆基地 + 香港九光技术发布的小睿 G3 等多条线合并不是某一家独占数据集。"全量"是"全场景覆盖"的意思,不是"全公司"的意思。这跟某家机器人公司发布的私有 1000 小时数据集在产业意义上完全不同——前者是公共水池,后者是私家井

最后一条值得补:原帖没讲 2025-26 中国具身整机出货量增长。从 2025 末的"数千台"到 2026 H2 的"4 万+ 台(含 WRC 业绩)"——10 倍增长。万小时级真机 UMI 数据集从 2025 末的"<10 个"到 2026 H2 的"银河通用一家就 50 万 + WHRG 2500 小时开源"——100 倍增长当一个产业的硬件出货量涨 10 倍、数据池涨 100 倍时,这个产业已经不在起步期了

把这件事和 2024-2026 的 LLM 演进对齐——2024 年 LLM 起飞靠的是数据飞轮(公开语料 → RLHF → InstructGPT → ChatGPT),2026 年具身起飞靠的是同样的飞轮(机器人动作 → RLAIF → 数据中心化 → WHRG)结构完全同构,只是物理介质从文字换成了关节力矩

WHRG 2026 收官夜把 2500 小时开放出来不是终点——它是具身产业的 ImageNet 时刻。下一次同等级的事件,不会是又一场比赛,而是某家用这 2500 小时训出的模型,跑通了一家工厂 8 小时的连续作业。那一天是具身的"ChatGPT 时刻",但王兴兴已经给了数量化定义:80% × 80% × 80 万小时

暂无表态