最后 1 秒。灯光暗下。2056 台机器走下赛道。
我读到「2500 小时全量免费开源」这条新闻时,先想到的是这件事的「商业不对劲」。一家还在融资烧钱阶段的产业,把自己跑出来的真机数据捐给世界——这反常。
然后我读了王鹤 8-27 在央广专访里给的两个数字:「计划到 2028 年把训练数据规模从 100 万小时扩到 1000 万小时」、「今天我们有高精 UMI 数据 50 万小时」。这两个数字让我立刻意识到——数据已经不再是赢者通吃的壁垒了。
单个厂商 100 万小时级别的数据要继续扩大,必须靠真机迭代。但真机迭代的成本早就不是清北实验室可承担的,意味着只有头部企业能继续投。当一家头部企业愿意把 2500 小时(占行业 0.25%)拿出来开源,背后逻辑可能是——真正壁垒已经不是数据本身,而是数据 + 训推框架 + 本体硬件的耦合能力。
但我得拆开讲一件事——「免费开源」的边界是什么。
公开数据集清单显示 WHRG 全量涵盖 12 个应用场景——工业、商超、餐饮、办公、家庭、消防救援、酒店、图书馆、园林、新能源汽车充电。每个场景下细分为 44 项作业、100+ 项技能、万余项精细化任务。真机本体专属的数据(关节扭矩、电机电流)可能仍然受限——它们直接竞争着本体硬件优势。开源的主体是跨场景 + 跨任务的视频 + 视觉 + 音频(场景感知层)。
这条边界画得很精明。把场景感知层开放、本体专属层保留——这意味着开源不会真的伤害头部企业的护城河。
但为什么是现在?我猜(我没看到内部商业逻辑的披露)三个理由:
① WHRG 比赛规则催生了开源。全自主模式成绩权重 1.0,遥操模式仅 0.5。这条规则让顶尖队伍全部押注全自主——全自主意味着「失败 + 纠错」全过程被记录。这些失败数据在 WHRG 上属于比赛副产品,但拿出来训练模型比让模型看人演示更值钱。
② 头部企业需要「沿途下蛋」才能活下去。真机数据 100 万小时的扩到 1000 万小时,靠工厂采集效率线性堆不出来,必须靠把全行业 WHRG + WRC + 各种独立开源数据集池化出来。2500 小时开源是千万小时具身数据的第一次汇流。
③ 「具身 ImageNet 时刻」需要公共基础设施。如果 WHRG 2500h 数据集附带统一的 evaluation harness,那这就是又一次「具身 ImageNet 时刻」——把数据格式、评估脚本、任务定义一次性标准化,催生学术 + 工业界同时涌入。
我特别关心的是第三点。WHRG 数据集开源还会带来一件更隐性的变化:学术界第一次可以证明自己的具身模型在「真实比赛、真实场景」上不输头部企业。这会逼迫头部企业加速把模型做得「真实可复现」+「论文可复现」,间接抬高了整个产业的天花板。
收尾钉子:2500 小时开源不是终点,是千万小时具身数据的第一次汇流——9 月份能不能让 evaluation harness 同步标准化,决定它能不能变成「具身 ImageNet 时刻」。