静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 13:33

整场 WRC 演讲里,我最喜欢的不是那句「2028 年问鼎」,是王鹤自己泼的冷水:「能打网球、却还难进家庭」。

他给的卡点原话是,每接一个新任务仍要采集数据、训练模型,代价有时甚至高于任务本身创造的价值。这句话原文没收录,而它比任何路线图都更能说明这个行业现在站在哪。

成本那笔账,他其实算过

原文只引了「2028 年数据体量提升到 10 倍」。他完整的预测是两句话:随着基座模型举一反三能力增强,同一件事的实现成本有望降到今天的千分之一,动作速度可能提升 2 到 4 倍。

千分之一和十倍数据,是两个量级完全不同的承诺。前者讲的是单位任务成本,后者讲的是总投入。把它们放在一起看,2028 这个年份才有可验证的形状。

架构里少了一截

原文把「大脑 WAM + 小脑 WBC」讲清楚了,漏掉中间那截。王鹤的比方是人的「大脑、脑桥、小脑」,两者通过脑桥连接成端到端闭环。脑桥这个词不是修辞,它指的是两套不同性质的表示之间那个窄接口。

小脑那侧有个定位原文也没给:AstraBrain-WBC 0.5 被描述为全球首个达到 GPT-1 量级的人形机器人运动大模型,并且第一次在运动控制领域验证了 Scaling Law。注意是 GPT-1 量级,不是 GPT-3.5。王鹤对大脑的判断是「现在处于 ChatGPT-2 时期」,对小脑的判断显然还要再往后放。

WAM 的能力描述可以更精确

原文写「既能吸收机器人带动作标签的数据,也能吸收人类海量无动作标签的视频」。官方口径是四元统一:虚实共融、人机混合、质量参差、有无动作标签。多出来的「虚实共融」和「质量参差」才是工程上最难的两项。仿真数据和真机数据的分布差、采集质量的参差不齐,这两件事处理不了,前两项就是空话。

数据金字塔有一层口径对不上

原文写「50 万小时裸手 + 50 万小时 UMI 头戴」。官方表述是高精度微米级数据 50 万小时,加 egocentric 人手数据 50 万小时。前者强调精度,后者强调视角,和「裸手 / 头戴」不是同一个切法。

171 篇这个数字要打折

原文说搜索「世界动作模型」有 171 篇后续论文。这是搜索引擎命中数,不是引用数。检索词本身就是个中文短语,命中里必然混着大量无关文献。想证明 WAM 成了气候,得拿真正的引用数据。顺带说一句,这个数字被引用进一篇讲「数字在转述链中会膨胀」的文章里,挺有喜感。

实验室的名单值得补

主任是王鹤,副主任是银河通用大模型负责人张直政和清华的弋力。学术委员会由高文领衔,成员包括张建伟、曾文军、张宏江、王田苗。这份名单的含金量比融资额更能说明 2028 这个赌注有几分成算。

比赛那块补一个细节:餐饮场景多数队伍选遥操作,银河通用坚持全自主,6 分 55 秒完赛零失误。商超场景的难点是订单内容随机、缺货位置不固定、还有外观相似的干扰项,没有固定路线可走。这两条比金牌本身更有信息量。

下一根钉子盯 WAM-TTT 的第二个场景。客户拍十分钟视频就能后训练,那从药房到便利店要多少小时。这个数字出来之前,2028 都还是个说法。

暂无表态