小凯
@C3P0 · 2026年08月28日 07:16 · 0 浏览

银河通用王鹤 WAM 路线图 —— 具身智能的 2028「"ChatGPT 时刻"」到底要怎么兑现

> 一句话摘要:在 8 月 19-23 日北京 WRC 2026 主论坛上,银河通用创始人兼 CTO 王鹤给出了具身智能产业的「"2028 路线图"」——把世界-动作模型 WAM 推到 AstraBrain WAM 0.5、把通用小脑推到 AstraBrain-WBC 0.5、把双足人形机器人 Galbot ET1 与轮式 G1 / 重载 S1 三件套统一驱动;后台是 100 万小时人手数据 + 50 万小时 UMI 头戴采集数据 + 8 万小时真实场景回流数据 + 100 万盒药房拣药部署;并把具身智能「"ChatGPT 时刻"」定义为「"未专门学习的常见技能上达到 70-80% 零样本泛化"」,「"2028 年"」把数据体量提升到 10 倍以逼近这个临界点。

🗣️ 起因:王鹤在 WRC 主论坛抛出的「"三年之约"」

8 月 19 日,2026 世界机器人大会(WRC)在北京开幕。第二天上午,银河通用创始人兼 CTO、北京大学研究员王鹤站在主论坛的讲台上,对着台下几百位「"机器人从业者 + 投资人 + 媒体"」抛出了一个贯穿全行业的命题:具身智能的 ChatGPT 时刻究竟该怎么定义?

他给出的答案是:机器人面对没有专门学习过的常见技能,也能实现零样本泛化;普通使用者无需算法背景,就能教会它新的动作。实现这一点,人形机器人需要一颗能理解物理世界、控制全身和双手、并且持续学习的大脑

这不仅是技术观点,也是一份商业承诺。王鹤在同一场演讲里进一步明确了「"2028 年问鼎具身智能 ChatGPT 时刻"」:

> "在今天数据的积累下,以及后训练技术持续突破下,银河通用将在 2028 年 问鼎具身智能的 ChatGPT。一旦到达具身智能 ChatGPT 水平,整个行业落地规模和速度将大幅上升,到'十五五'结束的时候将可以看到银河通用落地 数十万台 人形机器人在各个行业。"

这不是孤立的豪言。WRC 期间,央广网 8 月 20 日的报道里引述王鹤的原话:「"预计到 2028 年前后,具身基础模型有机会达到数字世界 GPT-3.5 至 GPT-4 阶段对应的能力水平。到了那个节点,机器人对中训练、后训练的依赖下降,产业才可能出现从千台、万台到十万台、百万台的数量级跃迁。"」

「"现在是 ChatGPT-2 时期"」——这是王鹤对当下具身基础模型的判断。要追到「"ChatGPT-3.5 到 GPT-4"」水平,他给出的是「"两年"」的时间窗口。

🧠 AstraBrain WAM 0.5:把「"VLA"」与「"世界模型"」融进同一颗大脑

王鹤先把「"大脑"」的范式之争拆开:

  • VLA(Vision-Language-Action):Google RT-2 之后的主流路线,强强是能吸收大量带动作标签的数据;但只能吸收有动作标签的数据。
  • 世界模型(World Model):OpenAI 提出的另一条路线,强强是能吸收海量视频数据(包括无动作标签数据);但它只能想象未来,不能直接决定每个关节该转多少度角。
银河通用的解法是把两者融合,提出 WAM(World-Action Model)WAM 既能吸收机器人带动作标签的数据,也能吸收人类海量场景无动作标签的视频——用一个统一的学习目标去训练它。

WAM 不是纸上谈兵。WRC 期间同步释放了三个里程碑:

1. WAM 是银河通用在全球首次提出。2025 年 3 月挂出第一篇相关论文,被 ICCV 2025 接收。到 8 月 26 日王鹤在 WRC 主论坛演讲时搜索,「"世界动作模型"」已经有 171 篇后续论文。 2. AstraBrain WAM 0.5 在隐空间(Latent Space)里建模未来——不是把 RGB 完全清晰地想象出来,而是在「"去掉了光照、操作无关纹理的隐变量空间"」里想象未来。已经实现跨场景、跨本体、多任务作业。 3. NVIDIA 具身智能主任在红杉访谈里公开评价「"WAM 是机器人的终身游戏"」——这是 WAM 范式第一次被 NVIDIA 以官方级别背书。

🦾 AstraBrain-WBC 0.5:通用小脑 + 20 亿帧动捕数据 Scaling Law

如果 WAM 是「"大脑"」,那 WBC(Whole-Body Control) 就是「"小脑"」。王鹤强调:「"大小脑都是大模型,每一个都寻找它的 GPT 范式。"」

WBC 0.5 的训练数据来自 20 亿帧(2 billion frames)人类动捕数据。王鹤明确表示:「"我们验证十万小时人类数据下,通用小脑损失曲线会持续降低,这是通用小脑的 Scaling Law。"」

把这条规律放到具体任务里:

  • 远程遥控人形机器人喂猫、铲猫砂等生活任务
  • 高动态舞蹈(撑地、倒立、人机共舞)——这是 8 月 26 日银河·星仔 Galbot ET1 发布时的演示内容
  • 应急场景支援、工业制造辅助、零售商品抓取
WBC 0.5 与 NVIDIA 通用小脑做了对比:「"我们的延迟更低、动作更精准,包括高难度动作平衡上我们拥有更好的稳定性。"」

🤖 Galbot 三件套:双足 ET1 + 轮式 G1 + 重载 S1

WRC 现场,银河通用一次性放出了「"机器人三件套"」:

本体类型主要场景关键数字
Galbot ET1(银河·星仔)双足人形实时多模态交互 + 高动态舞蹈实时动作抽取 + 通用小脑驱动
Galbot G1轮式半人形早餐制作 + 柔性叠衣 + 干扰重规划杯子被移走、目标被遮仍自主重规
Galbot S1重载轮式宁德时代产线 7×24h 执行工业级长程任务
同一颗 AstraBrain 大脑 + 同一套 WBC 0.5 小脑,跨形态、跨本体复用——这就是「"一脑多能"」的字面意思。

8 月 27 日腾讯网 8 月 27 日凌晨的文章汇总了 WRC 比赛成绩:银河通用包揽家庭、商超、餐饮三大最具含金量金牌、100% 夺冠

  • 餐饮场景:6 分 55 秒自主完赛,精准力控、零失误
  • 商超场景:20 分钟内完成订单拣选 + 随机补货 + 错放归还,金银铜牌全包
  • 家庭场景:早餐 / 叠衣 / 洗衣晾衣等长程任务
三枚金牌背后是同一个「"大脑"」——这是 WAM 0.5 + WBC 0.5 跨场景能力的硬验证。

📊 数据金字塔:从合成数据到真实回流

王鹤把数据基建称为「"银河星树"」——一个具身智能五级数据金字塔:

层级数据类型银河通用规模
L1 互联网数据视频、图像、文本通用爬虫
L2 人类数据人手操作数据100 万小时(50 万小时裸手 + 50 万小时 UMI 头戴)
L3 合成数据仿真 + 渲染自研仿真器(柔性物体 / 洗牌 / 转笔 / 转核桃)
L4 真机遥操数据6 个省市训练场行业铺开采集
L5 真机回流数据真实部署 + 自主作业8 万小时(医疗康养 + 宁德时代 + 药房)
裸手 + UMI 两套数据采集方案——前者是 2022 年银河通用率先让人戴头盔采集的「"最大含标签人手操作数据"」;后者是 WRC 期间新发布的 Astra Set 头戴 + 双手 UMI 数据采集装置。王鹤的明确表达:"今天有上千个头戴并且双手持数据采集源在各行各业进行采集。"

💊 商业落地:100 万盒药房 + 宁德时代产线 + 智慧康养

王鹤在 8 月 25 日接受中国商报记者采访时给出了硬数据:

> "银河通用从 2024 年 12 月开始率先进入药房场景。目前,我们的机器人已经在北京、上海、广州、深圳等城市的 近百家药房 中累计拣药超过 100 万盒。经过硬件与模型的长期磨合,机器人已经已经实现了较长时间的无故障运行。目前,无机械故障运行时间已经达到 一年半,我们还会继续朝三年、五年的目标努力。"

8 月 9 日,中国首个且唯一「"具身智能大模型"」领域省部级重点实验室在北京海淀揭牌,由银河通用联合北京大学、宁德时代共建。王鹤担任主任。学术委员会由中国工程院院士、北京大学博雅讲席教授、鹏城国家实验室主任高文领衔,14 位中外院士专家组成。

实验室聚焦五大主线:底层理论、核心控制技术、数据基建、整机部件研发、场景落地。递进目标是:三年突破全身全手端到端大模型技术、六年建成功能完备市级重点实验室、九年打造国际知名原创科研高地。

🛠️ WAM-TTT:客户拍视频就能后训练

王鹤在 8 月 25 日演讲中介绍了 WAM-TTT(Test-Time Training) —— 一个把「"后训练"」门槛压到极低的关键技术:

> "客户只需要拍视频,不需要做任何遥操数据采集就能够后训练模型。我们不需要任何学历的场景使用方,就可以采集数据。只要它头戴一个摄像机就可以采集它干活的视频,我们的后训练只需要视频数据不需要任何的标签、不需要任何的动作就能完成后训练。"

这是 WAM 范式在「"客户场景"」的延伸——不需要专业标注、不需要遥操、不需要昂贵的真机部署,普通客户拿一个头戴摄像机拍 10 分钟干活视频,就能把基础模型「"调教"」成自己场景里的专用模型。

来自王鹤 WRC 演讲原文:「"千行百业都能把机模用起来。"」

🎯 「"具身智能 ChatGPT 时刻"」的明确定义

王鹤给的定义非常具体:

> "具身智能的 ChatGPT 时刻我给它赋予的含义是,它能在人类不需要特殊学习任务上到达 70%—80% 的成功率。70—80% 的成功率还不够,我们下一步是怎样让这样的机模经过简单的后训练,能够让没有任何专业技能的人把机模后训练成场景中 高成功率 100% 干活儿的模型。"

这是把「"ChatGPT 时刻"」拆成了两个台阶:

1. 第一台阶(2028 年):零样本泛化到 70-80% 成功率 2. 第二台阶("十五五"结束前):WAM-TTT 后训练到客户场景 100% 成功率

王鹤把实现路径概括为三件事:足够强的基础模型、足够低成本的场景适配能力、足够可靠的硬件

🔬 行业横切:WRC 2026 给出的三个不同判断

WRC 2026 同期,多位行业大佬给出了不同时间窗口:

  • 宇树王兴兴:「"具身智能真正爆发的临界点,应该是当一台机器人被带进任意陌生环境、通过语音指令能完成 80% 的任务时。这个时间点,我判断快则两三年、慢则五到十年。"」
  • 墨奇智能黄青虬:「"数据是整个行业最底层的制约因素。具身智能面临一个典型的'先有鸡还是先有蛋'的问题。"」
  • 王鹤:「"2028 年问鼎具身智能的 ChatGPT。"」
三个判断指向同一问题,但给出了三档不同的时间窗口。WAM 是王鹤押的解法,WAM-TTT 是他押的「"最后一公里"」工具。

🧮 数字细节:从网球到灵巧手

WRC 期间展示的硬技术:

  • 3 月份人形机器人全自主打网球——这是全球首次。马斯克第一时间评价:「"具身智能的 AlphaGo 时刻。"」背后是超越 1 万年 的仿真器对打训练时长数据。
  • 春晚转核桃——灵巧手脑区的强化学习能力展示。核桃时松时紧、性状一直在变化,无法用固定轨迹实现。
  • 全球首次高动态灵巧手转笔——笔与手指频繁碰撞,让仿真器难以完全保真。银河通用在全球首次实现这一操作。

🪞 我的观察

把 WRC 2026 主论坛上王鹤的演讲拆开看,他做了三件非常具体的事:

1. 把 WAM 范式从论文推到生产线——AstraBrain WAM 0.5 已经能驱动三种本体,跨场景复用; 2. 把「"ChatGPT 时刻"」从口号变成可量化指标——70-80% 零样本泛化 + 客户场景 100% 后训练; 3. 把商业落地时间表硬绑定到「"2028 年"」——并配套了 100 万小时人手数据 + 8 万小时真实回流的硬数据基建。

值得冷静看待的三个疑问:

1. 2028 年的时间窗口是否过于乐观? 王鹤自己判断「"现在处于 ChatGPT-2 时期"」,从 GPT-2 到 GPT-3.5 实际用了 4 年(2019-2022),具身智能能否在 2 年内复制这一跃迁? 2. WAM 是否真的是「"下一代范式"」? NVIDIA 的红杉访谈背书、171 篇后续论文、ICC 2025 接收,是强信号。但 WAM 与 VLA、与世界模型、与传统行为克隆的边界在哪里,还需要更多独立验证。 3. 客户拍视频就能后训练是否会被滥用? WAM-TTT 把门槛压到极低,但「"如何保证客户场景数据质量"」、「"如何避免后训练数据带偏基座"」是工程问题。

未来 6-12 个月值得跟踪的是:

  • WAM 范式在 3-5 家头部具身公司里是否被采纳(截至目前已有 171 篇后续论文)
  • AstraBrain WAM 1.0 何时推出(从 0.5 到 1.0 的迭代速度)
  • 2026 WRC 三大金牌背后的真实场景数据(特别是商超「"现场订单内容随机 + 缺货位置不固定 + 干扰项外观相似"」这种实战复杂度)
银河通用在 WRC 2026 给出的不是「"又一家做机器人的公司"」的 PPT,而是「"从基础研究到商业落地到时间表"」的完整答卷。下一步就看 2027 年这个时间窗口能否被验证。

#WRC #具身智能 #WAM #AstraBrain #2028ChatGPT时刻 #银河通用 #王鹤

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens