⏱️ 先把 2500 小时换成能摸到的东西
一个人不吃不喝、不休息地操作机器人,连续 104 天,攒下 2500 小时。宇树说,他们的 UnifoLM-WLA-1.0 就是在这批真机数据上训出来的,模型约 6B 参数,一个权重覆盖 64 项任务——其中 54 项是桌面操作,10 项是全身或移动操作。
这个体量在具身智能里属于稀缺品。行业里多数公开模型的数据来自仿真或网络视频,真机小时数常常是三位数。
2026 年 9 月 26 日,宇树创始人王兴兴在第五届全球数字贸易博览会上做了场演讲,题目叫《从机械到灵智——具身未来进化论》。他把这件事往前又推了一步,给出了一个可以拿来当标尺的临界点定义。
同一周,宇树把 UnifoLM 的一部分权重、代码和数据集放了出来。值得细看的,恰好是「一部分」这三个字。
🧩 模型拆开是什么样
UnifoLM-WLA-1.0 不是一个单体,是一串分工明确的零件:
- UnifoLM-ER-1-4B:具身视觉与空间推理,基座是 Qwen3-VL-4B,用超过 500 万条具身样本训练,覆盖点预测、检测、多图推理、2D 轨迹、3D 检测与空间问答,同时与通用图文数据共训以保住通用视觉语言能力;
- UnifoLM-ER-Flow:在 ER-1 之上加入「场景会怎么变」与动作的表征;
- WLA 本体:在上述多模态骨干之外,加一个 MMDiT 动作专家,解码出连续的机器人动作。
两个设计点值得单独拎出来。
动态区域预测。 系统用光流提取未来的场景变化,再用 VQ-VAE 压成定长掩码 token,交给视觉语言模型去预测交互开始之后哪些区域会动。等于在动手之前先脑内演一遍。
离散动作学习。 用残差向量量化把统一的动作空间拆成末端位姿、手部关节、下半身关节三类 token,对齐到共享的时间步上。手臂、手、腿在同一套节拍里被统一调度,这是叠毛巾、铺床这类需要全身配合的任务能塞进单个模型的前提。
📊 跑分:7 项领先开源,部分项目压过 GPT-6 Astra
宇树公布的口径是:UnifoLM-ER-1-4B 在 16 项多模态空间理解基准中的 7 项领先参评开源模型;在重叠的空间类基准上,Where2Place 与 EmbSpatial 等项的成绩高于专有的 GPT-6 Astra。
| 说法 | 出处口径 |
|---|---|
| 6B 参数、64 项任务 | 宇树官方项目页与媒体转述 |
| 约 2500 小时真机数据 | 宇树官方项目页 |
| 16 项基准中 7 项领先 | 宇树报告 |
| 部分项目高于 GPT-6 Astra | 宇树报告 |
【判断】跑分这块的证据等级是「厂商自报 + 第三方转述」,参评的模型名单、评测脚本、误差范围都没有随报告一起公开。第三方独立复现目前没有看到。
📦 关键在这里:放出的是哪些,没放的是哪些
这是整件事最需要写清楚的一节。
宇树在项目页上把 Code、Models、Datasets 三栏标为「Coming soon」。9 月中旬陆续有更新:一份 9 月 16 日的发布清单核对显示,UniBot-V1 Challenge Dataset 已发布,UnifoLM-ER-1 与 ER-Flow 的权重已放出;同一份清单里,UnifoLM-WLA-Base 权重、后训练代码、Unitree-WBT-Dataset、Unitree-Manipulation-Dataset 仍标为待发布。9 月 20 日前后的报道同样把完整模型权重、代码与其余数据集描述为「计划中」而非「已可得」。
于是口径出现了两层的结构。宣传层说的是 6B、64 项任务、2500 小时真机数据;可复现层拿到的是 4B 的感知与推理组件、加了流动作的中间版本,以及一个挑战赛数据集。承载那 64 项任务的完整权重,目前外部研究者拿不到。
【推论】这个差距不等于「虚假宣传」。一家做硬件的公司把自家机器人的全部操控能力开源,商业上并不合理。它的意义在于,外界现在能验证的是它的空间推理部分,验证不了它的全身控制部分。后者恰恰是具身智能里最难、也最被质疑的那一段。
🎯 王兴兴给的临界点:80% 乘 80%
回到 9 月 26 日那场演讲。王兴兴给具身智能的「ChatGPT 时刻」下了一个可量化的定义:当机器人能在 80% 的陌生场景中,通过语音具身能力完成 80% 的任务时,行业就抵达爆发临界点。他判断这个拐点有望在未来几年落地。
他还说了瓶颈在哪。原话是,现在行业最大的瓶颈,是 AI 模型的输入输出与真实物理世界之间的精准匹配不足。大语言模型跑在数字空间,文字进文字出,偏差很小,几乎没有物理损失;机器人这一侧不一样。
同时他判断整个具身智能、人形机器人技术只发展了三四年,仍处在行业早期,距离大规模走进家庭还需要数年。
🏭 同期的另外几条交付
具身智能在 9 月的看点不止模型。几条同期的产业数字放在一起看更有意思:
- 宇树 GD01 载人机甲:全球首款量产版载人机甲,高约 3 米,载人后总重约 500 公斤,售价 300 多万元。王兴兴把它定义成「机器人里的越野车」,面向户外复杂地形,不用于城市室内;
- 智元机器人:第 2 万台通用具身机器人下线并交付长隆,300 余台在主题乐园做导览、商演与研学。从 1 万台到 2 万台用了约 6 个月;
- 启元机器人:9 月 20 日发布个人机器人 Q1 与 T1,均售 19999 元。
【判断】这三件事合起来说明一件事:具身智能的 2026 年 9 月,主线是「从视频惊艳走向交付可用」。大脑开不开放、文旅能不能批量上岗、消费级能不能开卖,是三条彼此独立的验证线。
🧭 接下来盯什么
- WLA-Base 权重与后训练代码到底发不发。 这是判断宇树「开源」成色的唯一硬指标;
- 第三方在自有硬件上的复现。 宇树公布的配置包含二指夹爪与多种五指灵巧手,别的本体能不能跑,是泛化能力的真正检验;
- 王兴兴那把 80%×80% 的尺子。 目前没有任何公开的第三方评测按这个口径打过分。这把尺子一旦被社区采纳,会倒逼出一套新的评测协议;
- 真机数据规模会不会继续涨。 2500 小时在当前是稀缺量级,下一个数量级跃迁会带来什么能力变化,是这条线最值得等的东西。
📚 参考来源
- 宇树 UnifoLM-WLA-1.0 官方项目页与发布清单核对,2026-09(9 月 16 日状态)
- Studio Global,《Unitree UnifoLM-WLA-1.0: What's Released and What's Still Missing》,2026-09
- 网易《人形机器人开卖不稀奇,具身大脑肯开源才靠谱》,2026-09
- 财联社《科创板日报》,第五届全球数字贸易博览会王兴兴演讲报道,2026-09-26
- 中国经营报《造车之外的新战场 车企竞速具身智能赛道》,2026-09-26
- 杨天若,网易未来大会「张量人工智能」演讲,2026-09-23
#具身智能 #宇树 #VLA #开源 #人形机器人
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。