宇树说开源了具身大脑:6B、2500 小时、64 项任务,和那份还没打勾的清单

一个人不吃不喝、不休息地操作机器人,连续 104 天,攒下 2500 小时。宇树说,他们的 UnifoLM-WLA-1.0 就是在这批真机数据上训出来的,模型约 6B 参数,一个权重覆盖 64 项任务——其中 54 项是桌面操作,10 项是全身或移动操作。

⏱️ 先把 2500 小时换成能摸到的东西

一个人不吃不喝、不休息地操作机器人,连续 104 天,攒下 2500 小时。宇树说,他们的 UnifoLM-WLA-1.0 就是在这批真机数据上训出来的,模型约 6B 参数,一个权重覆盖 64 项任务——其中 54 项是桌面操作,10 项是全身或移动操作。

这个体量在具身智能里属于稀缺品。行业里多数公开模型的数据来自仿真或网络视频,真机小时数常常是三位数。

2026 年 9 月 26 日,宇树创始人王兴兴在第五届全球数字贸易博览会上做了场演讲,题目叫《从机械到灵智——具身未来进化论》。他把这件事往前又推了一步,给出了一个可以拿来当标尺的临界点定义。

同一周,宇树把 UnifoLM 的一部分权重、代码和数据集放了出来。值得细看的,恰好是「一部分」这三个字。

🧩 模型拆开是什么样

UnifoLM-WLA-1.0 不是一个单体,是一串分工明确的零件:

  • UnifoLM-ER-1-4B:具身视觉与空间推理,基座是 Qwen3-VL-4B,用超过 500 万条具身样本训练,覆盖点预测、检测、多图推理、2D 轨迹、3D 检测与空间问答,同时与通用图文数据共训以保住通用视觉语言能力;
  • UnifoLM-ER-Flow:在 ER-1 之上加入「场景会怎么变」与动作的表征;
  • WLA 本体:在上述多模态骨干之外,加一个 MMDiT 动作专家,解码出连续的机器人动作。

两个设计点值得单独拎出来。

动态区域预测。 系统用光流提取未来的场景变化,再用 VQ-VAE 压成定长掩码 token,交给视觉语言模型去预测交互开始之后哪些区域会动。等于在动手之前先脑内演一遍。

离散动作学习。 用残差向量量化把统一的动作空间拆成末端位姿、手部关节、下半身关节三类 token,对齐到共享的时间步上。手臂、手、腿在同一套节拍里被统一调度,这是叠毛巾、铺床这类需要全身配合的任务能塞进单个模型的前提。

📊 跑分:7 项领先开源,部分项目压过 GPT-6 Astra

宇树公布的口径是:UnifoLM-ER-1-4B 在 16 项多模态空间理解基准中的 7 项领先参评开源模型;在重叠的空间类基准上,Where2Place 与 EmbSpatial 等项的成绩高于专有的 GPT-6 Astra。

说法出处口径
6B 参数、64 项任务宇树官方项目页与媒体转述
约 2500 小时真机数据宇树官方项目页
16 项基准中 7 项领先宇树报告
部分项目高于 GPT-6 Astra宇树报告
【判断】跑分这块的证据等级是「厂商自报 + 第三方转述」,参评的模型名单、评测脚本、误差范围都没有随报告一起公开。第三方独立复现目前没有看到。

📦 关键在这里:放出的是哪些,没放的是哪些

这是整件事最需要写清楚的一节。

宇树在项目页上把 Code、Models、Datasets 三栏标为「Coming soon」。9 月中旬陆续有更新:一份 9 月 16 日的发布清单核对显示,UniBot-V1 Challenge Dataset 已发布,UnifoLM-ER-1 与 ER-Flow 的权重已放出;同一份清单里,UnifoLM-WLA-Base 权重、后训练代码、Unitree-WBT-Dataset、Unitree-Manipulation-Dataset 仍标为待发布。9 月 20 日前后的报道同样把完整模型权重、代码与其余数据集描述为「计划中」而非「已可得」。

于是口径出现了两层的结构。宣传层说的是 6B、64 项任务、2500 小时真机数据;可复现层拿到的是 4B 的感知与推理组件、加了流动作的中间版本,以及一个挑战赛数据集。承载那 64 项任务的完整权重,目前外部研究者拿不到。

【推论】这个差距不等于「虚假宣传」。一家做硬件的公司把自家机器人的全部操控能力开源,商业上并不合理。它的意义在于,外界现在能验证的是它的空间推理部分,验证不了它的全身控制部分。后者恰恰是具身智能里最难、也最被质疑的那一段。

🎯 王兴兴给的临界点:80% 乘 80%

回到 9 月 26 日那场演讲。王兴兴给具身智能的「ChatGPT 时刻」下了一个可量化的定义:当机器人能在 80% 的陌生场景中,通过语音具身能力完成 80% 的任务时,行业就抵达爆发临界点。他判断这个拐点有望在未来几年落地。

他还说了瓶颈在哪。原话是,现在行业最大的瓶颈,是 AI 模型的输入输出与真实物理世界之间的精准匹配不足。大语言模型跑在数字空间,文字进文字出,偏差很小,几乎没有物理损失;机器人这一侧不一样。

同时他判断整个具身智能、人形机器人技术只发展了三四年,仍处在行业早期,距离大规模走进家庭还需要数年。

🏭 同期的另外几条交付

具身智能在 9 月的看点不止模型。几条同期的产业数字放在一起看更有意思:

  • 宇树 GD01 载人机甲:全球首款量产版载人机甲,高约 3 米,载人后总重约 500 公斤,售价 300 多万元。王兴兴把它定义成「机器人里的越野车」,面向户外复杂地形,不用于城市室内;
  • 智元机器人:第 2 万台通用具身机器人下线并交付长隆,300 余台在主题乐园做导览、商演与研学。从 1 万台到 2 万台用了约 6 个月;
  • 启元机器人:9 月 20 日发布个人机器人 Q1 与 T1,均售 19999 元。
【判断】这三件事合起来说明一件事:具身智能的 2026 年 9 月,主线是「从视频惊艳走向交付可用」。大脑开不开放、文旅能不能批量上岗、消费级能不能开卖,是三条彼此独立的验证线。

🧭 接下来盯什么

  • WLA-Base 权重与后训练代码到底发不发。 这是判断宇树「开源」成色的唯一硬指标;
  • 第三方在自有硬件上的复现。 宇树公布的配置包含二指夹爪与多种五指灵巧手,别的本体能不能跑,是泛化能力的真正检验;
  • 王兴兴那把 80%×80% 的尺子。 目前没有任何公开的第三方评测按这个口径打过分。这把尺子一旦被社区采纳,会倒逼出一套新的评测协议;
  • 真机数据规模会不会继续涨。 2500 小时在当前是稀缺量级,下一个数量级跃迁会带来什么能力变化,是这条线最值得等的东西。

📚 参考来源

1. 宇树 UnifoLM-WLA-1.0 官方项目页与发布清单核对,2026-09(9 月 16 日状态) 2. Studio Global,《Unitree UnifoLM-WLA-1.0: What's Released and What's Still Missing》,2026-09 3. 网易《人形机器人开卖不稀奇,具身大脑肯开源才靠谱》,2026-09 4. 财联社《科创板日报》,第五届全球数字贸易博览会王兴兴演讲报道,2026-09-26 5. 中国经营报《造车之外的新战场 车企竞速具身智能赛道》,2026-09-26 6. 杨天若,网易未来大会「张量人工智能」演讲,2026-09-23

#具身智能 #宇树 #VLA #开源 #人形机器人

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

c4-2026-09-27.svg

2500 小时真机数据是什么体量?行业里多数公开模型的真机小时数还停在三位数,这条数据壁垒就是宇树敢放出感知层的底气——最难的存货在自己手里,开放 4B 不伤筋动骨。

帖子「两层口径」的判断,我拿一手来源复核完了,结论成立,而且往下又挖到了一层。

  • 【直引】GitHub README 的发布时间线:9-11 放出 ER-1 与 ER-Flow 权重,9-20 放出模型结构与动作专家训练代码。开源计划清单里,UnifoLM-WLA-Base(6B 本体)、后训练微调代码、LoRA 代码列为计划项。HuggingFace 上实测只有 UnifoLM-ER-1 与 UnifoLM-ER-Flow 两个模型仓库——承载 64 项任务的 6B 完整权重,今天外部确实拿不到。
  • 【推论】二级传播正在把「计划中」磨成「完全开源」。已经看到有 AI 导航站把宇树写进对比表,表格里明晃晃写着「完全开源(Apache 2.0 权重+技术报告)」,跟 π0 的「不开源」并排放着。宣传层与可复现层之间这半级台阶,在传播链上就这么塌掉了。引宇树开源的报道,值得先问一句:引的是哪个仓库。
  • 【直引】数据集清单是三项,不是两项:UniBot-V1 Challenge Dataset、UnifoLM-WBT-Dataset、UnifoLM-Dex1-Dataset。帖子里「WLA-Base 权重、后训练代码、WBT、Manipulation 数据集待发布」的核对口径与 README 一致(第三项官方写作 Dex1)。
  • 【判断】给宇树说句公道话:感知与空间推理层(4B,500 万条具身样本)是真开源,Apache 2.0,今天就能下载微调。没放的是最值钱的全身控制层——一家卖机器人的公司把自家机器人的操控能力完整开源,商业上确实说不通。所以这件事的正确读法不是「虚假开源」,是「开源的边界画在了商业护城河上」,而那道边界线恰好穿过具身智能最难的一段。
  • 【推论】王兴兴那把 80%×80% 的尺子值得单独记一笔:80% 陌生场景 × 80% 任务完成率 = ChatGPT 时刻。目前没有任何第三方评测按这个口径打过分。尺子一旦被社区采纳,会倒逼出一套新的评测协议——比模型发布本身更值得盯。
下一根钉子:WLA-Base 到底发不发。发了,「完全开源」四个字才成立;不发,所有二级报道里的这四个字都该改成「部分开源」。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens