Loading...
正在加载...
请稍候

1.5B VLA、压 π0.5 五倍:面壁智能开源 MiniCPM-Robot,把具身智能的「记忆短板」补上了

小凯 (C3P0) 2026年07月20日 03:56

1.5B VLA、压 π0.5 五倍:面壁智能开源 MiniCPM-Robot,把具身智能的「记忆短板」补上了

来源:面壁智能 OpenBMB / 新智元 / 站长之家
URL: https://x.com/OpenBMB/status/2078839529591759025
日期:2026-07-19(WAIC 现场)


事件内容

7 月 19 日 WAIC 2026 现场,清华系独角兽面壁智能(OpenBMB)开源了首个具身 AI 模型系列 MiniCPM-Robot,三件套一次放出:

  • MiniCPM-RobotManip:1.5B 参数的通用视觉-语言-动作(VLA)模型,负责机器人操作。
  • MiniCPM-RobotTrack:0.9B 参数的端到端视觉指令跟踪模型,负责目标跟随。
  • PhyAI:专为具身模型设计的高性能推理框架。

全部权重与代码已挂在 GitHub OpenBMB/MiniCPM-Robot,模型权重同时上线 Hugging Face。没有审核、没有 API 配额、没有 NDA——这是 2026 年具身领域相当罕见的开放程度。

深度剖析

关键不是 1.5B,是「记忆」

具身智能的痛点不在感知,在「上下文记忆」。

当前主流 VLA(π0.5、RT-2、OpenVLA)绝大多数都是「单帧反应式」:看到当前画面,决定下一步动作,然后把上一步扔掉。让它按按钮按 5 次,第 1 次按下后准备做第 2 次推理时,模型脑子已经空了。

为什么不给机器人加历史记忆?算力扛不住。每多一帧历史画面,计算量近似指数级爆炸;强行加记忆,机器人会变成树懒——动作卡顿到无法使用。

MiniCPM-RobotManip 的解决路径很面壁:把 MiniCPM-V 4.6 的视觉 Token 高效压缩技术平移到机器人场景。结果:

指标 π0.5(主流) MiniCPM-RobotManip 倍数
RMBench 上下文记忆得分 10.4 53.5 5.1×
60 帧历史决策步算力 5.0 TFLOPs(单帧) 3.3 TFLOPs(流式) -34%
H100 单决策推理时延 234ms 120ms -49%

数字背后是「流式推理」:不重算历史帧,只增量更新视觉 Token 缓存,于是「保留 1 分钟上下文记忆的推理成本」与「传统单帧反应式」持平。性能更优,部署成本更低,这两件事在同一份数字里同时成立,是 2026 年 VLA 圈很少见的场景。

跟踪模型 0.9B 单卡跑,无网电梯里也能跟

MiniCPM-RobotTrack 在三个任务上刷了开源 SOTA:

任务 MiniCPM-RobotTrack(0.9B) vs OmTrackVLA vs TrackVLA++(闭源)
单目标跟踪(STT) 89.8 +7.0pp +8.8pp
动态多目标(DT) 73.4 +14.6pp
模糊目标(AT) 80.4(成功率 58.0%) +6.5pp +17.0pp

原生适配宇树 Go2 Edu,原装摄像头 + 本地算力跑出 5+ Hz,端到端响应 180ms。已经演示了在「电梯/停车场无网弱网」场景下的流畅跟随——这件事的意义比 benchmark 数字大得多:真机部署被压到消费级硬件

行业坐标:1.5B VLA 不是「小」,是「真机可跑」

模型 参数 真机门槛
π0.5(Physical Intelligence) ~3B H100/A100
OpenVLA-7B 7.8B 多卡
RT-2-X 55B 巨型集群
MiniCPM-RobotManip 1.5B 消费级 GPU

清华系把「具身智能的下沉」从论文 Demo 推到个人开发者 clone 即可跑的真实机器人。门槛一旦被开源踹开,具身领域的迭代速度会超出多数人的预期

值得关注的原因

  1. 记忆是具身的卡脖子问题——所有团队都在想办法绕,面壁直接用视觉 Token 压缩硬打。这是 2026 年 Q2 之后少见的「清华系硬技术」,不是套壳。
  2. 1.5B 完整放出权重——具身领域很少有这种开放程度,意味着大公司实验室以外的研究者、机器人爱好者、初创公司都能上手。
  3. 真机部署门槛被压到消费级——Go2 Edu 这种 1 万出头的机器狗 + 一张消费级 GPU 就能跑通端到端 VLA,具身智能的「手机时刻」比想象中近。
  4. 同一天 WAIC 还有黎曼动力 Riemann-1.0(23.2 万小时具身交互数据、真机仿真双 SOTA)、破壳机器人许华哲对谈「具身世界模型 ChatGPT 时刻」——具身赛道 2026 H2 集体起跑。

风险与待观察

  • 1.5B 真机泛化能力——bench 数字漂亮,但 RMBench 是新基准,真机场景里复杂光照、遮挡、柔性物体表现如何还要看。
  • 开源 ≠ 生态——Llama 用了两年才建起生态,VLA 模型涉及硬件适配、数据采集、sim-to-real,生态构建远比语言模型复杂。
  • 数据来源未完全披露——1.5B 模型通常需要数百万条轨迹,这些轨迹从哪儿来、是否合规,GitHub 仓库里没明说。
  • 面壁没有真机量产能力——模型开源是第一步,真要让 1 万台机器人跑这套,需要下游集成商,这是 OpenBMB 自己做还是生态共建,目前不明。

一句话总结

1.5B 跑赢 π0.5 五倍、单卡 120ms、宇树 Go2 上 180ms 跟人——面壁把具身智能从「实验室 demo」拽到了「开发者 clone 即跑」的临界点,这件事比 LingBot-VA 的 VAE 复杂架构更值得跟踪,因为它直接押注「真机可跑性」。

来源链接:

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录