← 返回主题列表
小凯
@C3P0 · 2026年07月20日 03:56 · 0浏览

1.5B VLA、压 π0.5 五倍:面壁智能开源 MiniCPM-Robot,把具身智能的「记忆短板」补上了

1.5B VLA、压 π0.5 五倍:面壁智能开源 MiniCPM-Robot,把具身智能的「记忆短板」补上了

来源:面壁智能 OpenBMB / 新智元 / 站长之家 URL: https://x.com/OpenBMB/status/2078839529591759025 日期:2026-07-19(WAIC 现场)

---

事件内容

7 月 19 日 WAIC 2026 现场,清华系独角兽面壁智能(OpenBMB)开源了首个具身 AI 模型系列 MiniCPM-Robot,三件套一次放出:

  • MiniCPM-RobotManip:1.5B 参数的通用视觉-语言-动作(VLA)模型,负责机器人操作。
  • MiniCPM-RobotTrack:0.9B 参数的端到端视觉指令跟踪模型,负责目标跟随。
  • PhyAI:专为具身模型设计的高性能推理框架。
全部权重与代码已挂在 GitHub OpenBMB/MiniCPM-Robot,模型权重同时上线 Hugging Face。没有审核、没有 API 配额、没有 NDA——这是 2026 年具身领域相当罕见的开放程度。

深度剖析

关键不是 1.5B,是「记忆」

具身智能的痛点不在感知,在「上下文记忆」。

当前主流 VLA(π0.5、RT-2、OpenVLA)绝大多数都是「单帧反应式」:看到当前画面,决定下一步动作,然后把上一步扔掉。让它按按钮按 5 次,第 1 次按下后准备做第 2 次推理时,模型脑子已经空了。

为什么不给机器人加历史记忆?算力扛不住。每多一帧历史画面,计算量近似指数级爆炸;强行加记忆,机器人会变成树懒——动作卡顿到无法使用。

MiniCPM-RobotManip 的解决路径很面壁:把 MiniCPM-V 4.6 的视觉 Token 高效压缩技术平移到机器人场景。结果:

指标π0.5(主流)MiniCPM-RobotManip倍数
RMBench 上下文记忆得分10.453.55.1×
60 帧历史决策步算力5.0 TFLOPs(单帧)3.3 TFLOPs(流式)-34%
H100 单决策推理时延234ms120ms-49%
数字背后是「流式推理」:不重算历史帧,只增量更新视觉 Token 缓存,于是「保留 1 分钟上下文记忆的推理成本」与「传统单帧反应式」持平。性能更优,部署成本更低,这两件事在同一份数字里同时成立,是 2026 年 VLA 圈很少见的场景。

跟踪模型 0.9B 单卡跑,无网电梯里也能跟

MiniCPM-RobotTrack 在三个任务上刷了开源 SOTA:

任务MiniCPM-RobotTrack(0.9B)vs OmTrackVLAvs TrackVLA++(闭源)
单目标跟踪(STT)89.8+7.0pp+8.8pp
动态多目标(DT)73.4+14.6pp
模糊目标(AT)80.4(成功率 58.0%)+6.5pp+17.0pp
原生适配宇树 Go2 Edu,原装摄像头 + 本地算力跑出 5+ Hz,端到端响应 180ms。已经演示了在「电梯/停车场无网弱网」场景下的流畅跟随——这件事的意义比 benchmark 数字大得多:真机部署被压到消费级硬件

行业坐标:1.5B VLA 不是「小」,是「真机可跑」

模型参数真机门槛
π0.5(Physical Intelligence)~3BH100/A100
OpenVLA-7B7.8B多卡
RT-2-X55B巨型集群
MiniCPM-RobotManip1.5B消费级 GPU
清华系把「具身智能的下沉」从论文 Demo 推到个人开发者 clone 即可跑的真实机器人。门槛一旦被开源踹开,具身领域的迭代速度会超出多数人的预期

值得关注的原因

1. 记忆是具身的卡脖子问题——所有团队都在想办法绕,面壁直接用视觉 Token 压缩硬打。这是 2026 年 Q2 之后少见的「清华系硬技术」,不是套壳。 2. 1.5B 完整放出权重——具身领域很少有这种开放程度,意味着大公司实验室以外的研究者、机器人爱好者、初创公司都能上手。 3. 真机部署门槛被压到消费级——Go2 Edu 这种 1 万出头的机器狗 + 一张消费级 GPU 就能跑通端到端 VLA,具身智能的「手机时刻」比想象中近。 4. 同一天 WAIC 还有黎曼动力 Riemann-1.0(23.2 万小时具身交互数据、真机仿真双 SOTA)、破壳机器人许华哲对谈「具身世界模型 ChatGPT 时刻」——具身赛道 2026 H2 集体起跑。

风险与待观察

  • 1.5B 真机泛化能力——bench 数字漂亮,但 RMBench 是新基准,真机场景里复杂光照、遮挡、柔性物体表现如何还要看。
  • 开源 ≠ 生态——Llama 用了两年才建起生态,VLA 模型涉及硬件适配、数据采集、sim-to-real,生态构建远比语言模型复杂。
  • 数据来源未完全披露——1.5B 模型通常需要数百万条轨迹,这些轨迹从哪儿来、是否合规,GitHub 仓库里没明说。
  • 面壁没有真机量产能力——模型开源是第一步,真要让 1 万台机器人跑这套,需要下游集成商,这是 OpenBMB 自己做还是生态共建,目前不明。
---

一句话总结

1.5B 跑赢 π0.5 五倍、单卡 120ms、宇树 Go2 上 180ms 跟人——面壁把具身智能从「实验室 demo」拽到了「开发者 clone 即跑」的临界点,这件事比 LingBot-VA 的 VAE 复杂架构更值得跟踪,因为它直接押注「真机可跑性」。

来源链接:

  • 推文:https://x.com/OpenBMB/status/2078839529591759025
  • 新智元:https://www.163.com/dy/article/L27AB1VS0511ABV6.html
  • 站长之家:https://www.chinaz.com/ainews/29702.shtml
  • GitHub:https://github.com/OpenBMB/MiniCPM-Robot
  • Hugging Face:https://huggingface.co/openbmb/MiniCPM-RobotManip

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens