1.5B VLA、压 π0.5 五倍:面壁智能开源 MiniCPM-Robot,把具身智能的「记忆短板」补上了
1.5B VLA、压 π0.5 五倍:面壁智能开源 MiniCPM-Robot,把具身智能的「记忆短板」补上了
来源:面壁智能 OpenBMB / 新智元 / 站长之家 URL: https://x.com/OpenBMB/status/2078839529591759025 日期:2026-07-19(WAIC 现场)
---
事件内容
7 月 19 日 WAIC 2026 现场,清华系独角兽面壁智能(OpenBMB)开源了首个具身 AI 模型系列 MiniCPM-Robot,三件套一次放出:
- MiniCPM-RobotManip:1.5B 参数的通用视觉-语言-动作(VLA)模型,负责机器人操作。
- MiniCPM-RobotTrack:0.9B 参数的端到端视觉指令跟踪模型,负责目标跟随。
- PhyAI:专为具身模型设计的高性能推理框架。
OpenBMB/MiniCPM-Robot,模型权重同时上线 Hugging Face。没有审核、没有 API 配额、没有 NDA——这是 2026 年具身领域相当罕见的开放程度。深度剖析
关键不是 1.5B,是「记忆」
具身智能的痛点不在感知,在「上下文记忆」。
当前主流 VLA(π0.5、RT-2、OpenVLA)绝大多数都是「单帧反应式」:看到当前画面,决定下一步动作,然后把上一步扔掉。让它按按钮按 5 次,第 1 次按下后准备做第 2 次推理时,模型脑子已经空了。
为什么不给机器人加历史记忆?算力扛不住。每多一帧历史画面,计算量近似指数级爆炸;强行加记忆,机器人会变成树懒——动作卡顿到无法使用。
MiniCPM-RobotManip 的解决路径很面壁:把 MiniCPM-V 4.6 的视觉 Token 高效压缩技术平移到机器人场景。结果:
| 指标 | π0.5(主流) | MiniCPM-RobotManip | 倍数 |
|---|---|---|---|
| RMBench 上下文记忆得分 | 10.4 | 53.5 | 5.1× |
| 60 帧历史决策步算力 | 5.0 TFLOPs(单帧) | 3.3 TFLOPs(流式) | -34% |
| H100 单决策推理时延 | 234ms | 120ms | -49% |
跟踪模型 0.9B 单卡跑,无网电梯里也能跟
MiniCPM-RobotTrack 在三个任务上刷了开源 SOTA:
| 任务 | MiniCPM-RobotTrack(0.9B) | vs OmTrackVLA | vs TrackVLA++(闭源) |
|---|---|---|---|
| 单目标跟踪(STT) | 89.8 | +7.0pp | +8.8pp |
| 动态多目标(DT) | 73.4 | +14.6pp | — |
| 模糊目标(AT) | 80.4(成功率 58.0%) | +6.5pp | +17.0pp |
行业坐标:1.5B VLA 不是「小」,是「真机可跑」
| 模型 | 参数 | 真机门槛 |
|---|---|---|
| π0.5(Physical Intelligence) | ~3B | H100/A100 |
| OpenVLA-7B | 7.8B | 多卡 |
| RT-2-X | 55B | 巨型集群 |
| MiniCPM-RobotManip | 1.5B | 消费级 GPU |
值得关注的原因
1. 记忆是具身的卡脖子问题——所有团队都在想办法绕,面壁直接用视觉 Token 压缩硬打。这是 2026 年 Q2 之后少见的「清华系硬技术」,不是套壳。 2. 1.5B 完整放出权重——具身领域很少有这种开放程度,意味着大公司实验室以外的研究者、机器人爱好者、初创公司都能上手。 3. 真机部署门槛被压到消费级——Go2 Edu 这种 1 万出头的机器狗 + 一张消费级 GPU 就能跑通端到端 VLA,具身智能的「手机时刻」比想象中近。 4. 同一天 WAIC 还有黎曼动力 Riemann-1.0(23.2 万小时具身交互数据、真机仿真双 SOTA)、破壳机器人许华哲对谈「具身世界模型 ChatGPT 时刻」——具身赛道 2026 H2 集体起跑。
风险与待观察
- 1.5B 真机泛化能力——bench 数字漂亮,但 RMBench 是新基准,真机场景里复杂光照、遮挡、柔性物体表现如何还要看。
- 开源 ≠ 生态——Llama 用了两年才建起生态,VLA 模型涉及硬件适配、数据采集、sim-to-real,生态构建远比语言模型复杂。
- 数据来源未完全披露——1.5B 模型通常需要数百万条轨迹,这些轨迹从哪儿来、是否合规,GitHub 仓库里没明说。
- 面壁没有真机量产能力——模型开源是第一步,真要让 1 万台机器人跑这套,需要下游集成商,这是 OpenBMB 自己做还是生态共建,目前不明。
一句话总结
1.5B 跑赢 π0.5 五倍、单卡 120ms、宇树 Go2 上 180ms 跟人——面壁把具身智能从「实验室 demo」拽到了「开发者 clone 即跑」的临界点,这件事比 LingBot-VA 的 VAE 复杂架构更值得跟踪,因为它直接押注「真机可跑性」。
来源链接:
- 推文:https://x.com/OpenBMB/status/2078839529591759025
- 新智元:https://www.163.com/dy/article/L27AB1VS0511ABV6.html
- 站长之家:https://www.chinaz.com/ainews/29702.shtml
- GitHub:https://github.com/OpenBMB/MiniCPM-Robot
- Hugging Face:https://huggingface.co/openbmb/MiniCPM-RobotManip
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens