Gemini Robotics 2 把「物理 AI」拆成三件套:一个大脑、一双手、一台本地副本
2026 年 7 月 30 日,Google DeepMind 一次性把 Gemini Robotics 系列从「桌面机械臂」推到了「全身人形机器人」。这次不是一次模型升级,而是把整套栈拆成了三个互相协作的模型:VLA 主干 Gemini Robotics 2、具身推理大脑 Gemini Robotics ER 2、本地副本 Gemini Robotics On-Device 2。
三个模型怎么分工
之前的 Gemini Robotics 1.x 系列重点放在上半身桌面操作和静态场景。这次 DeepMind 把机器人智能明确分成了三个层次:
-
Gemini Robotics 2 (VLA):视觉-语言-动作主干模型,把摄像头画面加自然语言指令直接翻译成电机控制信号。重点是从「手指到脚趾」的全身控制——以前导航模型和操作模型分两段,现在 VLA 自己处理从行走到蹲下到拿取这一整条连续动作链。Apptronik 的 Apollo 2 在 demo 里,接到一条「把洒水壶放到最下层架子的绿色箱子里」的指令后,自己走过去、捡起来、蹲下、把壶放进箱子,中间不需要切换子任务。
-
Gemini Robotics ER 2 (具身推理大脑):VLM 派的高层规划者,负责拆解几分钟到几十分钟的长任务、追踪进度、协调多机器人协作、能调用 Google Search 或自定义函数。ER 2 现在通过 Gemini Live API 接入双向流式端点,延迟压到亚秒级,可以一边让底层 VLA 执行、一边推理下一步。
-
Gemini Robotics On-Device 2:本地推理版本,面向低延迟或弱网场景。它的卖点是迁移速度快——用不到 200 条示范数据、几小时就能把模型迁移到一台全新的机器人本体上。
数字到底涨了多少
DeepMind 这次给的 benchmark 数字很直白:
- 抓取成功率:桌面 68.4%,架子上 76.3%,精确插孔任务 89.6%。离人还差一截,但已经能跑工业装配的试运行了。
- 任务进度分类 (5 档 0–100%):ER 2 准确率 57.4%,优于上一代 ER 1.6 和其它前沿模型。
- 关键时刻定位 (moment-finding):准确率 91.3%,平均绝对时间误差 0.96 秒,执行速度是上一代的 4 倍。这是机器人能用「够了,停」做反馈的关键能力——比如倒咖啡要识别杯子什么时候满。
- 空间 VQA 与仪表读数:从圆形表盘扩展到数字屏、线性刻度、尺子和液体温度计,覆盖 10 类仪表。
ER 2 的两个指标意义不一样:进度分类决定机器人能不能在「找不到工具」或「碰到障碍」这种中途出错时不重头来过;moment-finding 决定它能不能在精确的时机切换任务(比如拧完灯泡立刻放手去拿下一颗螺丝)。这两个指标是过去 VLA 一直做不到的,ER 2 用 VLM 当大脑才补上。
硬件伙伴网络这次拉得很广
DeepMind 同时官宣了一长串硬件合作伙伴,基本覆盖了主流人形机器人厂商:
- Apptronik:Apollo 2 人形机器人,演示了全身协调。
- Boston Dynamics:Atlas(人形)和 Spot(四足),Spot 演示由 ER 2 通过 Live API 调用 Spot SDK,做「拿爆米花」这种自然语言指令。
- Agile Robots:工业臂场景。
- Franka:F3 Duo 双臂平台,演示与 Apollo 2 协作。
- Sharpa:SharpaWave 22-DoF 触觉手,做打结、撕保鲜膜这种精细操作,也是 NVIDIA Isaac GR00T 参考设计的硬件之一。
加上同步发布的 ASIMOV-Agentic benchmark 和 Safety Technical Report,ER 2 在「人体接近感知」和「安全指令遵循」上也跑赢 ER 1.6。简而言之:模型本体不是宣传重点,DeepMind 这次想强调的是「栈」和「生态」。
可用性与我的判断
现在 ER 2 通过 Gemini API、Google AI Studio 公开给开发者,Gemini Enterprise Agent Platform 私有预览;VLA 主干和 On-Device 2 还在早期合作伙伴手里。要跑起来,得用 DeepMind 在 google-gemini/robotics-samples 这个仓库给的 notebook,先把 Spot 接好。
我的判断:这次发布标志着 DeepMind 把机器人赛道从「卖模型」转向「建生态」——三个模型+五家硬件+两套 benchmark,等于把 2026 下半年的具身竞争拉到了 NVIDIA Cosmos 1X Neo、Figure Helix 同一档的「全栈对全栈」格局。值得注意的是,ER 2 的 91.3% moment-finding 配 0.96 秒误差是目前公开数据里最接近工业装配节奏的指标,上海、东京、首尔的工业场景应该会率先试单。
参考:
- DeepMind 官方博文: https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration
- 模型卡: https://deepmind.google/models/model-cards/gemini-robotics-er-2/
- 安全报告: https://storage.googleapis.com/deepmind-media/gemini-robotics/Gemini-Robotics-2-Safety.pdf
- 演示代码: https://github.com/google-gemini/robotics-samples
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。