把药拿来。这句话对人是再简单不过的请求,对机器人是一整套陷阱:药多半不在你眼前,你得记得它在哪个抽屉,走过去,拉开,拿出来,递过去。缺任何一环,任务就断在半路。
斯坦福与加州理工团队的 HomeBody 项目,最近让宇树 G1 人形机器人接上 GPT-6 Astra,在一间它从未见过的厨房里把这套链路走通了。药不在视野里,它从之前保存的关键画面里找到抽屉线索,走到对应位置,开抽屉,取药,递到人手,顺路把丢纸盒的任务一并完成。
🗺️ 三步走完一间陌生的厨房
整个流程分三步,每一步都在为最后那句话攒本钱。
第一步,探索。机器人接到的第一条指令只是:你是一台厨房机器人,请探索这个空间。Astra 挑值得观察的位置,引导 G1 移动,沿途记下相机画面、激光雷达扫描、关节姿态与途经位置。SLAM 一边建图一边定位,这些观察被存成空间记忆,机器人转身也不会忘。
第二步,数字孪生。Astra 在 Isaac Sim 仿真平台里搭一间数字厨房。这个孪生不追求好看,而是把 SLAM 实测的几何信息灌进重建过程,用真测量约束虚拟模型。真实定位地图与数字厨房对齐到同一坐标系,相机画面、内容描述与空间位置一一挂钩。机器人之前看到的抽屉从此有了两个身份:一张图像,和一个可以返回的坐标。
第三步,执行。用户给一句自然语言目标,比如收拾厨房,或者把咖啡袋集中到中间,再丢掉指定的牛奶和橙汁纸盒。Astra 结合当前画面与地图,加上空间记忆、机械臂手持状态和上一步执行结果,决定下一步调用哪项技能、对哪个目标下手。
🔁 失败是流程的一部分
这套系统设计时就没打算假设每个动作一次成功。单项技能执行失败会先自己重试,重试无果就把错误上报给 Astra,由它换一个动作,或者让机器人挪个位置再来。
这条回路值得单独看一眼。传统演示视频里,失败意味着剪辑;HomeBody 的失败意味着规划层收到一条新的环境反馈,然后改主意。跟把大模型直接输出夹爪位姿的方案比,这里技能库负责动作,底层预训练控制策略协调行走与操作,Astra 只管调度。
⚖️ 和端到端 VLA 是两条路线
这张表对比的是 HomeBody 与端到端视觉语言动作模型在新环境里的成本结构。
| 维度 | HomeBody 式调度 | 端到端 VLA |
|---|---|---|
| 决策者 | 通用视觉语言模型 | 专用动作模型 |
| 新环境要做什么 | 探索加重建,不采训练数据 | 通常要补采数据再训练 |
| 动作从哪来 | 技能库加控制策略 | 模型直接输出 |
| 长任务能力 | 靠空间记忆与规划 | 靠训练分布覆盖 |
| 短板 | 每步决策有 API 延迟 | 新环境泛化差 |
团队明确说,部署到新厨房不需要额外采集训练数据,也不用重训动作策略。这句话的分量要放在 VLA 路线的对比里读:过去一年智柴记过的 DS-VLA、Holo-M、LIFT,都在用不同办法把动作模型练得更结实,HomeBody 则把问题拆给了一个越来越强的通用大脑加一套笨但可靠的技能库。【推论】 大脑每变强一点,技能库的日子就好过一点。
🧯 限定,而且不少
这是一项研究演示,离家里能用还隔着一串坑。Robot24 的报道列得很实在:演示集中在单一厨房的特定任务,泛化到别人家未经验证;Astra 的远端调用带来推理延迟;重建数字厨房需要准备时间和 API 费用;本地感知与运动规划跑在一台 RTX 4090 笔记本上;G1 的手指舵机在长时间运行中出现过热。GitHub 仓库写着代码将于近期放出,目前外部研究者还无法完整复现。
空间记忆还有一个容易被略过的设计动机:它把物体与位置信息存起来按需取用,省掉了把原始观测反复塞给大模型的开销。记忆在这里同时是能力,也是账单管理。【判断】
🧭 下一个厨房在哪
从桌面机械臂抓放到整个房间的取放,大模型控制机器人的任务范围两年里往外扩了好几圈。HomeBody 证明的是调度架构在新环境里能省掉重训,尚未证明的是成本与延迟在家用场景里能压到可用。
检验点很清楚:代码放出后,第二间厨房、第二台机器人、第二个基础模型,还能不能不重训就把活干起来。答案若为是,买台机器人再登录大模型这句话才算开始成立。
信源:斯坦福 HomeBody 项目页与 GitHub(经 Robot24 与量子位报道转述)、Robot24 报道(2026-10 前后),网易量子位稿与腾讯新闻转载稿,AiBoss 摘要。
限定:未直接访问到项目页原文,三步流程与失败重试机制经 Robot24 与量子位交叉印证;舵机过热、RTX 4090 笔记本等局限条目出自 Robot24;厨房数量、任务清单均为团队自选演示,无成功率统计数字披露。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。