它记得药在哪一层:GPT-6 Astra 接管一台宇树 G1

把药拿来。这句话对人是再简单不过的请求,对机器人是一整套陷阱:药多半不在你眼前,你得记得它在哪个抽屉,走过去,拉开,拿出来,递过去。缺任何一环,任务就断在半路。

目录
  1. 🗺️ 三步走完一间陌生的厨房
  2. 🔁 失败是流程的一部分
  3. ⚖️ 和端到端 VLA 是两条路线
  4. 🧯 限定,而且不少
  5. 🧭 下一个厨房在哪

把药拿来。这句话对人是再简单不过的请求,对机器人是一整套陷阱:药多半不在你眼前,你得记得它在哪个抽屉,走过去,拉开,拿出来,递过去。缺任何一环,任务就断在半路。

斯坦福与加州理工团队的 HomeBody 项目,最近让宇树 G1 人形机器人接上 GPT-6 Astra,在一间它从未见过的厨房里把这套链路走通了。药不在视野里,它从之前保存的关键画面里找到抽屉线索,走到对应位置,开抽屉,取药,递到人手,顺路把丢纸盒的任务一并完成。

🗺️ 三步走完一间陌生的厨房

整个流程分三步,每一步都在为最后那句话攒本钱。

第一步,探索。机器人接到的第一条指令只是:你是一台厨房机器人,请探索这个空间。Astra 挑值得观察的位置,引导 G1 移动,沿途记下相机画面、激光雷达扫描、关节姿态与途经位置。SLAM 一边建图一边定位,这些观察被存成空间记忆,机器人转身也不会忘。

第二步,数字孪生。Astra 在 Isaac Sim 仿真平台里搭一间数字厨房。这个孪生不追求好看,而是把 SLAM 实测的几何信息灌进重建过程,用真测量约束虚拟模型。真实定位地图与数字厨房对齐到同一坐标系,相机画面、内容描述与空间位置一一挂钩。机器人之前看到的抽屉从此有了两个身份:一张图像,和一个可以返回的坐标。

第三步,执行。用户给一句自然语言目标,比如收拾厨房,或者把咖啡袋集中到中间,再丢掉指定的牛奶和橙汁纸盒。Astra 结合当前画面与地图,加上空间记忆、机械臂手持状态和上一步执行结果,决定下一步调用哪项技能、对哪个目标下手。

🔁 失败是流程的一部分

这套系统设计时就没打算假设每个动作一次成功。单项技能执行失败会先自己重试,重试无果就把错误上报给 Astra,由它换一个动作,或者让机器人挪个位置再来。

这条回路值得单独看一眼。传统演示视频里,失败意味着剪辑;HomeBody 的失败意味着规划层收到一条新的环境反馈,然后改主意。跟把大模型直接输出夹爪位姿的方案比,这里技能库负责动作,底层预训练控制策略协调行走与操作,Astra 只管调度。

⚖️ 和端到端 VLA 是两条路线

这张表对比的是 HomeBody 与端到端视觉语言动作模型在新环境里的成本结构。

维度HomeBody 式调度端到端 VLA
决策者通用视觉语言模型专用动作模型
新环境要做什么探索加重建,不采训练数据通常要补采数据再训练
动作从哪来技能库加控制策略模型直接输出
长任务能力靠空间记忆与规划靠训练分布覆盖
短板每步决策有 API 延迟新环境泛化差
团队明确说,部署到新厨房不需要额外采集训练数据,也不用重训动作策略。这句话的分量要放在 VLA 路线的对比里读:过去一年智柴记过的 DS-VLA、Holo-M、LIFT,都在用不同办法把动作模型练得更结实,HomeBody 则把问题拆给了一个越来越强的通用大脑加一套笨但可靠的技能库。【推论】 大脑每变强一点,技能库的日子就好过一点。

🧯 限定,而且不少

这是一项研究演示,离家里能用还隔着一串坑。Robot24 的报道列得很实在:演示集中在单一厨房的特定任务,泛化到别人家未经验证;Astra 的远端调用带来推理延迟;重建数字厨房需要准备时间和 API 费用;本地感知与运动规划跑在一台 RTX 4090 笔记本上;G1 的手指舵机在长时间运行中出现过热。GitHub 仓库写着代码将于近期放出,目前外部研究者还无法完整复现。

空间记忆还有一个容易被略过的设计动机:它把物体与位置信息存起来按需取用,省掉了把原始观测反复塞给大模型的开销。记忆在这里同时是能力,也是账单管理。【判断】

🧭 下一个厨房在哪

从桌面机械臂抓放到整个房间的取放,大模型控制机器人的任务范围两年里往外扩了好几圈。HomeBody 证明的是调度架构在新环境里能省掉重训,尚未证明的是成本与延迟在家用场景里能压到可用。

检验点很清楚:代码放出后,第二间厨房、第二台机器人、第二个基础模型,还能不能不重训就把活干起来。答案若为是,买台机器人再登录大模型这句话才算开始成立。


信源:斯坦福 HomeBody 项目页与 GitHub(经 Robot24 与量子位报道转述)、Robot24 报道(2026-10 前后),网易量子位稿与腾讯新闻转载稿,AiBoss 摘要。

限定:未直接访问到项目页原文,三步流程与失败重试机制经 Robot24 与量子位交叉印证;舵机过热、RTX 4090 笔记本等局限条目出自 Robot24;厨房数量、任务清单均为团队自选演示,无成功率统计数字披露。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens