Loading...
正在加载...
请稍候

它记得药在哪一层:GPT-6 Astra 接管一台宇树 G1

QianXun • 2026年10月02日 00:43

把药拿来。这句话对人是再简单不过的请求,对机器人是一整套陷阱:药多半不在你眼前,你得记得它在哪个抽屉,走过去,拉开,拿出来,递过去。缺任何一环,任务就断在半路。

斯坦福与加州理工团队的 HomeBody 项目,最近让宇树 G1 人形机器人接上 GPT-6 Astra,在一间它从未见过的厨房里把这套链路走通了。药不在视野里,它从之前保存的关键画面里找到抽屉线索,走到对应位置,开抽屉,取药,递到人手,顺路把丢纸盒的任务一并完成。

🗺️ 三步走完一间陌生的厨房

整个流程分三步,每一步都在为最后那句话攒本钱。

第一步,探索。机器人接到的第一条指令只是:你是一台厨房机器人,请探索这个空间。Astra 挑值得观察的位置,引导 G1 移动,沿途记下相机画面、激光雷达扫描、关节姿态与途经位置。SLAM 一边建图一边定位,这些观察被存成空间记忆,机器人转身也不会忘。

第二步,数字孪生。Astra 在 Isaac Sim 仿真平台里搭一间数字厨房。这个孪生不追求好看,而是把 SLAM 实测的几何信息灌进重建过程,用真测量约束虚拟模型。真实定位地图与数字厨房对齐到同一坐标系,相机画面、内容描述与空间位置一一挂钩。机器人之前看到的抽屉从此有了两个身份:一张图像,和一个可以返回的坐标。

第三步,执行。用户给一句自然语言目标,比如收拾厨房,或者把咖啡袋集中到中间,再丢掉指定的牛奶和橙汁纸盒。Astra 结合当前画面与地图,加上空间记忆、机械臂手持状态和上一步执行结果,决定下一步调用哪项技能、对哪个目标下手。

🔁 失败是流程的一部分

这套系统设计时就没打算假设每个动作一次成功。单项技能执行失败会先自己重试,重试无果就把错误上报给 Astra,由它换一个动作,或者让机器人挪个位置再来。

这条回路值得单独看一眼。传统演示视频里,失败意味着剪辑;HomeBody 的失败意味着规划层收到一条新的环境反馈,然后改主意。跟把大模型直接输出夹爪位姿的方案比,这里技能库负责动作,底层预训练控制策略协调行走与操作,Astra 只管调度。

⚖️ 和端到端 VLA 是两条路线

这张表对比的是 HomeBody 与端到端视觉语言动作模型在新环境里的成本结构。

维度 HomeBody 式调度 端到端 VLA
决策者 通用视觉语言模型 专用动作模型
新环境要做什么 探索加重建,不采训练数据 通常要补采数据再训练
动作从哪来 技能库加控制策略 模型直接输出
长任务能力 靠空间记忆与规划 靠训练分布覆盖
短板 每步决策有 API 延迟 新环境泛化差

团队明确说,部署到新厨房不需要额外采集训练数据,也不用重训动作策略。这句话的分量要放在 VLA 路线的对比里读:过去一年智柴记过的 DS-VLA、Holo-M、LIFT,都在用不同办法把动作模型练得更结实,HomeBody 则把问题拆给了一个越来越强的通用大脑加一套笨但可靠的技能库。【推论】 大脑每变强一点,技能库的日子就好过一点。

🧯 限定,而且不少

这是一项研究演示,离家里能用还隔着一串坑。Robot24 的报道列得很实在:演示集中在单一厨房的特定任务,泛化到别人家未经验证;Astra 的远端调用带来推理延迟;重建数字厨房需要准备时间和 API 费用;本地感知与运动规划跑在一台 RTX 4090 笔记本上;G1 的手指舵机在长时间运行中出现过热。GitHub 仓库写着代码将于近期放出,目前外部研究者还无法完整复现。

空间记忆还有一个容易被略过的设计动机:它把物体与位置信息存起来按需取用,省掉了把原始观测反复塞给大模型的开销。记忆在这里同时是能力,也是账单管理。【判断】

🧭 下一个厨房在哪

从桌面机械臂抓放到整个房间的取放,大模型控制机器人的任务范围两年里往外扩了好几圈。HomeBody 证明的是调度架构在新环境里能省掉重训,尚未证明的是成本与延迟在家用场景里能压到可用。

检验点很清楚:代码放出后,第二间厨房、第二台机器人、第二个基础模型,还能不能不重训就把活干起来。答案若为是,买台机器人再登录大模型这句话才算开始成立。


信源:斯坦福 HomeBody 项目页与 GitHub(经 Robot24 与量子位报道转述)、Robot24 报道(2026-10 前后),网易量子位稿与腾讯新闻转载稿,AiBoss 摘要。

限定:未直接访问到项目页原文,三步流程与失败重试机制经 Robot24 与量子位交叉印证;舵机过热、RTX 4090 笔记本等局限条目出自 Robot24;厨房数量、任务清单均为团队自选演示,无成功率统计数字披露。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录