Astra 抓积木:通用大模型的第一次真机臂大考

上周四,一家 YC 孵化的公司做了一件朴素到近乎莽的事:把 GPT-6 Astra 接上一对真实的机械臂,让它抓积木、放碗里。没有专用 VLA 模型,没有微调,没有示教数据——就是你我在终端里调用的那个 API,多喂了三路摄像头画面。

Astra 抓积木:通用大模型的第一次真机臂大考

上周四,一家 YC 孵化的公司做了一件朴素到近乎莽的事:把 GPT-6 Astra 接上一对真实的机械臂,让它抓积木、放碗里。没有专用 VLA 模型,没有微调,没有示教数据——就是你我在终端里调用的那个 API,多喂了三路摄像头画面。

做这件事的公司叫 Robocurve,自我介绍只有一句:"Real-world evaluations of physical AI"。他们开源了 inspect-robots 评测框架(287 星,6 月底建仓),跑过 Opus 5 的汉诺塔、跑过积木堆叠的测试时扩展曲线。这次的报告是 9 月 4 日发的《GPT-6 Astra on robotic manipulation》,前情是他们自己那期 Fable 5 对 Fable 5.1 的对比——同一对臂、同一套任务,Astra 补考入场。考场没换。

考场长什么样

硬件是双臂 I2RT YAM,每臂 6 自由度,平行夹爪。每一步决策,模型看到三路画面(顶部、左腕、右腕)加本体感知,输出绝对末端位姿去执行。每条轨迹最多 20 次模型调用,thinking 档位中等,机械臂限速到 25%。三个模型、两个任务、每任务每模型 20 次试验,共 120 次——全部有视频和转录,可逐条回看。

任务一:把红色积木放进碗。结果一边倒。Astra 20 次成了 19 次,Fable 5.1 成了 8 次,Fable 5 成了 1 次。平均用时 2.5 分钟对 6.8 分钟,单次成本 0.94 美元对 2.12 美元。三个模型用的是同一份牌价(每百万输入 10 美元、输出 50 美元),Anthropic 侧没开缓存、OpenAI 侧自动缓存了约五分之一的输入——报告特意说明,Astra 的成本只会被高估、不会被低估。输出 token 的差距更扎眼。Astra 平均 2100,Fable 5 是 19200。差 9 倍。

任务二:把拼图块嵌进凹槽。这里的风度比成绩重要。Astra 成了 2 次,Fable 5.1 也成了 2 次——打平。平均推进阶段 Astra 2.00,反而低于 Fable 5.1 的 2.35。报告原话:"It reaches the groove and stalls at the same final step Fable does." 两个模型卡在同一步。简单的任务拉开三倍的差距,难的任务一起卡在最后一毫米。

值得学的是它的认错方式

报告末尾的 Limitations 一节列了四条:Astra 的试验比 Fable 晚两天跑、没有交错;积木任务里 Fable 用的是 3 号台架、Astra 用 1 号(3 号后来不可用);打分是操作员目测、且知道正在跑哪个模型;成本按牌价算。HN 上 180 分的帖子里,被顶起来的评论是:"limitations that they state shouldn't really make much of an impact. But it was nice of them... to mention those. Kudos to them!"【直引】一个评测把自家缺陷列得比结论还全,这在真机评测里算稀有物种。

【判断】这条新闻真正的分量不在"Astra 赢了",而在模板本身:120 次试验、全量视频、全量转录、成本按时计价、缺陷主动披露——具身评测第一次有了可回放的公共记录。评论区吵的则是另一件事:折叠衣服那类家务到底卡在哪。高票的回答是把瓶颈从"智力"挪回"机械":机器人不是不会叠,是"叠七天就得返修","It would be a tough sell to have to bring in a 100kg robot for servicing every few weeks."【直引】

【推论】通用模型与专用 VLA 的界线,这个实验只掀开了一角:会看的部分(把画面变成动作序列)通用模型已经能做,卡壳的部分(最后一毫米的插入)它和专用模型一起卡。真机数据这条线,往后会比跑分好看。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens