九月的机器人圈被两段视频刷了屏。一段里,机械臂看着人类演示的视频,自己复刻了动作;另一段里,它笨拙又执着地画了一座金门大桥——作者 Thijs,OpenAI 一位 20 岁的工程师,迭代到第四次才成,Sam Altman 在底下留言要画。热闹归热闹,demo 不算数。机器人领域被漂亮视频喂了十年,饱得很。
比视频硬的东西 9 月 4 日就挂出来了,9 月 16 日被 Humanoids Daily 一篇长文推到台前:RoboCurve 给 GPT-6 Astra 做的真机评测,120 次试验,每一次都带完整视频和执行轨迹存档。
先认识一下出卷人。RoboCurve 是一家公益公司,YC 系,9 月 14 日刚宣布 1000 万美元种子轮。它把评测框架开源了,名字叫 Inspect Robots——致敬英国 AI 安全研究所那套 Inspect AI。出卷思路写在开源文档里:真机械臂、真物体、全量留痕。
考场是两台 I2RT YAM 机械臂。考生用 GPT-6 Astra(9 月 3 日发布,OpenAI 现役旗舰),对照组是 Fable 5.1 和 Fable 5 两个专用机器人模型。三个模型、两个任务、各 20 次。规则统一:模型每回合只有 20 次 LLM 调用预算,速度被压到 25%,带默认安全护栏;评分按 0 到 4 五个等级记"最高到达阶段"。任务从一句话开始:"把红色的那个捡起来。"
第一道题,把积木放进碗里。Astra 19 次,成功率 95%;Fable 5.1 拿下 8 次;上代 Fable 5 只成过 1 次。差距不光在成功率:Astra 平均 2.5 分钟完成一次,对照组 6.8 分钟;单次试验成本 0.94 美元对 2.12 美元;输出 token 还少 6.2 倍。这几个数我们逐项复算过,对得上。
第二道题画风突变。把拼图精确插进对应的孔里——亚毫米级的对位。Astra 成功 2 次,10%。跟 Fable 5.1 打平。另一套 RoboDojo 双臂协作测试,Astra 拿下 26%。
95 减 10,中间隔着的正是"最后十厘米"。粗放抓放靠视觉和理解,模型的时代红利全在这;插孔靠的是接触力学——力控、摩擦、形变,全世界实验室啃了几十年的硬骨头。推理能力换不来这十厘米,今天这份成绩单把它量化出来了。仿真侧的数字更热但要做冷处理:另一份技术报告里,10 个仿真任务 Astra 直控拿到 49/50——计时里不含推理延迟,真机部署的障碍一个没少。
传播层还有一条独立的支线要分开记。9 月 3 日前后,有博主发现 GPT-6 Astra 的部分基准分数在上线后被改动过,视频传开。OpenAI 承认改了分,归因于评测噪声和一个发布 bug。这事发生在模型发布环节,跟两天后的机器人评测是两条线,时间挨得近,很容易被搅成一句话,分开看更清楚。两条线拼在一起倒是有个共同主题:基准的可信度本身成了新闻。
小字还有几行,一并交底。对照物是 Fable 5.1,网上"胜过人类"的说法是讹传。OpenAI 官方发布页从头到尾没有一个字的机器人内容,机器人叙事全部来自第三方评测。RoboCurve 自己也列了局限:试验没有交错进行,碗型不完全一致,人工评分没有盲评。这些都没推翻成绩,只是给 95 这个数圈了误差棒。
这份成绩单真正的分量,也许在评测行业本身。排行榜见过太多了——一个总分,一句"遥遥领先",点到为止。RoboCurve 给出的另一种格式是:每跑一次,存一份视频和轨迹,谁都可以点开数它错在哪一次。95 这个数因此可以被人复核,1 那次失败也有案可查。
顺带把那两段刷屏视频放回坐标系:看视频学动作,对应的是物理在上下文中学习这条路,单次演示就能复刻——拆开看,模型输出的是末端位姿,关节解算仍由外部运动规划器完成;画金门大桥翻车三次、第四次才成,倒是意外地诚实——真机学习就是这个样子,一次一次试出来的。
最后十厘米什么时候被跨过去,没人能排期。可以确定的是下一份真机成绩单大概也会带收据。排行榜会撒谎,收据不会。
来源:robocurve.org 评测页与开源框架;Humanoids Daily 2026-09-16 长文;OpenAI GPT-6 Astra 发布页;HN 及 r/singularity 相关讨论。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。