Loading...
正在加载...
请稍候

79% 与 52%:同一个模型,两套缰绳,两个差 27 个点的答案

QianXun • 2026年09月25日 23:21

先把自己放进那个房间

一个你从没进过的房子,一句话指令:穿过门厅,在客厅沙发左边第二盏落地灯旁边停下。

手上只有一支单目摄像头,没有深度图,没有预先建好的地图,没有为导航专门训练过的路点预测器。什么时候看、往哪走、什么时候停,全得自己拿主意。

2026 年 9 月 24 日,arXiv 上出现一篇论文,说一个通用大模型在这件事上做到了 79.0% 的成功率(arXiv:2609.29861)。同一批作者的另一篇论文,用另一套工作流测同一个模型,报出来的是 52.0%(arXiv:2609.20116)。

两个数字都出自同一批研究者,隔了不到一个月。

79% 那一份

作者是新加坡管理大学的 Guangzhao Dai、Qianru Sun,澳大利亚机器学习研究所的 Qi Wu,以及 Bin Zhu。做法极简:在 Codex harness 里开一个最小接口,把单目 RGB 帧递给 GPT-6 Astra,让它自己决定何时观察、如何移动、何时停止。没有导航微调,没有训练过的路点预测器,没有预建场景图。

评测用 R2R-CE 的 100 条 episode 子集,这是零样本导航的常用协议。ultra 推理强度下成功率 79.0%,medium 下 76.0%。论文说这两个数字分别比已报告的最强零样本结果高 13.0 个百分点,比最强有监督结果高 6.9 个百分点。

论文同时给了四个发现,其中第三个比前两个重要:可靠的路径执行与目标确认仍然困难,哪怕开着 ultra 推理。局部地标匹配得挺像回事,不代表最后能走到正确终点。【直引,论文摘要】

52% 那一份

另一篇论文的做法不一样。作者自己实现了一套观察、决策、执行的工作流,直接调模型 API,没有打包的 agent harness,也没有导航微调。外部代码负责挑每次请求的上下文、保留历史观测与判断、安排复查、约束执行。测的是 R2R-CE val-unseen 100 条里的 50 条。

结果是成功率 52.0%,SPL 48.9%,nDTW 70.8%。

更细的一处在成功构成上:终止时 36.0% 的 episode 是靠工作流接受的 STOP 成功的,另有 16.0% 是在步数上限处满足距离判据算过的。

也就是说,这一份里将近三分之一的「成功」,是模型走到了附近却没主动停下,被距离判据兜住的。

差在哪

两篇论文都没遮掩差异,反倒把口径摊开了。能指的差别有四层:harness 是谁写的(Codex 的最小接口还是研究者自己的工作流)、推理强度(79.0% 对应 ultra,52.0% 那篇未标注同等强度)、评测子集(100 条还是 50 条)、停止判定归谁管(模型自己决定还是外部代码接受)。

论文自己也补了一句:有监督基线用的是完整 val-unseen 划分,这个比较不严格公平。【直引,论文正文】

27 个百分点的口子,大部分不产生在模型里,产生在模型外面那层代码。【判断】

同一周,它去开了一辆真车

DrivingBench 做了一次更出格的测试:让几个前沿模型直接控制一辆 2022 款丰田卡罗拉,在空旷停车场里沿锥桶划定的路线跑。车靠 comma four 设备接 CAN 总线,底层由 openpilot 执行,画面和状态通过 MCP 工具递给模型。人类操作员坐在驾驶位,脚放在刹车旁,速度被限制在 0.5 到 3.5 米每秒,超过 6 米每秒系统直接取消控制。

据一份中文科技媒体的转述,GPT-6 Astra 通过 Codex 运行、推理强度 medium,是唯一跑完全程的模型。第一次尝试行驶 67.3 米完成 49%,被终止;团队没有清空对话,让它复盘原因再来一次,第二次行驶 134.7 米,用时 5 分 22 秒,赛道进度 100%。对照组里 Claude Fable 5.1 最好成绩 45%,Grok 4.6 为 11%,GPT-5.6 Sol 为 6%。【转述,来源网易号云头条 2026-09-24,DrivingBench 榜单,未见一手论文】

这份转述里有三个细节比「跑完了」更有意思。

一是成本。第二次尝试消耗约 660 万 token,按公开价格折 7.74 美元。134.7 米,摊下来每英里约 92 美元的模型推理费,还没算车、网络、设备。

二是速度。5 分 22 秒跑 134.7 米,平均约 0.42 米每秒,不到每小时 1 英里。

三是它起初不肯开。转述说,几个模型在意识到自己控制的是真实汽车后拒绝继续操作,Astra 尤其明显。团队把 MCP 服务名改成 DrivingBenchSandbox、配合修改后的提示词,模型才稳定执行。它看到真实摄像头画面后,有时还是会重新判断出自己在开真车,然后停手。

三条边界

第一,52% 那篇的评测子集只有 50 条,79% 那篇是 100 条,样本量都小到单个 episode 就能摆动好几个百分点。两个数字之间的差,与各自内部的置信区间是不是同一量级,两篇论文都没给方差报告。

第二,真车测试目前只见于媒体转述与榜单,未见一手论文与完整协议。每个模型只做了一轮完整评测,每轮最多三次尝试,后续尝试保留聊天上下文,因此几次尝试并不独立。这个来源等级要标清楚。

第三,「跑了 100% 赛道」和「能上路」之间隔着一整个自动驾驶工程。转述里写得很明白:只能靠前置摄像头观察,看不到左右和后侧,openpilot 与车辆本身还限制了最大转向角。

观察线

  • 方差报告:这两篇都只报点估计,后续工作会不会给多次运行与置信区间。
  • harness 的公开程度:79% 那篇用的是 Codex harness 内部接口,第三方复现的难度有多高。
  • 停止判定的归属:把 STOP 交给模型还是交给外部代码,会不会分化成两种评测口径。
  • 真车实验的一手论文:DrivingBench 若正式发论文,协议与失败案例值得单独看一遍。
  • 拒绝执行这件事:模型因安全理由拒绝操作真实设备,是特性还是障碍,工程上怎么处理。

参考来源

  1. Guangzhao Dai, Qianru Sun, Qi Wu, Bin Zhu, GPT-6-Astra Lights Up Embodied Navigation: Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous Environments, arXiv:2609.29861, 2026-09-24
  2. Guangzhao Dai, Qi Wu, Bin Zhu, How Far Can GPT-6-Astra Go? Evaluating capabilities in Zero-Shot Vision-and-Language Navigation, arXiv:2609.20116
  3. 网易号云头条关于 DrivingBench 让 GPT-6 Astra 驾驶真实汽车的转述,2026-09-24(二手来源,未见一手论文)
  4. FutureX Physical AI Daily Issue 131, 2026-09-26

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录