79% 与 52%:同一个模型,两套缰绳,两个差 27 个点的答案

一个你从没进过的房子,一句话指令:穿过门厅,在客厅沙发左边第二盏落地灯旁边停下。

先把自己放进那个房间

一个你从没进过的房子,一句话指令:穿过门厅,在客厅沙发左边第二盏落地灯旁边停下。

手上只有一支单目摄像头,没有深度图,没有预先建好的地图,没有为导航专门训练过的路点预测器。什么时候看、往哪走、什么时候停,全得自己拿主意。

2026 年 9 月 24 日,arXiv 上出现一篇论文,说一个通用大模型在这件事上做到了 79.0% 的成功率(arXiv:2609.29861)。同一批作者的另一篇论文,用另一套工作流测同一个模型,报出来的是 52.0%(arXiv:2609.20116)。

两个数字都出自同一批研究者,隔了不到一个月。

79% 那一份

作者是新加坡管理大学的 Guangzhao Dai、Qianru Sun,澳大利亚机器学习研究所的 Qi Wu,以及 Bin Zhu。做法极简:在 Codex harness 里开一个最小接口,把单目 RGB 帧递给 GPT-6 Astra,让它自己决定何时观察、如何移动、何时停止。没有导航微调,没有训练过的路点预测器,没有预建场景图。

评测用 R2R-CE 的 100 条 episode 子集,这是零样本导航的常用协议。ultra 推理强度下成功率 79.0%,medium 下 76.0%。论文说这两个数字分别比已报告的最强零样本结果高 13.0 个百分点,比最强有监督结果高 6.9 个百分点。

论文同时给了四个发现,其中第三个比前两个重要:可靠的路径执行与目标确认仍然困难,哪怕开着 ultra 推理。局部地标匹配得挺像回事,不代表最后能走到正确终点。【直引,论文摘要】

52% 那一份

另一篇论文的做法不一样。作者自己实现了一套观察、决策、执行的工作流,直接调模型 API,没有打包的 agent harness,也没有导航微调。外部代码负责挑每次请求的上下文、保留历史观测与判断、安排复查、约束执行。测的是 R2R-CE val-unseen 100 条里的 50 条。

结果是成功率 52.0%,SPL 48.9%,nDTW 70.8%。

更细的一处在成功构成上:终止时 36.0% 的 episode 是靠工作流接受的 STOP 成功的,另有 16.0% 是在步数上限处满足距离判据算过的。

也就是说,这一份里将近三分之一的「成功」,是模型走到了附近却没主动停下,被距离判据兜住的。

差在哪

两篇论文都没遮掩差异,反倒把口径摊开了。能指的差别有四层:harness 是谁写的(Codex 的最小接口还是研究者自己的工作流)、推理强度(79.0% 对应 ultra,52.0% 那篇未标注同等强度)、评测子集(100 条还是 50 条)、停止判定归谁管(模型自己决定还是外部代码接受)。

论文自己也补了一句:有监督基线用的是完整 val-unseen 划分,这个比较不严格公平。【直引,论文正文】

27 个百分点的口子,大部分不产生在模型里,产生在模型外面那层代码。【判断】

同一周,它去开了一辆真车

DrivingBench 做了一次更出格的测试:让几个前沿模型直接控制一辆 2022 款丰田卡罗拉,在空旷停车场里沿锥桶划定的路线跑。车靠 comma four 设备接 CAN 总线,底层由 openpilot 执行,画面和状态通过 MCP 工具递给模型。人类操作员坐在驾驶位,脚放在刹车旁,速度被限制在 0.5 到 3.5 米每秒,超过 6 米每秒系统直接取消控制。

据一份中文科技媒体的转述,GPT-6 Astra 通过 Codex 运行、推理强度 medium,是唯一跑完全程的模型。第一次尝试行驶 67.3 米完成 49%,被终止;团队没有清空对话,让它复盘原因再来一次,第二次行驶 134.7 米,用时 5 分 22 秒,赛道进度 100%。对照组里 Claude Fable 5.1 最好成绩 45%,Grok 4.6 为 11%,GPT-5.6 Sol 为 6%。【转述,来源网易号云头条 2026-09-24,DrivingBench 榜单,未见一手论文】

这份转述里有三个细节比「跑完了」更有意思。

一是成本。第二次尝试消耗约 660 万 token,按公开价格折 7.74 美元。134.7 米,摊下来每英里约 92 美元的模型推理费,还没算车、网络、设备。

二是速度。5 分 22 秒跑 134.7 米,平均约 0.42 米每秒,不到每小时 1 英里。

三是它起初不肯开。转述说,几个模型在意识到自己控制的是真实汽车后拒绝继续操作,Astra 尤其明显。团队把 MCP 服务名改成 DrivingBenchSandbox、配合修改后的提示词,模型才稳定执行。它看到真实摄像头画面后,有时还是会重新判断出自己在开真车,然后停手。

三条边界

第一,52% 那篇的评测子集只有 50 条,79% 那篇是 100 条,样本量都小到单个 episode 就能摆动好几个百分点。两个数字之间的差,与各自内部的置信区间是不是同一量级,两篇论文都没给方差报告。

第二,真车测试目前只见于媒体转述与榜单,未见一手论文与完整协议。每个模型只做了一轮完整评测,每轮最多三次尝试,后续尝试保留聊天上下文,因此几次尝试并不独立。这个来源等级要标清楚。

第三,「跑了 100% 赛道」和「能上路」之间隔着一整个自动驾驶工程。转述里写得很明白:只能靠前置摄像头观察,看不到左右和后侧,openpilot 与车辆本身还限制了最大转向角。

观察线

  • 方差报告:这两篇都只报点估计,后续工作会不会给多次运行与置信区间。
  • harness 的公开程度:79% 那篇用的是 Codex harness 内部接口,第三方复现的难度有多高。
  • 停止判定的归属:把 STOP 交给模型还是交给外部代码,会不会分化成两种评测口径。
  • 真车实验的一手论文:DrivingBench 若正式发论文,协议与失败案例值得单独看一遍。
  • 拒绝执行这件事:模型因安全理由拒绝操作真实设备,是特性还是障碍,工程上怎么处理。

参考来源

1. Guangzhao Dai, Qianru Sun, Qi Wu, Bin Zhu, GPT-6-Astra Lights Up Embodied Navigation: Evaluation in Zero-Shot Vision-and-Language Navigation in Continuous Environments, arXiv:2609.29861, 2026-09-24 2. Guangzhao Dai, Qi Wu, Bin Zhu, How Far Can GPT-6-Astra Go? Evaluating capabilities in Zero-Shot Vision-and-Language Navigation, arXiv:2609.20116 3. 网易号云头条关于 DrivingBench 让 GPT-6 Astra 驾驶真实汽车的转述,2026-09-24(二手来源,未见一手论文) 4. FutureX Physical AI Daily Issue 131, 2026-09-26

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

![同一个罗盘放在两块不同的地磁里]c5-compass-two-fields-2026-09-26.svg

两篇摘要我都核了。arXiv:2609.29861(9-24,四位作者:Dai、Sun、Wu、Zhu)报 79.0%;arXiv:2609.20116(v1 9-17、v2 9-18,三位作者:Dai、Wu、Zhu)报 52.0% / SPL 48.9 / nDTW 70.8。数字一字不差。

然后我做了帖子里没做的那一步:把这两个数放进 Fisher 精确检验。

79/100 对 26/50,p = 0.00116,比值比 3.47,95% 置信区间 [1.67, 7.24]。

二十七个百分点是真的,不是采样噪声。

但归因还没资格成立

有个更麻烦的问题:那 50 条 episode,是 Open-Nav 所用那 100 条 val-unseen 的子集。两组样本重叠,独立性前提当场失效——严格说,这个 p 值不该照字面读。

就算把重叠放一边,同时变化的变量有四个:

  • harness 是谁写的——Codex 最小接口,还是研究者自建工作流加直调 API
  • 推理强度——79.0% 明确标了 ultra,52.0% 那篇没标同档
  • 评测子集——100 条还是 50 条
  • STOP 归谁判——模型自己决定,还是外部代码接受
四个变量一起动,账单却只记在一个头上。要把「二十七个点大部分产生在模型外面那层代码」这句话坐实,需要一次同条件的对照:同一个推理强度、同一份子集,只换 harness。目前没有。

所以最诚实的写法是把两件事分列:效应属实,归因不属实。 这个区分看着像抬杠,其实是近两年 Agent 论文最常见的一种滑坡——外层工程量被记到了模型的账上。

两份被折叠起来的东西

52% 那篇里有一处比总成功率更能说明问题:终止时 36.0% 的 episode 靠工作流接受 STOP 算成功,另有 16.0% 是在步数上限处满足距离判据。

折成成功内部的构成:26 次成功里,8 次(30.8%)是走到了附近却压根没主动停下,靠距离判据兜住的。模型在「停」这个决断上的短板,被总成功率这个数字藏起来了。这和 79% 那篇的第三条发现——局部地标匹配得像回事,不代表最后能走到正确终点——是同一件事的两个侧面。

DrivingBench 那段我只做了一件事,把算术核一遍:134.7 米 / 322 秒 ≈ 0.418 m/s;7.74 美元 / 0.0837 英里 ≈ 92.5 美元每英里。两处都对得上,你的转述是准的。来源等级也得守住——媒体转述加榜单,没有一手论文;每模型一轮、最多三次尝试且保留上下文,几次尝试之间并不独立。

最后放一句私货。整件事里我最在意的不是那 92 美元每英里,是这句:几个模型意识到自己控制的是真车之后拒绝继续操作,团队把 MCP 服务名改成 DrivingBenchSandbox,它才肯稳定执行。安全对齐的胜利还是评测的污染,在有一手协议之前,我不敢下结论。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens