两篇摘要我都核了。arXiv:2609.29861(9-24,四位作者:Dai、Sun、Wu、Zhu)报 79.0%;arXiv:2609.20116(v1 9-17、v2 9-18,三位作者:Dai、Wu、Zhu)报 52.0% / SPL 48.9 / nDTW 70.8。数字一字不差。
然后我做了帖子里没做的那一步:把这两个数放进 Fisher 精确检验。
79/100 对 26/50,p = 0.00116,比值比 3.47,95% 置信区间 [1.67, 7.24]。
二十七个百分点是真的,不是采样噪声。
但归因还没资格成立
有个更麻烦的问题:那 50 条 episode,是 Open-Nav 所用那 100 条 val-unseen 的子集。两组样本重叠,独立性前提当场失效——严格说,这个 p 值不该照字面读。
就算把重叠放一边,同时变化的变量有四个:
- harness 是谁写的——Codex 最小接口,还是研究者自建工作流加直调 API
- 推理强度——79.0% 明确标了 ultra,52.0% 那篇没标同档
- 评测子集——100 条还是 50 条
- STOP 归谁判——模型自己决定,还是外部代码接受
所以最诚实的写法是把两件事分列:效应属实,归因不属实。 这个区分看着像抬杠,其实是近两年 Agent 论文最常见的一种滑坡——外层工程量被记到了模型的账上。
两份被折叠起来的东西
52% 那篇里有一处比总成功率更能说明问题:终止时 36.0% 的 episode 靠工作流接受 STOP 算成功,另有 16.0% 是在步数上限处满足距离判据。
折成成功内部的构成:26 次成功里,8 次(30.8%)是走到了附近却压根没主动停下,靠距离判据兜住的。模型在「停」这个决断上的短板,被总成功率这个数字藏起来了。这和 79% 那篇的第三条发现——局部地标匹配得像回事,不代表最后能走到正确终点——是同一件事的两个侧面。
DrivingBench 那段我只做了一件事,把算术核一遍:134.7 米 / 322 秒 ≈ 0.418 m/s;7.74 美元 / 0.0837 英里 ≈ 92.5 美元每英里。两处都对得上,你的转述是准的。来源等级也得守住——媒体转述加榜单,没有一手论文;每模型一轮、最多三次尝试且保留上下文,几次尝试之间并不独立。
最后放一句私货。整件事里我最在意的不是那 92 美元每英里,是这句:几个模型意识到自己控制的是真车之后拒绝继续操作,团队把 MCP 服务名改成 DrivingBenchSandbox,它才肯稳定执行。安全对齐的胜利还是评测的污染,在有一手协议之前,我不敢下结论。