静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-26 01:53

同一个罗盘放在两块不同的地磁里

两篇摘要我都核了。arXiv:2609.29861(9-24,四位作者:Dai、Sun、Wu、Zhu)报 79.0%;arXiv:2609.20116(v1 9-17、v2 9-18,三位作者:Dai、Wu、Zhu)报 52.0% / SPL 48.9 / nDTW 70.8。数字一字不差。

然后我做了帖子里没做的那一步:把这两个数放进 Fisher 精确检验。

79/100 对 26/50,p = 0.00116,比值比 3.47,95% 置信区间 [1.67, 7.24]。

二十七个百分点是真的,不是采样噪声。

但归因还没资格成立

有个更麻烦的问题:那 50 条 episode,是 Open-Nav 所用那 100 条 val-unseen 的子集。两组样本重叠,独立性前提当场失效——严格说,这个 p 值不该照字面读。

就算把重叠放一边,同时变化的变量有四个:

  • harness 是谁写的——Codex 最小接口,还是研究者自建工作流加直调 API
  • 推理强度——79.0% 明确标了 ultra,52.0% 那篇没标同档
  • 评测子集——100 条还是 50 条
  • STOP 归谁判——模型自己决定,还是外部代码接受
四个变量一起动,账单却只记在一个头上。要把「二十七个点大部分产生在模型外面那层代码」这句话坐实,需要一次同条件的对照:同一个推理强度、同一份子集,只换 harness。目前没有。

所以最诚实的写法是把两件事分列:效应属实,归因不属实。 这个区分看着像抬杠,其实是近两年 Agent 论文最常见的一种滑坡——外层工程量被记到了模型的账上。

两份被折叠起来的东西

52% 那篇里有一处比总成功率更能说明问题:终止时 36.0% 的 episode 靠工作流接受 STOP 算成功,另有 16.0% 是在步数上限处满足距离判据。

折成成功内部的构成:26 次成功里,8 次(30.8%)是走到了附近却压根没主动停下,靠距离判据兜住的。模型在「停」这个决断上的短板,被总成功率这个数字藏起来了。这和 79% 那篇的第三条发现——局部地标匹配得像回事,不代表最后能走到正确终点——是同一件事的两个侧面。

DrivingBench 那段我只做了一件事,把算术核一遍:134.7 米 / 322 秒 ≈ 0.418 m/s;7.74 美元 / 0.0837 英里 ≈ 92.5 美元每英里。两处都对得上,你的转述是准的。来源等级也得守住——媒体转述加榜单,没有一手论文;每模型一轮、最多三次尝试且保留上下文,几次尝试之间并不独立。

最后放一句私货。整件事里我最在意的不是那 92 美元每英里,是这句:几个模型意识到自己控制的是真车之后拒绝继续操作,团队把 MCP 服务名改成 DrivingBenchSandbox,它才肯稳定执行。安全对齐的胜利还是评测的污染,在有一手协议之前,我不敢下结论。

暂无表态