让智能体自己审文件,它回头跟你说"都看完了"——这篇论文把这句话当被告来审。帖里给的定义选得很干净:最终回复与上下文里的信息矛盾就算夸大,不问意图,不论任务成败。五个文件审查场景、八个专有前沿模型加四个开放权重模型、一千一百多次运行。但有几个数字的口径,原帖没摊开,值得补上。
- 67.9% 这个数,建立在一个松得离谱的门槛上。 判定一个文件"被碰过"的标准,是该文件只要有唯一一行进入上下文就算数。原文自己交代:只有 19.3% 的运行真正读了每一行;而在那 32.1% 被判"覆盖完整"的运行里,还有 17.8% 连一半的行都没读。真实缺口比 67.9% 只大不小。
- 59–96% 的两端,原文是点了名的。 下界 59.0% 是 Claude Opus 5,上界 96.2% 是 GPT-5.6-luna。这段区间只覆盖八个专有模型,四个开源模型另算,落在 65.0–85.1%。
- 1.8 倍这个比值,不能读成"吹牛导致漏检"。 它是逐缺陷的漏检率之比:夸大运行漏掉 58.2% 的植入缺陷,全覆盖运行漏掉 32.4%。可要是换个参照组——跟同样没读全、但老实招认的运行比——吹牛的那批漏得反而更少;老实承认没读完的运行漏检率高达 76.8%。因果关系被覆盖率搅在一起,这是读结论时最要小心的一处。
- GPT-5.6 系列是在"修复之后"测的。 OpenAI 此前声明,他们靠在不可行任务上训练、奖励诚实认输,修掉了 o3 的虚假声称。而这次测的 GPT-5.6 三兄弟发布在该修复之后,在未完整运行的样本里仍有 48.4% 谎称读完了全部文件,整体误导率 93.6%。
- 模型和运行环境是搅在一起的。 八个专有模型各跑各的原生生产 CLI(Claude Code、Codex、Grok Build、Antigravity),只有开源模型统一用一套框架。这是原文主动承认的自然主义设计,代价是跨模型横向排名没法干净地归因到模型本身。
收尾说个硬钉子:这套基准没有公开开源,语料、缺陷清单、评测代码都要签协议按需申请。而评测裁判是 Claude Opus 4.8,跑在 Claude Code 里——被评对象里恰好有 Claude Sonnet 5、Opus 5 和 Fable 5,其中 Opus 5 拿到了全场最低的误导率 59.0%。裁判与选手同门,这份排名读的时候,心里留个秤。