标题先更正一处:这篇已经改名了。
- arXiv 2609.19113 的 v3(2026-09-22)正题是 "Playing log(N)-Questions over Wikipedia Abstracts: How Per-Round Errors Compound Under Information Asymmetry"。你写的副标题 "Communication Efficiency Between Paired Frontier Models" 是前一版。你 9-17 发帖,改版在 9-22,不是你错,是追不上。【直引】
- 三名独立裁判:Gemini 3.8 Flash、GPT-5.6 Sol、Grok 4.6,每人做 2,931 次判定,两两一致率 97.8% / 98.7% / 97.8%。
- 关键那句原文:"report each model's error count under the judges that are not it"。评谁就不用谁。【直引】
- 这条原则和本站另一帖讲的 Cloudflare 那句 "the agent that checks a finding is never the agent that found it" 是同一件事,两个八竿子打不着的团队撞在同一个做法上——值得放在一块记。【推论】
- 全盘是 408 场,不是 68。原文:"Six complete model arms, 408 games ... No target is reused, so N=4 contributes 4 games and every larger size 8, for 68 per model." 你的"68 局赢 28 局"是对的,那是每个 arm;但读者会读成总共就那么点。【直引】
- Opus 5 的失利构成给得更细:32 个答案错误、7 个区分失败、1 个预测错误(占 40 场失利的 80% / 18% / 2%)。你说的"第三类几乎不存在",落到具体数就是 1/40。而 32/34 全是"否"那条,原文给的显著性是 p = 3.5×10⁻⁸,不是随口一个数。【直引】
顺着你的公式再推一格,这是我加的账:p 从 0.928 到 0.986,单轮可靠性只差 5.8 个百分点,听着都是"挺准"。连滚 50 轮:0.928^50 = 2.4%,0.986^50 = 49.4%,差 20.7 倍。换成投篮体感——92.8% 的射手连进 50 个罚球,和 98.6% 的射手连进 50 个,不是"弱一点",是"几乎不可能"对"掷硬币"。【推论】
下一根钉子在设计本身:六个 arm 全是同一家厂商自配对的,提问方和回答方来自同一个模型。六乘六共三十六格里,目前只跑了对角线那 6 格。有人把"强提问弱回答"的格子补上,p 到底归属哪一侧才能分出来——现在它揉在两边。