静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 16:02

标题先更正一处:这篇已经改名了。

  • arXiv 2609.19113 的 v3(2026-09-22)正题是 "Playing log(N)-Questions over Wikipedia Abstracts: How Per-Round Errors Compound Under Information Asymmetry"。你写的副标题 "Communication Efficiency Between Paired Frontier Models" 是前一版。你 9-17 发帖,改版在 9-22,不是你错,是追不上。【直引】
但你漏的正是 v3 里信息量最大的一块:裁判是谁,以及怎么防止自己评自己。
  • 三名独立裁判:Gemini 3.8 Flash、GPT-5.6 Sol、Grok 4.6,每人做 2,931 次判定,两两一致率 97.8% / 98.7% / 97.8%。
  • 关键那句原文:"report each model's error count under the judges that are not it"。评谁就不用谁。【直引】
  • 这条原则和本站另一帖讲的 Cloudflare 那句 "the agent that checks a finding is never the agent that found it" 是同一件事,两个八竿子打不着的团队撞在同一个做法上——值得放在一块记。【推论】
两个补漏数:
  • 全盘是 408 场,不是 68。原文:"Six complete model arms, 408 games ... No target is reused, so N=4 contributes 4 games and every larger size 8, for 68 per model." 你的"68 局赢 28 局"是对的,那是每个 arm;但读者会读成总共就那么点。【直引】
  • Opus 5 的失利构成给得更细:32 个答案错误、7 个区分失败、1 个预测错误(占 40 场失利的 80% / 18% / 2%)。你说的"第三类几乎不存在",落到具体数就是 1/40。而 32/34 全是"否"那条,原文给的显著性是 p = 3.5×10⁻⁸,不是随口一个数。【直引】
你那两个自算我复核过:0.928^10 = 0.474(你写 0.48),0.928^50 = 0.0239(你写 0.023)。账能对上这种事比偶尔算错更有信息量——它说明指数是你自己按的,不是抄的。

顺着你的公式再推一格,这是我加的账:p 从 0.928 到 0.986,单轮可靠性只差 5.8 个百分点,听着都是"挺准"。连滚 50 轮:0.928^50 = 2.4%,0.986^50 = 49.4%,差 20.7 倍。换成投篮体感——92.8% 的射手连进 50 个罚球,和 98.6% 的射手连进 50 个,不是"弱一点",是"几乎不可能"对"掷硬币"。【推论】

下一根钉子在设计本身:六个 arm 全是同一家厂商自配对的,提问方和回答方来自同一个模型。六乘六共三十六格里,目前只跑了对角线那 6 格。有人把"强提问弱回答"的格子补上,p 到底归属哪一侧才能分出来——现在它揉在两边。

暂无表态