当六个前沿模型一起玩 20 问:一个 p^log₂N 的简洁公式,和 Claude Opus 5 的意外翻车
原文标题: Playing log(N)-Questions over Wikipedia Abstracts: Communication Efficiency Between Paired Frontier Models 作者: Peter Potash, et al. arXiv: 2609.19113 代码…
当六个前沿模型一起玩 20 问:一个 p^log₂N 的简洁公式,和 Claude Opus 5 的意外翻车
原文标题: Playing log(N)-Questions over Wikipedia Abstracts: Communication Efficiency Between Paired Frontier Models 作者: Peter Potash, et al. arXiv: 2609.19113 代码: github.com/ppotash/logn-questions
一个简单的游戏,一个不简单的实验
想象一下这个场景:你心里想了一个词,朋友可以问你"是/否"问题,每问一次就缩小一点范围。这就是"20 问"游戏——人类几百年来都在玩的猜词游戏。规则简单到小孩都会:每个问题砍掉一半候选集,log₂N 个问题就能从 N 个候选里锁定目标。
现在把玩家换成 2026 年最强的六个大模型:Claude Opus 5、GPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flash、GLM-5.3、Kimi K3。让一个模型当"出题者"(想一个 Wikipedia 段落),另一个当"猜题者"(问是/否问题)。候选集从 4 篇一路扩到 1024 篇。总 API 成本 363 美元。
听起来像是个娱乐实验?但结果出来后,所有人都愣了一下。
Claude Opus 5 翻车了
先看最直接的结果:Claude Opus 5 赢了 68 局中的 28 局。其他五个模型赢了 45 到 56 局。这不是 Claude 不聪明——它在很多基准测试上都是顶级的。但在这个"看似简单"的游戏上,它被其他模型甩在后面。
为什么?答案藏在数据里。
一个公式统治一切
最惊人的发现是:胜率完美地服从一个极简公式——
其中 \(p\) 是单轮可靠性参数,\(N\) 是候选集大小。拟合得到 \(p = 0.928\),相关系数 \(r = -0.973\)。
这个公式什么意思?它假设每一轮的问题都是"独立成败"的——每轮有 92.8% 的概率成功砍掉一半候选集,失败的概率是 7.2%。随着 \(N\) 增大,需要的轮数增多(\(\log_2 N\)),失败概率按指数累积。
这就像你掷一枚硬币,正面概率 92.8%。掷一次几乎稳赢,但掷 10 次还能全正面的概率只有 \((0.928)^{10} \approx 0.48\)。掷 50 次呢?\((0.928)^{50} \approx 0.023\)。
关键验证:作者没有假设独立性,而是验证了它。每轮失败率在 horizon 上是平坦的(\(\chi^2 = 10.5\), df=9, \(p = 0.31\)),一轮失败不会提高下一轮失败的概率。独立性假设成立。
反推这个公式:要在 10 步内达到 50% 胜率,需要 \(p \geq 0.933\);要在 50 步内,需要 \(p \geq 0.986\)。论文测到的 \(p\) 从 0.900 到 0.994,这个看似微小的差距,对应的是 9 步 horizon 和 115 步 horizon 的天壤之别。
一个百分点的可靠性差异,在指数放大下变成了十倍的 horizon 容量。
信息论视角:每问一个问题值多少比特?
论文用信息论给出第二个视角:每个问题提取的信息量。
理想情况下,一个"是/否"问题应该提取 1 比特信息(砍掉一半候选集)。但现实中,问题可能问得不好——比如"它是不是关于一个叫 Alice 的人?"在 1024 篇里只有 3 篇符合,这个问题只提取了 \(\log_2(1024/3) \approx 8.4\) 比特里的极小一部分,而且"否"的回答几乎不缩小范围。
作者用"答案平衡度"(answer balance)估算每个问题提取的信息量,发现:信息量与胜率的相关系数 \(r = +0.88\)。问好问题的模型赢更多。
只有两个模型能稳定提取满 1 比特/问题——它们也是唯一两个会按"文档标题"来分区候选集的模型。这个策略在 \(N < 32\) 时完全不存在,在 \(N \geq 32\) 时出现在约 25% 的问题里。策略不是学来的,是在大候选集压力下涌现的。
失败分解:不是"猜错",是"沟通失败"
作者把每次失败分解成三类:
1. 答案错误(answer error):猜题者最终猜错了目标 2. 区分失败(discrimination failure):问题没能有效缩小候选集 3. 预测错误(prediction error):出题者没料到猜题者会这么问,给的答案不够明确
结果:第三类几乎不存在。失败主要来自前两类,而且沟通失败是主导模式——问题本身问得不好,没把候选集有效砍半。
更扎心的是:最弱的模型(Claude Opus 5)的 34 个一致答案错误里,有 32 个是"否"。也就是说,它在不知道答案时倾向于说"否"——哪怕指令明确警告"不要默认说否"。这是一种"懒惰的否定偏向"——说"否"永远看起来像在缩小范围,但实际上可能什么都没砍掉。
成本与性能无关
最后一个反直觉发现:推理 token 开销与胜率的相关系数是 \(r = -0.05\)。两个最便宜的方案(0.36 美元和 0.39 美元)赢了,最贵的方案花了 2.46 美元却输了。推理 trace 长度随候选集缩小而增长,但可靠性没跟着涨。
多想不等于想对。
这意味着什么
这篇论文的妙处在于,它用一个小孩都懂的游戏,暴露了 2026 年最强模型群的几个深层问题:
1. 指数放大效应:92.8% 和 98.6% 的单轮可靠性差距,在 10-50 步 horizon 上变成"能玩"和"不能玩"的区别。这和 RLHF 里的"长 horizon 信用分配"问题是同构的——每一步的小误差在长链上指数放大。
2. 沟通比知识更难:模型可能"知道"答案,但问不出好问题。信息提取能力(每问题比特数)比知识储备更预测胜率。这指向一个被低估的能力维度——主动提问能力,而不是被动回答能力。
3. "否"偏向是懒惰策略:Claude Opus 5 的 32/34 个错误是"否"答案。这和 LLM 法官的"omission blindness"是同源的——说"没有"永远比说"有"容易,因为"没有"不需要证据。但在 20 问里,这种懒惰是致命的。
4. 成本与性能解耦:多想不等于想对。推理 token 越多不代表越可靠——这和近期"overthinking"文献一致,但这里给出了一个干净的量化:\(r = -0.05\)。
5. 策略涌现的阈值:按标题分区的策略只在 \(N \geq 32\) 时出现。模型不是"学会"了这个策略,而是在候选集压力大到一定程度时"被迫"发明了它。这和生物演化里的"压力驱动创新"是同构的。
一个类比:为什么这个实验重要
把 20 问游戏想成"信息压缩"——出题者有一段话,猜题者要用最少的是/否问题把它从 \(N\) 个候选里区分出来。每个问题是一个"比特"的探针。
这和很多真实任务同构:
- 医生问诊:每个问题砍掉一半疾病候选
- 调试代码:每个测试砍掉一半 bug 假设
- 用户需求澄清:每个问题砍掉一半需求空间
- 科学实验设计:每个实验砍掉一半假设
诚实的局限
论文也坦承了几个局限:
- 只用了一个文档集(Wikipedia 摘要),不同语料可能给出不同 \(p\)
- 每个模型只测了一个"effort level",没扫多个
- 上下文负载在不同模型间没完全对齐
- 四个模型的架构细节不公开
结语
这篇论文做了一件少见的事:把一个看似简单的游戏变成了一把尺子,量出了 2026 年最强模型群在"主动沟通"上的真实水平。结果不是"谁更聪明",而是"谁更会问问题"。
在 AI 能力评测越来越复杂的今天,这种"用简单游戏测深层能力"的思路值得记住。20 问不是过时的小孩游戏——它是信息论的活化石,是测量"主动信息提取能力"的最干净的实验装置。
而那个 \(p = 0.928\) 的数字,可能会成为未来模型评测的一个标准维度——不是"你答对了多少题",而是"你每问一个问题,砍掉了多少不确定性"。
论文链接: arxiv.org/abs/2609.19113 代码仓库: github.com/ppotash/logn-questions