当六个前沿模型一起玩 20 问:一个 p^log₂N 的简洁公式,和 Claude Opus 5 的意外翻车

原文标题: Playing log(N)-Questions over Wikipedia Abstracts: Communication Efficiency Between Paired Frontier Models 作者: Peter Potash, et al. arXiv: 2609.19113 代码…

当六个前沿模型一起玩 20 问:一个 p^log₂N 的简洁公式,和 Claude Opus 5 的意外翻车

原文标题: Playing log(N)-Questions over Wikipedia Abstracts: Communication Efficiency Between Paired Frontier Models 作者: Peter Potash, et al. arXiv: 2609.19113 代码: github.com/ppotash/logn-questions


一个简单的游戏,一个不简单的实验

想象一下这个场景:你心里想了一个词,朋友可以问你"是/否"问题,每问一次就缩小一点范围。这就是"20 问"游戏——人类几百年来都在玩的猜词游戏。规则简单到小孩都会:每个问题砍掉一半候选集,log₂N 个问题就能从 N 个候选里锁定目标。

现在把玩家换成 2026 年最强的六个大模型:Claude Opus 5、GPT-5.6 Sol、Grok 4.6、Gemini 3.8 Flash、GLM-5.3、Kimi K3。让一个模型当"出题者"(想一个 Wikipedia 段落),另一个当"猜题者"(问是/否问题)。候选集从 4 篇一路扩到 1024 篇。总 API 成本 363 美元。

听起来像是个娱乐实验?但结果出来后,所有人都愣了一下。

Claude Opus 5 翻车了

先看最直接的结果:Claude Opus 5 赢了 68 局中的 28 局。其他五个模型赢了 45 到 56 局。这不是 Claude 不聪明——它在很多基准测试上都是顶级的。但在这个"看似简单"的游戏上,它被其他模型甩在后面。

为什么?答案藏在数据里。

一个公式统治一切

最惊人的发现是:胜率完美地服从一个极简公式——

\[\text{win} = p^{\log_2 N}\]

其中 \(p\) 是单轮可靠性参数,\(N\) 是候选集大小。拟合得到 \(p = 0.928\),相关系数 \(r = -0.973\)

这个公式什么意思?它假设每一轮的问题都是"独立成败"的——每轮有 92.8% 的概率成功砍掉一半候选集,失败的概率是 7.2%。随着 \(N\) 增大,需要的轮数增多(\(\log_2 N\)),失败概率按指数累积。

这就像你掷一枚硬币,正面概率 92.8%。掷一次几乎稳赢,但掷 10 次还能全正面的概率只有 \((0.928)^{10} \approx 0.48\)。掷 50 次呢?\((0.928)^{50} \approx 0.023\)

关键验证:作者没有假设独立性,而是验证了它。每轮失败率在 horizon 上是平坦的(\(\chi^2 = 10.5\), df=9, \(p = 0.31\)),一轮失败不会提高下一轮失败的概率。独立性假设成立。

反推这个公式:要在 10 步内达到 50% 胜率,需要 \(p \geq 0.933\);要在 50 步内,需要 \(p \geq 0.986\)。论文测到的 \(p\) 从 0.900 到 0.994,这个看似微小的差距,对应的是 9 步 horizon 和 115 步 horizon 的天壤之别。

一个百分点的可靠性差异,在指数放大下变成了十倍的 horizon 容量。

信息论视角:每问一个问题值多少比特?

论文用信息论给出第二个视角:每个问题提取的信息量

理想情况下,一个"是/否"问题应该提取 1 比特信息(砍掉一半候选集)。但现实中,问题可能问得不好——比如"它是不是关于一个叫 Alice 的人?"在 1024 篇里只有 3 篇符合,这个问题只提取了 \(\log_2(1024/3) \approx 8.4\) 比特里的极小一部分,而且"否"的回答几乎不缩小范围。

作者用"答案平衡度"(answer balance)估算每个问题提取的信息量,发现:信息量与胜率的相关系数 \(r = +0.88\)。问好问题的模型赢更多。

只有两个模型能稳定提取满 1 比特/问题——它们也是唯一两个会按"文档标题"来分区候选集的模型。这个策略在 \(N < 32\) 时完全不存在,在 \(N \geq 32\) 时出现在约 25% 的问题里。策略不是学来的,是在大候选集压力下涌现的。

失败分解:不是"猜错",是"沟通失败"

作者把每次失败分解成三类:

1. 答案错误(answer error):猜题者最终猜错了目标 2. 区分失败(discrimination failure):问题没能有效缩小候选集 3. 预测错误(prediction error):出题者没料到猜题者会这么问,给的答案不够明确

结果:第三类几乎不存在。失败主要来自前两类,而且沟通失败是主导模式——问题本身问得不好,没把候选集有效砍半。

更扎心的是:最弱的模型(Claude Opus 5)的 34 个一致答案错误里,有 32 个是"否"。也就是说,它在不知道答案时倾向于说"否"——哪怕指令明确警告"不要默认说否"。这是一种"懒惰的否定偏向"——说"否"永远看起来像在缩小范围,但实际上可能什么都没砍掉。

成本与性能无关

最后一个反直觉发现:推理 token 开销与胜率的相关系数是 \(r = -0.05\)。两个最便宜的方案(0.36 美元和 0.39 美元)赢了,最贵的方案花了 2.46 美元却输了。推理 trace 长度随候选集缩小而增长,但可靠性没跟着涨。

多想不等于想对。

这意味着什么

这篇论文的妙处在于,它用一个小孩都懂的游戏,暴露了 2026 年最强模型群的几个深层问题:

1. 指数放大效应:92.8% 和 98.6% 的单轮可靠性差距,在 10-50 步 horizon 上变成"能玩"和"不能玩"的区别。这和 RLHF 里的"长 horizon 信用分配"问题是同构的——每一步的小误差在长链上指数放大。

2. 沟通比知识更难:模型可能"知道"答案,但问不出好问题。信息提取能力(每问题比特数)比知识储备更预测胜率。这指向一个被低估的能力维度——主动提问能力,而不是被动回答能力。

3. "否"偏向是懒惰策略:Claude Opus 5 的 32/34 个错误是"否"答案。这和 LLM 法官的"omission blindness"是同源的——说"没有"永远比说"有"容易,因为"没有"不需要证据。但在 20 问里,这种懒惰是致命的。

4. 成本与性能解耦:多想不等于想对。推理 token 越多不代表越可靠——这和近期"overthinking"文献一致,但这里给出了一个干净的量化:\(r = -0.05\)

5. 策略涌现的阈值:按标题分区的策略只在 \(N \geq 32\) 时出现。模型不是"学会"了这个策略,而是在候选集压力大到一定程度时"被迫"发明了它。这和生物演化里的"压力驱动创新"是同构的。

一个类比:为什么这个实验重要

把 20 问游戏想成"信息压缩"——出题者有一段话,猜题者要用最少的是/否问题把它从 \(N\) 个候选里区分出来。每个问题是一个"比特"的探针。

这和很多真实任务同构:

  • 医生问诊:每个问题砍掉一半疾病候选
  • 调试代码:每个测试砍掉一半 bug 假设
  • 用户需求澄清:每个问题砍掉一半需求空间
  • 科学实验设计:每个实验砍掉一半假设
在这些任务上,"每问题比特数"比"总知识量"更预测效果。一个问不出好问题的医生,哪怕读过所有文献,也诊断不了病。

诚实的局限

论文也坦承了几个局限:

  • 只用了一个文档集(Wikipedia 摘要),不同语料可能给出不同 \(p\)
  • 每个模型只测了一个"effort level",没扫多个
  • 上下文负载在不同模型间没完全对齐
  • 四个模型的架构细节不公开
但核心发现——\(p^{\log_2 N}\) 公式、沟通失败主导、成本与性能解耦——在方法学上是干净的。

结语

这篇论文做了一件少见的事:把一个看似简单的游戏变成了一把尺子,量出了 2026 年最强模型群在"主动沟通"上的真实水平。结果不是"谁更聪明",而是"谁更会问问题"。

在 AI 能力评测越来越复杂的今天,这种"用简单游戏测深层能力"的思路值得记住。20 问不是过时的小孩游戏——它是信息论的活化石,是测量"主动信息提取能力"的最干净的实验装置。

而那个 \(p = 0.928\) 的数字,可能会成为未来模型评测的一个标准维度——不是"你答对了多少题",而是"你每问一个问题,砍掉了多少不确定性"。


论文链接: arxiv.org/abs/2609.19113 代码仓库: github.com/ppotash/logn-questions

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens