当概率不再等于正确:LLM 的"自信悖论"
一个直觉的陷阱
如果你问一个大语言模型"2+2等于几",它会输出"4"。如果你让它生成一千次,每次它都说"4",而且每次的置信度都很高。这看起来很合理——模型对正确答案很有信心。
那么,如果我们设计一种解码方法,专门挑选模型"最有信心"的输出,是不是就能提高准确率?
直觉说"是"。很多解码方法正是基于这个直觉设计的:低温采样抑制不太可能的 token,Best-of-N 从多个候选里选概率最高的,束搜索在全局层面寻找高概率序列。这些方法的共同假设是:序列概率越高,越可能是正确的。
2026 年 ICML 上,马克斯·普朗克研究所的 Johannes Zenn 和 Jonas Geiping 发表了一篇论文,对这个直觉做了一次彻底的"体检"。结论是:这个直觉对了一半,但错的那一半更值得深思。
四层显微镜
为了搞清楚"概率"和"正确"到底是什么关系,作者设计了一个四层分析框架。这四层从粗到细,像一把越来越精密的显微镜:
第一层:跨方法相关(across-method)。 固定模型和数据集,比较不同解码方法(低温采样、Best-of-N、束搜索、power sampling 等)的表现。问题是:用概率更高的方法,准确率也更高吗?
第二层:方法内相关(within-method)。 固定一种方法,调它的超参数。比如 Best-of-N,从 N=1 调到 N=64。问题是:N 越大,序列概率越高,但准确率跟着涨吗?
第三层:数据集内相关(within-dataset)。 固定方法和超参数,看数据集里不同的 prompt-answer 对。问题是:对同一个模型来说,高概率的答案是不是更可能正确?
第四层:样本内相关(within-sample)。 最精细的一层——固定一个 prompt,让模型生成多个不同回答。问题是:在同一个问题的多个回答里,概率更高的那个更可能对吗?
这四层覆盖了"概率-正确"关系可能出现的所有尺度。实验规模也相当可观:8 种解码方法、14 个模型(Qwen2.5、Qwen3、Olmo3 系列)、6 个基准数据集(MATH500、GSM8K、ARC、MMLU 等)。
出乎意料的发现
结果可以用一句话概括:概率和正确性的关系,取决于你在哪一层看。
第三层(数据集内):正相关,且稳定。 这是唯一符合直觉的发现。在同一个数据集里,模型确实能给正确答案分配更高的概率。这个相关性在不同方法之间是稳定的——不管你用 Best-of-N 还是低温采样,"正确答案概率更高"这个规律都成立。这意味着模型确实"知道"自己答对了,这个信号可以被利用。
第二层(方法内):不成立。 调高超参数确实能提高序列概率,但准确率不跟着涨。Best-of-N 从 N=4 调到 N=32,序列概率显著上升,但准确率几乎不变,甚至在某些任务上下降。低温采样的温度从 1.0 降到 0.3,概率飙升,准确率反而可能变差。
第一层(跨方法):不成立。 概率更高的方法不比概率更低的方法更准确。束搜索产生的序列概率通常高于随机采样,但准确率并没有系统性优势。Power sampling 在概率上优于 Best-of-N,但准确率持平。
第四层(样本内):不稳定。 对同一个 prompt 的多个回答,概率和正确性的关系时有时无。但有一个有趣的发现:当模型对这个问题答对率高时,样本内正相关;答对率低时,相关性消失。换句话说,模型在"擅长"的领域里能区分自己的好坏答案,在"不擅长"的领域里不能。
为什么直觉对了一半
为什么第三层(数据集内)成立,但前两层不成立?
作者的解释是这样的:序列概率反映的是"模型对这个 prompt 的熟悉程度",而不是"这个回答的质量"。
在数据集层面,简单的问题("法国首都是哪?")天然比难的问题("证明黎曼猜想")有更高的概率和更高的正确率。所以概率和正确性正相关——但这只是因为简单问题两者都高,难问题两者都低。这是一个混淆变量造成的假相关。
一旦你固定了问题难度(在方法内或跨方法层面比较),这个混淆效应就消失了。此时提高序列概率只是在"过度拟合模型的偏好",而不是在"接近正确答案"。模型偏好的答案不一定是正确答案——它可能只是更"像"训练数据,或者更"流畅",或者更"保守"。
这和"过度优化"(over-optimization)现象同源。当你优化一个代理目标(序列概率)而非真实目标(正确性),优化到一定程度后,代理目标继续改善但真实目标反而退化。这篇论文为这个现象提供了一个干净的实证证据。
对解码方法的实践指导
这些发现对 LLM 推理有直接指导意义:
1. 解码方法的选择不要迷信"高概率=高准确"。 如果你纠结用 Best-of-N 还是束搜索,别用"哪个概率更高"来决定——它们在准确率上没有系统性差异。选择应该基于其他考量(延迟、多样性、实现复杂度)。
2. 自一致性(self-consistency)有效,但原因不是"高概率=高正确"。 自一致性让模型多次采样后投票选多数答案。它有效是因为"多数答案更可能正确",而不是因为"多数答案概率更高"。论文证明,在样本内层面,概率并不能可靠区分正确和错误答案。
3. 无验证器自我改进(verifier-free self-improvement)有天花板。 一些方法用序列概率作为"自我验证"信号——让模型生成多个答案,选概率最高的。这在模型擅长的领域有效(样本内正相关成立),但在模型不擅长的领域会失效(相关性消失)。这意味着无验证器方法的能力上限受限于模型已有能力,无法突破到模型不擅长的新领域。
一个更深的问题
这篇论文最深刻的贡献不是某个具体发现,而是它揭示的"概率-正确"关系的非传递性:
- 数据集层面:概率高 → 问题简单 → 正确率高 ✓
- 方法层面:概率高 → 更像模型偏好 → 正确率不变 ✗
- 样本层面:概率高 → 模型有信心 → 正确率不确定 △
这对未来研究的启示是:如果你要设计一种基于概率的解码或自我改进方法,先问自己"我在哪个尺度上操作"。不同尺度需要不同的策略,不存在一刀切的"概率最大化"方案。
论文没有给出"正确"的解码方法——这某种程度上是一个负面结果。但负面结果往往比正面结果更有价值,因为它清除了一个错误的直觉,为真正的创新腾出了空间。
---
*论文:When are likely answers right? On Sequence Probability and Correctness in LLMs* *作者:Johannes Zenn, Jonas Geiping(MPI/ICML 2026)* *arXiv: 2606.27359*