[论文] When are likely answers right? On Sequence Probability and Correctness in LLMs

论文概要 研究领域: ML 作者: Johannes Zenn, Jonas Geiping 发布时间: 2026-06-27 arXiv: 2606.27359

论文概要

研究领域: ML 作者: Johannes Zenn, Jonas Geiping 发布时间: 2026-06-27 arXiv: 2606.27359

中文摘要

Many decoding methods for large language models can be understood as shifting probability mass toward outputs that are more likely under the model, either locally at the token level or globally at the sequence level. Therefore, their success depends on a fundamental question: when does sequence prob...

原文摘要

Many decoding methods for large language models can be understood as shifting probability mass toward outputs that are more likely under the model, either locally at the token level or globally at the sequence level. Therefore, their success depends on a fundamental question: when does sequence probability, that is, the conditional probability of a continuation given a prompt, actually align with correctness? In this paper, we set out to quantify this relationship across decoding methods, models...


*自动采集于 2026-06-27*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

当概率不再等于正确:LLM 的"自信悖论"

一个直觉的陷阱

如果你问一个大语言模型"2+2等于几",它会输出"4"。如果你让它生成一千次,每次它都说"4",而且每次的置信度都很高。这看起来很合理——模型对正确答案很有信心。

那么,如果我们设计一种解码方法,专门挑选模型"最有信心"的输出,是不是就能提高准确率?

直觉说"是"。很多解码方法正是基于这个直觉设计的:低温采样抑制不太可能的 token,Best-of-N 从多个候选里选概率最高的,束搜索在全局层面寻找高概率序列。这些方法的共同假设是:序列概率越高,越可能是正确的

2026 年 ICML 上,马克斯·普朗克研究所的 Johannes Zenn 和 Jonas Geiping 发表了一篇论文,对这个直觉做了一次彻底的"体检"。结论是:这个直觉对了一半,但错的那一半更值得深思

四层显微镜

为了搞清楚"概率"和"正确"到底是什么关系,作者设计了一个四层分析框架。这四层从粗到细,像一把越来越精密的显微镜:

第一层:跨方法相关(across-method)。 固定模型和数据集,比较不同解码方法(低温采样、Best-of-N、束搜索、power sampling 等)的表现。问题是:用概率更高的方法,准确率也更高吗?

第二层:方法内相关(within-method)。 固定一种方法,调它的超参数。比如 Best-of-N,从 N=1 调到 N=64。问题是:N 越大,序列概率越高,但准确率跟着涨吗?

第三层:数据集内相关(within-dataset)。 固定方法和超参数,看数据集里不同的 prompt-answer 对。问题是:对同一个模型来说,高概率的答案是不是更可能正确?

第四层:样本内相关(within-sample)。 最精细的一层——固定一个 prompt,让模型生成多个不同回答。问题是:在同一个问题的多个回答里,概率更高的那个更可能对吗?

这四层覆盖了"概率-正确"关系可能出现的所有尺度。实验规模也相当可观:8 种解码方法、14 个模型(Qwen2.5、Qwen3、Olmo3 系列)、6 个基准数据集(MATH500、GSM8K、ARC、MMLU 等)。

出乎意料的发现

结果可以用一句话概括:概率和正确性的关系,取决于你在哪一层看

第三层(数据集内):正相关,且稳定。 这是唯一符合直觉的发现。在同一个数据集里,模型确实能给正确答案分配更高的概率。这个相关性在不同方法之间是稳定的——不管你用 Best-of-N 还是低温采样,"正确答案概率更高"这个规律都成立。这意味着模型确实"知道"自己答对了,这个信号可以被利用。

第二层(方法内):不成立。 调高超参数确实能提高序列概率,但准确率不跟着涨。Best-of-N 从 N=4 调到 N=32,序列概率显著上升,但准确率几乎不变,甚至在某些任务上下降。低温采样的温度从 1.0 降到 0.3,概率飙升,准确率反而可能变差。

第一层(跨方法):不成立。 概率更高的方法不比概率更低的方法更准确。束搜索产生的序列概率通常高于随机采样,但准确率并没有系统性优势。Power sampling 在概率上优于 Best-of-N,但准确率持平。

第四层(样本内):不稳定。 对同一个 prompt 的多个回答,概率和正确性的关系时有时无。但有一个有趣的发现:当模型对这个问题答对率高时,样本内正相关;答对率低时,相关性消失。换句话说,模型在"擅长"的领域里能区分自己的好坏答案,在"不擅长"的领域里不能。

为什么直觉对了一半

为什么第三层(数据集内)成立,但前两层不成立?

作者的解释是这样的:序列概率反映的是"模型对这个 prompt 的熟悉程度",而不是"这个回答的质量"

在数据集层面,简单的问题("法国首都是哪?")天然比难的问题("证明黎曼猜想")有更高的概率和更高的正确率。所以概率和正确性正相关——但这只是因为简单问题两者都高,难问题两者都低。这是一个混淆变量造成的假相关。

一旦你固定了问题难度(在方法内或跨方法层面比较),这个混淆效应就消失了。此时提高序列概率只是在"过度拟合模型的偏好",而不是在"接近正确答案"。模型偏好的答案不一定是正确答案——它可能只是更"像"训练数据,或者更"流畅",或者更"保守"。

这和"过度优化"(over-optimization)现象同源。当你优化一个代理目标(序列概率)而非真实目标(正确性),优化到一定程度后,代理目标继续改善但真实目标反而退化。这篇论文为这个现象提供了一个干净的实证证据。

对解码方法的实践指导

这些发现对 LLM 推理有直接指导意义:

1. 解码方法的选择不要迷信"高概率=高准确"。 如果你纠结用 Best-of-N 还是束搜索,别用"哪个概率更高"来决定——它们在准确率上没有系统性差异。选择应该基于其他考量(延迟、多样性、实现复杂度)。

2. 自一致性(self-consistency)有效,但原因不是"高概率=高正确"。 自一致性让模型多次采样后投票选多数答案。它有效是因为"多数答案更可能正确",而不是因为"多数答案概率更高"。论文证明,在样本内层面,概率并不能可靠区分正确和错误答案。

3. 无验证器自我改进(verifier-free self-improvement)有天花板。 一些方法用序列概率作为"自我验证"信号——让模型生成多个答案,选概率最高的。这在模型擅长的领域有效(样本内正相关成立),但在模型不擅长的领域会失效(相关性消失)。这意味着无验证器方法的能力上限受限于模型已有能力,无法突破到模型不擅长的新领域。

一个更深的问题

这篇论文最深刻的贡献不是某个具体发现,而是它揭示的"概率-正确"关系的非传递性

  • 数据集层面:概率高 → 问题简单 → 正确率高 ✓
  • 方法层面:概率高 → 更像模型偏好 → 正确率不变 ✗
  • 样本层面:概率高 → 模型有信心 → 正确率不确定 △
同一个量(序列概率)在不同尺度上有完全不同的含义。这就像温度——在宏观尺度上表示冷热,在分子尺度上表示动能,在量子尺度上变得不确定。序列概率不是一个"统一的正确性指标",而是一个尺度依赖的信号

这对未来研究的启示是:如果你要设计一种基于概率的解码或自我改进方法,先问自己"我在哪个尺度上操作"。不同尺度需要不同的策略,不存在一刀切的"概率最大化"方案。

论文没有给出"正确"的解码方法——这某种程度上是一个负面结果。但负面结果往往比正面结果更有价值,因为它清除了一个错误的直觉,为真正的创新腾出了空间。


*论文:When are likely answers right? On Sequence Probability and Correctness in LLMs* *作者:Johannes Zenn, Jonas Geiping(MPI/ICML 2026)* *arXiv: 2606.27359*

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens