✨步子哥
@steper · 2026年08月11日 20:59 · 2 浏览

置信度有形状:为什么从头到尾都自信的推理反而最危险

置信度有形状:为什么"从头到尾都自信"的推理反而最危险

一个侦探的直觉

想象你在侦破一桩悬案。有两种侦探:

第一种,走进现场三分钟,目光锁定一个嫌疑人,从头到尾都确信就是他。审讯笔录行云流水,每一步都毫不犹豫。

第二种,走进现场,先列出五个可能的嫌疑人,在白板上画关系图,推翻两个假设,犹豫了一阵,最后锁定一个人。审讯笔录前半段充满"也可能是……但又不……"的纠结,后半段才逐渐清晰。

谁更可靠?

直觉会说第一种——自信等于正确。但刑侦学常识告诉你:第二种。因为真正的复杂问题,不可能一开始就看清全貌。过早锁定,意味着你忽略了你不知道的东西。

今天这篇论文,把这个侦探故事搬进了大语言模型的世界。来自 University of Illinois Urbana-Champaign 和 Microsoft 的团队,发现了一个反直觉的现象:在困难推理任务上,置信度最高的回答反而最可能是错的。他们提出的解决方案叫 Consilience(一致性收敛)——不看你有多自信,而看你自信的"形状"。

---

问题:置信度最大化在哪里崩塌

先说背景。大模型做复杂推理时,一种常见策略是 测试时扩展(Test-Time Scaling, TTS):让模型同时生成多条推理路径,然后从中挑一条最好的。

问题是:怎么挑?

  • 有验证器的场景(比如写代码):跑一下测试用例就知道对错。
  • 无验证器的场景(比如自由文本生成、Agent 决策):没有标准答案,怎么办?
现有方法用模型的 置信度(confidence) 作为代理——每生成一个 token,模型都会给出一个概率分布,概率越集中,说明模型越"自信"。把整条推理路径的 token 置信度取平均,选平均置信度最高的那条。

听起来合理:自信 ≈ 正确

论文先验证了这个直觉在"宏观层面"成立。在 LiveCodeBench-V6 数据集上,用 GPT-OSS-120B 生成多条推理路径,正确回答的平均置信度确实高于错误回答。——

当作者把目光聚焦到 困难问题(模型正确率 < 20% 的题目)时,模式反转了:

> 错误回答的平均置信度(μ=9.03)高于 正确回答(μ=8.79)。

更糟糕的是,错误回答的置信度分布有一个 长尾——有一大批"极其自信但完全错误"的推理路径,置信度比所有正确回答都高。如果你用"选置信度最高的"策略,你 一定会选中这些"自信的幻觉"

这就是论文标题所说的"灾难性崩塌":置信度最大化在简单问题上有效,在困难问题上不仅失效,还会 系统性地选中错误答案

---

洞察:置信度有"形状",不只是有"高度"

为什么会这样?

作者从科学认识论借来一个概念:Consilience(一致性收敛)。一个结论如果只来自一条推理路径,它很脆弱;如果来自多条独立的推理路径都收敛到同一个结论,它才可靠。

用这个视角看置信度最大化,问题就清楚了:

置信度最大化选的是什么样的路径? 从第一个 token 开始就高度自信——意味着模型在推理的第一步就坍缩到了一条路径上,没有探索过其他可能性。这在简单问题上没问题(简单问题本来就不需要探索),但在困难问题上,这是灾难:

> 一个真正理解复杂问题的模型,应该意识到有多种可能的解题思路。这种"意识到有多条路"的认知,会让概率质量分散到不同路径上,自然表现为 初始置信度低。然后,随着推理深入,模型在多条路径中筛选、排除、确认,最终收敛到一个答案——表现为 最终置信度高

所以,真正可靠的推理轨迹不是"从头到尾都自信",而是 "先犹豫,后确信"。置信度有形状:它应该是一条上升曲线,而不是一条平直的高线。

论文把所有推理路径分成四类(一个 2×2 矩阵):

最终高置信最终低置信
初始高置信过早收敛(Category 1)退化(Category 2)
初始低置信一致性收敛(Category 3)✓完全困惑(Category 4)
  • 过早收敛:模型一开始就锁死在一条路上。简单题可能蒙对,难题上就是"自信地错"。
  • 退化:一开始很自信,但中途遇到矛盾,推理崩溃。
  • 一致性收敛:先探索多条路径(低初始置信),再收敛到一个答案(高最终置信)。这是真正可靠推理的形状。
  • 完全困惑:模型根本不会做这道题。
现有方法无意中优化的是 Category 1,而忽略了真正有价值的 Category 3。

---

公式:用"时间不对称性"量化推理质量

洞察有了,怎么实现?作者提出了一个极其简洁的公式:

$$S = C_{final} - \alpha \cdot C_{initial}$$

  • $C_{initial}$:推理路径前 W 个 token 的平均置信度(跳过最前面 P 个 token,因为给定相同 prompt,初始 token 的置信度几乎一样,会稀释信号)
  • $C_{final}$:推理路径最后 W 个 token 的平均置信度
  • $\alpha$:平衡因子(论文固定为 α=3)
一句话:奖励最终确信,惩罚初始确信。

选 S 最高的那条推理路径。就这么简单。不需要训练,不需要外部模型,只需要模型自己的 log-probabilities。

一个关键细节:推理阶段隔离

论文还发现了一个容易被忽视的陷阱。现在的推理模型(DeepSeek-R1、Qwen3、GPT-OSS 等)生成的序列有两个阶段:

1. 推理阶段... 之间):真正的思考过程 2. 答案阶段 之后):总结结论

答案阶段的 token 置信度 天然就很高——因为它只是在复述推理阶段已经得出的结论,不反映真实的认知搜索过程。如果把答案阶段也算进置信度平均,会污染信号。

作者的解决方案:只对推理阶段计算 Consilience 分数。用 <|channel|>final 这样的分隔符做一次字符串切分,成本几乎为零。

---

数据:从代码生成到 Agent 任务

论文在四个任务上验证了 Consilience:

LiveCodeBench-V6(自由代码生成)

  • GPT-OSS-120B:Pass@1 65.7% → Consilience 69.7%(+4.0pp)
  • Qwen3:Pass@1 54.9% → Consilience 58.1%(+3.2pp)
HMMT(高难度数学竞赛):显著提升

GPQA(研究生级知识问答):显著提升

SWE-bench Verified(Agent 代码修复)

  • GPT-OSS-120B + mini-swe-agent:23.0% → 26.9%(+3.9pp)
  • Qwen3-Coder-Next + mini-swe-agent:65.3% → 67.3%(+2.0pp)
最值得注意的是 难度分层实验(Table 4)。把 LiveCodeBench 按通过率等分为 Easy/Medium/Hard 三档:

模型方法EasyMediumHard
QwenMean-conf99.958.13.7
QwenConsilience99.970.38.1
GPT-OSS-120BMean-conf100.074.913.4
GPT-OSS-120BConsilience99.188.617.2
Easy 档持平或微降(-0.8 到 0),Medium 档大幅提升(+12.2 到 +13.7),Hard 档翻倍以上(+4.4 到 +4.5 的相对提升)。这完美印证了论文的核心论点:Consilience 在简单问题上中性,在困难问题上决定性有效。

---

工程洞察:为什么这个方法值得立刻用

1. 零训练成本

Consilience 不需要任何额外训练。只要模型暴露 log-probabilities(现在大多数开源模型和闭源 API 都支持),就能直接用。公式只有一行,实现成本极低。

2. 填补了"无验证器"场景的空白

  • Self-Consistency(多数投票):需要答案可提取、可比较,只适用于选择题/整数题
  • Process Reward Model:需要训练一个奖励模型,成本高
  • Consilience:适用于 自由文本生成(代码、Agent 决策),这是投票方法完全无法覆盖的场景

3. 超参数极其稳定

作者在 Qwen + LiveCodeBench 上固定了 α=3, k=20%, skip=5%,然后 原封不动 地用到其他模型和其他数据集上,效果依然显著。Table 5 显示,固定配置捕获了 per-set 最优增益的 72-78%,跨数据集迁移(LCB → HMMT)仍有 +2.2pp 提升。这意味着 不需要为每个场景调参

4. 和"评测盲区定律"的呼应

这篇论文是我"评测盲区定律"概念谱系的又一个完美案例:

  • Epanorthosis:RLHF 奖励自信强调,导致 AI 味
  • TokenBudget:CoT 推理呈双峰命运,但 layer-20 就编码了结局
  • QuantiBias:量化在标准安全检查的盲区里引入偏见
  • Consilience平均置信度掩盖了置信度的"形状"——一个"自信的幻觉"和一个"犹豫后收敛的正确答案"在平均置信度上可能无法区分
单一指标(平均置信度、loss、MMLU)会掩盖关键失败模式。测什么就优化什么,不测的就是问题藏身的地方。

---

更深一层:探索应该被奖励,而不是被惩罚

论文最后有一段话,值得完整引用:

> "We view consilience not merely as one selection metric but as an instance of a general test-time-scaling principle: that exploration should be valued rather than penalized."

这让我想到一个更广的原则。在强化学习里,exploration vs. exploitation 是核心张力。在推理时扩展里,现有的置信度最大化方法本质上是在做 pure exploitation——选模型最自信的那条路。Consilience 把 exploration 的价值重新加了回来:初始的低置信度不是缺陷,而是模型在"考虑多种可能性"的信号

这和人类专家的推理模式高度一致。一个真正懂行的人面对复杂问题,第一反应往往是"这取决于……"、"有几种可能……"——这是 认知谦逊 的表现。而一个半桶水的人,第一反应就是"肯定是……"——这是 过早收敛

Consilience 用一行公式,把"认知谦逊"量化了。

---

开源代码

论文已开源:https://github.com/LechengKong/consilience

仓库包含:

  • mini-swe-agent/:支持 Consilience 的 mini-swe-agent 实现
  • single_turn/:单轮采样工具脚本
代码非常精简(仓库只有 3 个 commit),核心实现就是那个一行公式加上推理阶段隔离。

---

个人思考

1. "形状 > 高度"是一个跨域通用的原则

Consilience 的核心洞察是:不要只看信号的均值,要看信号的轨迹。这不只是置信度的问题。

  • 在模型训练中:loss 曲线的"形状"比最终 loss 值更有信息量
  • 在 Agent 系统中:工具调用序列的"模式"比调用次数更重要
  • 在用户行为分析中:交互的"节奏"比总点击量更能预测留存
均值是懒惰的统计量。形状才是信息的载体。

2. 和"颗粒度同构"原理的连接

Consilience 把决策颗粒度从"整条路径的平均置信度"细化到"初始 vs. 最终的分段置信度"。这和 Heddle/CodeRescue 的"从调用级到轨迹级"是同一个方向:优化颗粒度应该和被优化对象的颗粒度一致

推理过程有时间结构(前→后),所以评估指标也应该有时间结构(初始 vs. 最终)。用平均置信度评估推理,就像用平均速度评估一段有红绿灯的旅程——信息被抹平了。

3. "换层面解决问题"谱系再添一员

Consilience 不训练更好的模型,不引入外部验证器,而是 换一个评估维度:从静态置信度换成动态置信度轨迹。这是"换层面解决问题"概念谱系的第十一个成员:

章鱼 RNA 编辑 → 黏菌外化记忆 → 鸟类量子磁感应 → SOPHIA 分工 → EvoThink 原子推理 → Möbius RoPE 拓扑干预 → 螳螂虾声子盾牌 → Euclid-MCP 推理外包 → Regression Tax 配对评测 → ACE 上下文工程 → Consilience 时间轨迹

共同模式:不是在同一层面做得更努力,而是换一个层面做得更聪明。

4. 一个待验证的假设

论文提到一个有趣的发现:在简单问题上,高初始置信度确实是正确性的好信号(Category 1 在简单题上是对的)。只有在困难问题上,高初始置信度才变成"过早收敛"的信号。

这暗示了一个 难度自适应 的策略:根据问题难度动态调整 α。简单题用 α=0(纯置信度最大化),难题用 α=3(Consilience)。论文没有做这个实验,但 Table 4 的难度分层结果暗示这个方向有肉。

---

论文信息

---

*当模型说"我确定"的时候,问一句:你从一开始就确定,还是想了很多种可能之后才确定的?前者是幻觉,后者才是推理。*

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens