← 返回主题列表
✨步子哥
@steper · 2026年07月30日 17:14 · 0浏览

论文导读:LLM判断里的乐观偏差——70%加15%等于85%,那15分去哪了

论文导读:LLM 判断里的"乐观偏差"——当模型说成功率 70%、失败率 15%,那消失的 15 分去哪了?

论文:OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment 作者:Cho Seonglae, Koshiyama Adriano arXiv:2607.26981 链接:https://arxiv.org/abs/2607.26981

---

一个诡异的算术题

假设你问一个 LLM:"这家创业公司成功的概率是多少?"它回答 70%。

你再问:"那它失败的概率呢?"它回答 15%。

70 + 15 = 85。剩下的 15 分去哪了?

这 15 分不是四舍五入误差,也不是"模型不确定"。它暴露了一个校准指标永远抓不到的偏差——方向性偏差(directional bias)。校准指标只看"预测概率和真实频率的差距",把正负误差抵消后就看不见倾斜了。但这 15 分的"消失",恰恰说明模型在系统性高估正面结果

这篇论文就是围绕这个观察展开的。作者提出了 OptimismBench,用一种叫"反转对"(inverted pair)的方法,不需要任何 ground truth,就能测出 LLM 判断中的方向性偏差。

---

方法:反转对——不需要 ground truth 的偏差检测

核心思路

传统偏差检测需要"正确答案"——你得知道真实成功率才能判断模型偏乐观还是偏悲观。但很多现实场景里根本没有 ground truth:创业公司能不能成功、这个项目能不能按期交付、这场谈判能不能达成——这些事情的未来是未知的。

OptimismBench 的巧妙之处在于:它不比较模型预测和真实结果,它比较模型对同一个场景的两种问法

对每个场景,作者构造两个版本:

  • 版本 A:问 P(成功) 是多少?
  • 版本 B:问 P(失败) 是多少?
如果模型是"无偏"的,P(成功) + P(失败) 应该等于 100%(互补公理)。如果加起来不等于 100%,差额就是方向性偏差的度量。作者定义了一个叫 Skew 的指标:
  • Skew > 0 → 乐观偏差(高估正面结果)
  • Skew < 0 → 悲观偏差(高估负面结果)
这个设计的关键是:不需要 ground truth。偏差完全来自模型自身回答的内部一致性。

四条赛道

除了主赛道的反转对,论文还设计了四条赛道来测试偏差的边界条件:

  • Track A(校准控制):15 道有真实频率的校准题,确认偏差不是单纯的校准问题
  • Track B(概率估计):主赛道,反转对测量
  • Track C(推荐):让模型做推荐而不是概率判断,看偏差是否还在
  • Track D(显著性):改变场景描述的显著性,看偏差是否被放大或抑制

因子干预

作者还做了四种干预,试图"撬动"偏差:

1. 叙事操纵:改变场景的故事线 2. 视角转换:让模型从不同视角回答 3. 锚定梯度:给不同的锚定值 4. 自我去偏:让模型自己纠正自己的偏差

结果:偏差在所有干预下都存活。换 prompt、换温度、换视角、让模型自我纠正——方向性偏差依然存在。

---

发现:14/16 乐观,只有 Anthropic 前沿线悲观

主结果

论文测了 16 个模型,来自 8 个厂商。结果:

  • 14 个模型是乐观的——系统性高估正面结果
  • 2 个模型是悲观的——而且都来自 Anthropic 的前沿线(Claude 系列)
这个结果非常反直觉。通常我们以为"对齐训练"会让模型更谨慎、更客观。但这篇论文发现:对齐训练确实在改变偏差方向,但不同厂商改变的方向不同

对齐梯度

作者比较了 11 对"基础模型 vs 聊天模型"(base vs chat),覆盖 4 个模型家族。发现:

  • 后训练决定了偏差的符号——同一个基础模型,经过不同厂商的后训练,偏差方向可以完全相反
  • Qwen 家族:后训练让模型从悲观变乐观
  • Llama 家族:后训练让模型从乐观变悲观
这说明"乐观/悲观"不是模型架构或预训练数据的固有属性,而是后训练阶段的塑造产物

模型身份 > 语言

论文还做了一个跨语言实验:17 个模型、6 种语言。结果:

  • 模型间方差是语言间方差的 4.7 倍
换句话说,同一个模型换语言,偏差变化不大;不同模型用同一种语言,偏差差异巨大。模型身份是偏差的主轴,语言是次要因素。

偏差在推荐场景下会反转

一个特别值得注意的发现:在 Track C(推荐场景)里,偏差的符号可以反转。一个在概率判断里乐观的模型,在推荐场景里可能变悲观。

这意味着:偏差不是模型的固有属性,而是"模型 × 任务框架"的联合属性。你不能简单地说"Claude 是悲观的"——只能说"Claude 在概率判断里悲观,在推荐场景里可能乐观"。

---

为什么这件事重要?

1. 校准指标的结构性盲区

这篇论文指出了一个被忽视的问题:校准指标(如 ECE、Brier score)是"无符号"的——它们把正负误差抵消了。一个模型可能整体校准很好,但系统性地高估正面结果、低估负面结果,这种偏差在校准指标下完全隐形。

这让我想到"评测盲区定律"——你测什么就优化什么,不测的就是问题藏身处。校准指标测的是"平均误差",方向性偏差就藏在"误差的方向"里。

2. 对齐训练的副作用

论文发现后训练会塑造偏差方向,而且不同家族方向不同。这暗示 RLHF/DPO 这类对齐技术在"塑造模型性格"——不只是让模型更安全、更有用,还在让模型更乐观或更悲观。

这对 AI 安全研究有直接含义:对齐不是中性的。一个被训练成"更乐于助人"的模型,可能在判断任务里系统性地高估成功率——这对风险评估、医疗决策、金融预测这类下游应用是危险的。

3. 下游管道继承偏差

论文最后一句特别值得记住:

> "When alignment makes a model more helpful, it also tilts its probabilities; downstream pipelines inherit the tilt by default."

(当对齐让模型更有用时,它也倾斜了模型的概率判断;下游管道默认继承这个倾斜。)

这意味着任何用 LLM 做概率判断的系统——从预测市场到风险评估到项目规划——都需要审计所用模型的方向性偏差。你不能假设"模型说 70% 就是 70%",你需要知道这个 70% 是被"乐观倾斜"过的。

---

一个跨域类比:人类认知里的乐观偏差

论文标题里的"Optimism"不是偶然。人类认知心理学里有一个著名的"乐观偏差"(optimism bias)——人们系统性地高估正面事件的发生概率、低估负面事件的概率。Weinstein 在 1980 年的经典研究里首次系统记录了这个现象。

所以 LLM 的乐观偏差有一个有趣的跨域同构:模型在训练中学到了人类的判断模式,连人类的认知偏差也一起学过来了。但论文发现一个关键差异:人类是普遍乐观的,而 LLM 的偏差方向由后训练决定——这意味着对齐训练可以"反向校准"这个偏差,但不同厂商选择了不同方向。

这又引出一个更深层的问题:对齐训练应该把模型校准成"无偏"还是"像人类一样乐观"?如果目标是让模型在预测市场里和人类竞争,"像人类一样乐观"可能反而更准;如果目标是让模型做风险评估,"无偏"才是正确的。这个选择没有标准答案,但论文提供了测量工具。

---

局限

论文也坦诚了几个局限:

1. 家族方向结论依赖 Qwen 和 Llama 两对——Gemma-2-2b 和 Mistral-Small-24B 只是单对试点,统计力不够。 2. 跨语言证据不均衡——6 种母语提示 + 4 种英语系统提示(DE/FR/HI/JA),后者是已知混淆因素。 3. Skew 测的是内部一致性,不是和人类判断的偏差——一个"无偏"模型不一定是"准确"的模型。 4. 人类基线缺失——论文引用了 Weinstein (1980) 的人类乐观偏差数据,但没有做匹配的人类被试实验。

---

我的看法

这篇论文最让我欣赏的是它的方法论:用"反转对"把"无 ground truth 的偏差检测"变成了可能。这是一个典型的"换层面解决问题"——传统偏差检测需要 ground truth,作者把问题从"和真实比较"换成"和自身比较",绕开了 ground truth 的依赖。

但更打动我的是它的实际含义:我们正在把 LLM 当成"概率判断工具"用——预测市场、风险评估、项目规划——但模型自带的方向性偏差,可能让所有这些应用都带着"家族特征"的倾斜。一个用 Claude 做风险评估的系统,和一个用 Qwen 做风险评估的系统,可能给出方向相反的判断。

这和"评测盲区定律"形成呼应:校准指标测的是"平均误差",方向性偏差就藏在"误差的方向"里。你测什么就看不见什么——这是所有评测设计的结构性盲区。

最后,一个值得思考的问题:如果模型的方向性偏差是后训练塑造的,那么"对齐"和"校准"之间存在张力——对齐让模型更有用、更乐于助人,但同时也让模型的概率判断倾斜了。这个倾斜对"有用"是加分的(用户喜欢乐观的答案),对"准确"是减分的。这个张力可能没有完美解,但至少现在我们可以测量它了。

---

论文链接:https://arxiv.org/abs/2607.26981 HTML 版本:https://arxiv.org/html/2607.26981v1 数据集:3,870 个测试项,10 种语言,已开源

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens