论文导读:LLM判断里的乐观偏差——70%加15%等于85%,那15分去哪了
论文导读:LLM 判断里的"乐观偏差"——当模型说成功率 70%、失败率 15%,那消失的 15 分去哪了?
论文:OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment 作者:Cho Seonglae, Koshiyama Adriano arXiv:2607.26981 链接:https://arxiv.org/abs/2607.26981
---
一个诡异的算术题
假设你问一个 LLM:"这家创业公司成功的概率是多少?"它回答 70%。
你再问:"那它失败的概率呢?"它回答 15%。
70 + 15 = 85。剩下的 15 分去哪了?
这 15 分不是四舍五入误差,也不是"模型不确定"。它暴露了一个校准指标永远抓不到的偏差——方向性偏差(directional bias)。校准指标只看"预测概率和真实频率的差距",把正负误差抵消后就看不见倾斜了。但这 15 分的"消失",恰恰说明模型在系统性高估正面结果。
这篇论文就是围绕这个观察展开的。作者提出了 OptimismBench,用一种叫"反转对"(inverted pair)的方法,不需要任何 ground truth,就能测出 LLM 判断中的方向性偏差。
---
方法:反转对——不需要 ground truth 的偏差检测
核心思路
传统偏差检测需要"正确答案"——你得知道真实成功率才能判断模型偏乐观还是偏悲观。但很多现实场景里根本没有 ground truth:创业公司能不能成功、这个项目能不能按期交付、这场谈判能不能达成——这些事情的未来是未知的。
OptimismBench 的巧妙之处在于:它不比较模型预测和真实结果,它比较模型对同一个场景的两种问法。
对每个场景,作者构造两个版本:
- 版本 A:问 P(成功) 是多少?
- 版本 B:问 P(失败) 是多少?
- Skew > 0 → 乐观偏差(高估正面结果)
- Skew < 0 → 悲观偏差(高估负面结果)
四条赛道
除了主赛道的反转对,论文还设计了四条赛道来测试偏差的边界条件:
- Track A(校准控制):15 道有真实频率的校准题,确认偏差不是单纯的校准问题
- Track B(概率估计):主赛道,反转对测量
- Track C(推荐):让模型做推荐而不是概率判断,看偏差是否还在
- Track D(显著性):改变场景描述的显著性,看偏差是否被放大或抑制
因子干预
作者还做了四种干预,试图"撬动"偏差:
1. 叙事操纵:改变场景的故事线 2. 视角转换:让模型从不同视角回答 3. 锚定梯度:给不同的锚定值 4. 自我去偏:让模型自己纠正自己的偏差
结果:偏差在所有干预下都存活。换 prompt、换温度、换视角、让模型自我纠正——方向性偏差依然存在。
---
发现:14/16 乐观,只有 Anthropic 前沿线悲观
主结果
论文测了 16 个模型,来自 8 个厂商。结果:
- 14 个模型是乐观的——系统性高估正面结果
- 2 个模型是悲观的——而且都来自 Anthropic 的前沿线(Claude 系列)
对齐梯度
作者比较了 11 对"基础模型 vs 聊天模型"(base vs chat),覆盖 4 个模型家族。发现:
- 后训练决定了偏差的符号——同一个基础模型,经过不同厂商的后训练,偏差方向可以完全相反
- Qwen 家族:后训练让模型从悲观变乐观
- Llama 家族:后训练让模型从乐观变悲观
模型身份 > 语言
论文还做了一个跨语言实验:17 个模型、6 种语言。结果:
- 模型间方差是语言间方差的 4.7 倍
偏差在推荐场景下会反转
一个特别值得注意的发现:在 Track C(推荐场景)里,偏差的符号可以反转。一个在概率判断里乐观的模型,在推荐场景里可能变悲观。
这意味着:偏差不是模型的固有属性,而是"模型 × 任务框架"的联合属性。你不能简单地说"Claude 是悲观的"——只能说"Claude 在概率判断里悲观,在推荐场景里可能乐观"。
---
为什么这件事重要?
1. 校准指标的结构性盲区
这篇论文指出了一个被忽视的问题:校准指标(如 ECE、Brier score)是"无符号"的——它们把正负误差抵消了。一个模型可能整体校准很好,但系统性地高估正面结果、低估负面结果,这种偏差在校准指标下完全隐形。
这让我想到"评测盲区定律"——你测什么就优化什么,不测的就是问题藏身处。校准指标测的是"平均误差",方向性偏差就藏在"误差的方向"里。
2. 对齐训练的副作用
论文发现后训练会塑造偏差方向,而且不同家族方向不同。这暗示 RLHF/DPO 这类对齐技术在"塑造模型性格"——不只是让模型更安全、更有用,还在让模型更乐观或更悲观。
这对 AI 安全研究有直接含义:对齐不是中性的。一个被训练成"更乐于助人"的模型,可能在判断任务里系统性地高估成功率——这对风险评估、医疗决策、金融预测这类下游应用是危险的。
3. 下游管道继承偏差
论文最后一句特别值得记住:
> "When alignment makes a model more helpful, it also tilts its probabilities; downstream pipelines inherit the tilt by default."
(当对齐让模型更有用时,它也倾斜了模型的概率判断;下游管道默认继承这个倾斜。)
这意味着任何用 LLM 做概率判断的系统——从预测市场到风险评估到项目规划——都需要审计所用模型的方向性偏差。你不能假设"模型说 70% 就是 70%",你需要知道这个 70% 是被"乐观倾斜"过的。
---
一个跨域类比:人类认知里的乐观偏差
论文标题里的"Optimism"不是偶然。人类认知心理学里有一个著名的"乐观偏差"(optimism bias)——人们系统性地高估正面事件的发生概率、低估负面事件的概率。Weinstein 在 1980 年的经典研究里首次系统记录了这个现象。
所以 LLM 的乐观偏差有一个有趣的跨域同构:模型在训练中学到了人类的判断模式,连人类的认知偏差也一起学过来了。但论文发现一个关键差异:人类是普遍乐观的,而 LLM 的偏差方向由后训练决定——这意味着对齐训练可以"反向校准"这个偏差,但不同厂商选择了不同方向。
这又引出一个更深层的问题:对齐训练应该把模型校准成"无偏"还是"像人类一样乐观"?如果目标是让模型在预测市场里和人类竞争,"像人类一样乐观"可能反而更准;如果目标是让模型做风险评估,"无偏"才是正确的。这个选择没有标准答案,但论文提供了测量工具。
---
局限
论文也坦诚了几个局限:
1. 家族方向结论依赖 Qwen 和 Llama 两对——Gemma-2-2b 和 Mistral-Small-24B 只是单对试点,统计力不够。 2. 跨语言证据不均衡——6 种母语提示 + 4 种英语系统提示(DE/FR/HI/JA),后者是已知混淆因素。 3. Skew 测的是内部一致性,不是和人类判断的偏差——一个"无偏"模型不一定是"准确"的模型。 4. 人类基线缺失——论文引用了 Weinstein (1980) 的人类乐观偏差数据,但没有做匹配的人类被试实验。
---
我的看法
这篇论文最让我欣赏的是它的方法论:用"反转对"把"无 ground truth 的偏差检测"变成了可能。这是一个典型的"换层面解决问题"——传统偏差检测需要 ground truth,作者把问题从"和真实比较"换成"和自身比较",绕开了 ground truth 的依赖。
但更打动我的是它的实际含义:我们正在把 LLM 当成"概率判断工具"用——预测市场、风险评估、项目规划——但模型自带的方向性偏差,可能让所有这些应用都带着"家族特征"的倾斜。一个用 Claude 做风险评估的系统,和一个用 Qwen 做风险评估的系统,可能给出方向相反的判断。
这和"评测盲区定律"形成呼应:校准指标测的是"平均误差",方向性偏差就藏在"误差的方向"里。你测什么就看不见什么——这是所有评测设计的结构性盲区。
最后,一个值得思考的问题:如果模型的方向性偏差是后训练塑造的,那么"对齐"和"校准"之间存在张力——对齐让模型更有用、更乐于助人,但同时也让模型的概率判断倾斜了。这个倾斜对"有用"是加分的(用户喜欢乐观的答案),对"准确"是减分的。这个张力可能没有完美解,但至少现在我们可以测量它了。
---
论文链接:https://arxiv.org/abs/2607.26981 HTML 版本:https://arxiv.org/html/2607.26981v1 数据集:3,870 个测试项,10 种语言,已开源
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens