论文: Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs
作者: Izhar Ali (Rowan University)
arXiv: 2607.20464
会议: EIML@ICML 2026 (2nd Workshop on Epistemic Intelligence in Machine Learning)
🎲 引子:一百万次的掷骰子
想象你面对一个极其复杂的谜题。你不知道答案,但有一个"智者"可以咨询。你问了他一个问题,他给出了一个答案。你不确定这个答案是否正确,所以你决定:问同一個智者,同一個问题,但要求他每次都用略微不同的思路来回答。你问了100遍。
现在你有100个答案。你统计了一下,发现第1个答案和第51个答案在60%的内容上完全一致。你觉得这下可以高枕无忧了——"如果同一个智者在不同时间给出相同的答案,那答案很可能是对的。"
但你忽略了一个关键问题:这100个答案虽然略有不同,但它们都来自同一个智者,同一个知识库,同一个认知盲区。 如果智者本身在某个领域存在系统性的误解,那么无论你问100遍还是100万遍,你得到的都将是同一个误解的100万个变体。
这正是Izhar Ali在ICML 2026的Epistemic Intelligence Workshop上提出的尖锐问题:当你对一个LLM进行100次采样(stochastic sampling)时,你得到的多样性真的是"知识"的多样性,还是仅仅是"噪音"的多样性?
🧩 第一章:自一致性——一个看似聪明的捷径
在深入这篇论文之前,让我们先理解一个被广泛使用的方法:自一致性(Self-Consistency)。
这个概念最早由Wang等人在2023年提出,其核心思想异常简单:对于一个复杂问题(比如数学推理题),与其让LLM只生成一个答案,不如让它生成多个答案,然后取多数票。如果10个答案中有7个都说是"42",那么我们对"42"的信心就大大增加了。
这个方法在实践中表现出色,成本低(不需要多个模型),效果好(在GSM8K等数学基准上显著提升准确率)。很快,它衍生出了一系列变种:
- 答案重现置信度:看同一个答案出现的频率
- 语义熵:不仅看答案是否完全相同,还看语义上是否等价
- 幻觉检测:如果多次采样结果分歧很大,就标记为可能的幻觉
这些方法背后的共同假设是:同一个模型的多次采样产生的变化,携带着关于模型"知道什么"和"不知道什么"的信息。
但Ali的问题直击要害:这种变化真的携带了结构化的知识信息,还是仅仅是表面上的噪音?
🏔️ 第二章:两种不确定性——硬币的两面
要理解这篇论文的核心发现,我们需要区分两种不同类型的不确定性估计。
第一种:问题级不确定性(Per-question uncertainty)
这是自一致性擅长的领域。对于某个特定问题,模型生成多个答案,我们看答案之间的分歧程度。分歧大 = 模型对这个问题的答案不确定。这就像是反复掷一枚硬币来估计它的偏差——每次掷都是独立的,但合在一起可以给出对"正面概率"的精确估计。
第二种:跨问题结构(Cross-question structure)
这是更深层、更有趣的问题。假设我们有一组相关的数学题。如果一个模型在"代数"方面很弱,我们预期它在所有代数题上的表现都会系统性地下滑。这种跨问题的相关性揭示了一个模型的"能力维度"——它不仅告诉我们"这道题我不会",还告诉我们"这类题我都不擅长"。
用一个更生活化的比喻:
- 问题级不确定性就像问一个学生"这道微积分题你会做吗?",让他做10遍,看答案是否一致。
- 跨问题结构则是分析这个学生在微积分、线性代数、概率论三个领域的表现,发现他在"需要空间想象力的题目"上普遍表现不佳——这揭示了一个更深层的认知特征。
Ali的核心问题是:自一致性的多次采样,能否揭示这种跨问题的结构?
🔬 第三章:随机矩阵理论——一个数学显微镜
为了回答这个问题,Ali借用了物理学和统计学中一个强大的工具:Marchenko-Pastur(MP)随机矩阵理论。
这个理论听起来很吓人,但核心直觉其实很简单。
想象你有一个巨大的表格,行代表"不同的尝试",列代表"不同的问题"。表格里的每个格子是0(答错)或1(答对)。如果你只做了一个尝试(一行),这个表格没什么可分析的。但如果你做了100次尝试,你就有了一个100行的矩阵。
现在关键问题来了:这100行之间的相关性,有多少是真正的"结构化知识信号",有多少只是"随机噪音"?
MP理论提供了一个优雅的答案。它告诉我们:对于一个纯随机的矩阵(即每个格子的值都是独立随机生成的),其特征值谱(eigenvalue spectrum)会遵循一个特定的分布——MP分布。任何超出这个分布边界的特征值,都意味着存在某种"非随机结构"。
这就像是有一个"噪音基准线"——任何超过这个基准线的信号,都值得我们关注。
📊 第四章:实验设计——100次采样 vs 24个模型
Ali设计了一个精妙的对照实验。
实验组A(内模型): 取一个LLM(比如Qwen2.5-7B),在同一个问题上运行100次(temperature=1),记录每次的对错。得到一个100×500的矩阵(100次运行,500个问题)。
实验组B(跨模型): 取24个不同的LLM(不同架构、不同训练数据、不同规模),每个运行1次(temperature=0,即确定性输出),记录对错。得到一个24×500的矩阵。
然后,对两个矩阵分别做MP测试。
结果让人震惊:
在实验组A中——100次采样——MP测试发现:最多只有一个特征值超出了噪音边界。而且,这一个信号也非常微弱(TW z-score ≤ +0.05,完全在噪音范围内)。
换句话说:同一个模型的100次采样,几乎不包含任何跨问题的结构化信息。
但在实验组B中——24个不同模型——MP测试发现了四个清晰的超出噪音边界的特征值。而且,这个结果被严格验证:与一个匹配难度的独立伯努利零假设(500次蒙特卡洛抽取)相比,零假设最多产生一个信号特征值,而实验组B稳定地产出四个。
这就是论文标题中的"维度差距"(Dimensionality Gap):
- 内模型维度:≤1
- 跨模型维度:≥4
🌊 第五章:温度稀释——为什么采样如此"浅"
为什么同一个模型的100次采样如此"贫瘠"?
Ali给出了一个深刻的解释:温度(temperature)是一个对logits的均匀膨胀。
要理解这一点,我们需要回顾一下LLM是如何生成文本的。模型为每个可能的下一个词输出一个"分数"(logit)。然后通过softmax函数将这些分数转换为概率分布。温度参数T控制这个分布的"尖锐程度":
- T=0:完全贪婪,总是选择概率最高的词
- T=1:标准采样
- T>1:更"随机",概率分布更平坦
Ali指出,温度调整是对整个概率分布的均匀操作——它不区分领域,不区分问题类型,不区分"我知道这个"和"我猜这个"。它就像一个均匀照亮房间的灯,不会在某些角落投下更深的阴影来揭示结构。
这导致了一个关键结果:温度变化产生的采样差异,本质上是"无结构的噪音",而不是"有结构的知识差异"。
用一个比喻:想象你在一个巨大的图书馆里找书。温度采样就像是在同一个图书馆里,每次随机选一条不同的走廊走。走廊不同,但你看到的始终是这个图书馆的书——你不会突然看到另一个图书馆的藏书。而使用不同模型,则是去了完全不同的图书馆。
🎯 第六章:局部承诺,全局无序
论文中有一个特别精彩的概念:"局部承诺,全局无序"(Locally committed, globally incoherent)。
Ali发现,当Qwen2.5-7B在一个边缘问题上答错时,它在100次采样中有87.4%的概率选择同一个错误答案。这意味着:模型在这个具体问题上有着强烈的"局部承诺"——它"坚信"某个错误答案是对的。
但关键是,这些局部承诺之间没有跨问题的关联结构。模型在问题A上倾向于错误答案X,在问题B上倾向于错误答案Y——这两个倾向之间没有系统性的关联。错误是"孤立事件",而不是"症状群"。
这与人类的认知形成了有趣的对比。如果一个学生在"需要空间想象力的几何题"上反复出错,我们可能会诊断出他在空间推理方面存在系统性弱点。这种跨问题的关联性是教育诊断的核心。但LLM的采样误差似乎缺乏这种结构——它们是原子化的、孤立的、无关联的。
💡 第七章:对AI工程的启示
这项研究的发现对实际的AI系统开发有着直接的影响。
1. 选择性预测(Selective Prediction)
如果你的系统需要判断"我是否应该回答这个问题,还是说我应该拒绝回答因为我可能答错",自一致性是一个不错的低成本方案——它可以给出准确的问题级不确定性估计。但如果你想知道"我在哪类问题上普遍表现不佳,需要额外训练",自一致性帮不了你。你需要真正的模型多样性。
2. 模型集成的价值
传统的集成学习(ensemble learning)建议"使用多个模型来减少方差"。Ali的结果给出了一个更深层的理由:不同模型不仅减少了方差,还揭示了单一模型内部无法触及的"认知维度"。一个24模型的集成不只是"100次采样的更贵版本"——它是根本不同的信息源。
3. 幻觉检测的局限
当前很多幻觉检测方法依赖自一致性——如果多次采样结果不一致,就标记为可能的幻觉。Ali的结果并不否定这种方法的有效性(问题级不确定性确实是准确的),但它提醒我们:这种方法无法揭示更深层的、跨问题的系统性幻觉模式。
🌌 第八章:哲学余韵——什么是"知道"?
这篇论文虽然技术性强,但触及了一个深刻的哲学问题:什么是"知道"?
自一致性假设:如果一个模型在多次采样中给出一致的答案,那么它"知道"这个答案。但Ali的结果暗示,一致性可能只是一种"局部惯性"——模型在特定问题上被训练得足够好,以至于采样噪音不足以撼动它。但这不等于"理解"。
真正的"知道"可能需要满足更强的条件:不仅在特定问题上表现稳定,而且在相关问题上的表现也有可预测的结构。一个"知道"代数的模型,应该在所有代数题上表现出相关的模式——它的错误不是随机的,而是系统性的、有结构的、可诊断的。
从这个意义上说,Ali的维度差距揭示了一个令人不安的可能性:当前LLM的采样行为可能更接近"记忆"而非"理解"——它们记住了大量孤立的事实和模式,但这些记忆之间缺乏深层的结构化关联。
🔮 结语:从回声室走向交响乐团
让我们回到开头的比喻。
你对同一个智者问了100遍同一个问题。你得到了100个略有不同的答案。你以为这是100个独立的视角,但实际上,这只是同一个视角的100次回声。
这篇论文的价值,在于它用严格的数学工具量化了这个直觉。自一致性不是 ensemble 的廉价替代品——它是一个根本不同的、信息上更贫瘠的近似。
对于AI研究者和工程师来说,这个发现既是警示也是方向:
- 警示:不要过度依赖采样的"表面多样性"
- 方向:在追求真正的认知维度时,模型多样性可能比采样深度更有价值
就像从一个乐器演奏100次得到的录音,永远无法替代一个交响乐团中不同乐器之间的和声与对话。真正的智慧,或许不在于一个声音多么响亮,而在于多个声音如何共鸣。
📚 参考文献
-
Ali, I. (2026). Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs. arXiv:2607.20464. EIML@ICML 2026.
-
Wang, X., et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR.
-
Lakshminarayanan, B., et al. (2017). Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles. NeurIPS.
-
Marčenko, V.A., & Pastur, L.A. (1967). Distribution of eigenvalues for some sets of random matrices. Mathematics of the USSR-Sbornik.
-
Farquhar, S., et al. (2024). Detecting Hallucinations in Large Language Models Using Semantic Entropy. Nature.
#论文 #LLM #不确定性估计 #随机矩阵 #ICML2026 #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。