注意力通路的脆弱性:当模型的自信建立在摇摇欲坠的地基上
注意力通路的脆弱性:当模型的自信建立在摇摇欲坠的地基上
> 论文链接:arXiv:2608.11138 > 代码:暂无开源 > 作者:Minsoo Kim, Sungyoung Ji, Kisung Moon, Ilyong Yoon
---
一个反直觉的场景
你问一个大模型:"《百年孤独》的作者是谁?"它回答:"加西亚·马尔克斯。"置信度 99.9%。
你再问:"2026 年诺贝尔物理学奖得主是谁?"它回答:"某某某。"置信度 99.9%。
两个回答的置信度一模一样,但第一个是对的,第二个是编的。模型自己完全无法区分这两种"自信"——至少传统的输出概率分布看不出区别。
这篇论文问了一个被忽视的问题:如果模型对某个答案很自信,但只要稍微扰动一下它的注意力通路,答案就会崩塌——这种"脆弱的自信"本身是不是一种不确定性信号?
答案是肯定的,而且这个信号和传统的输出置信度是两回事。
---
现有不确定性估计的困境
大模型的不确定性估计(Uncertainty Estimation, UE)主要有四条路线:
1. 输出熵:看模型输出的概率分布有多分散。分布越尖锐,模型越自信。但问题是,模型经常在错误答案上也很尖锐——它不知道自己不知道。
2. 采样一致性(Self-consistency):让模型回答多次,看答案是否一致。问题是成本高,需要多次前向传播。
3. 语义一致性:比较多次采样的语义相似度,而不是字面一致。比纯采样好,但仍然需要多次采样。
4. 结构扰动:给模型内部加噪声或 dropout,看输出是否稳定。这是本文所属的路线。
本文的核心洞察是:传统方法都在看"输出端"——模型说了什么。但模型说了什么,取决于它的注意力通路怎么走。如果通路很脆弱,稍微扰动就变,那即使输出很自信,这种自信也是虚假的。
---
ASMI:注意力子网络互信息
方法叫 ASMI(Attention-Subnetwork Mutual Information),核心思路三步:
第一步:掩码注意力头
把模型的注意力头分成若干子网络,每次随机掩码一部分(类似 dropout,但只在注意力层)。每次掩码后,模型会给出一个输出分布。
第二步:测量互信息
用 BALD(Bayesian Active Learning by Disagreement)框架测量这些子网络输出之间的互信息。直觉上:如果模型很自信且正确,那不管你怎么掩码注意力头,输出都应该差不多——互信息高。如果模型自信但脆弱,掩码不同子集会给出截然不同的答案——互信息低。
第三步:语义一致性核
关键创新。传统 BALD 比较的是字面一致的输出,但语言模型的输出经常"字面不同但语义相同"——"马尔克斯"和"加西亚·马尔克斯"是同一个答案。ASMI 引入了一个语义一致性核(semantic agreement kernel),用语义等价而非字面一致来衡量子网络之间的同意度。
这个设计很关键。没有它,ASMI 会把"语义相同但字面不同"的输出误判为"不一致",从而高估不确定性。
---
核心发现:这不是输出置信度的复读机
论文最扎实的部分是证明 ASMI 提供的是独立信号,不是输出置信度的换皮。
发现一:在"自信但脆弱"的区间,ASMI 把错误率砍半
在 grounded QA(SQuAD, CoQA, BabiQA)上,把 ASMI 作为置信度过滤器的附加信号:
- 在"自信但脆弱"的预测子集里,错误率从基线降到约一半
- 在"自信且稳健"的子集里,ASMI 不加不减
发现二:信号的正交性
用残差化分析(residualization):先把输出置信度和熵能解释的不确定性去掉,再看 ASMI 还能不能预测错误。结果:能。在五个模型-数据集组合中,ASMI 在四个上提供了统计显著的增量信息。
发现三:有自己的适用边界
ASMI 在参数化 QA(TriviaQA,闭卷问答)上失效——信号方向甚至反了。作者没有掩盖这个事实,而是给出了解释:
- Grounded QA(有上下文):答案需要从上下文中提取,注意力通路至关重要。通路脆弱 = 不确定性高。
- Parametric QA(闭卷):答案依赖模型参数中的知识,注意力通路的作用不同。通路脆弱不等于不确定。
---
为什么这个方法有意思
1. "看地基,不看招牌"
传统不确定性估计都在看模型的"招牌"——输出概率分布。ASMI 看的是"地基"——注意力通路稳不稳。招牌可以粉饰得光鲜亮丽,但地基松了,楼迟早会塌。
这个思路可以推广。任何复杂系统都有"表面信号"和"结构信号"的区分。人的自信可以是"嘴上说很确定"(输出置信度),也可以是"怎么问都答得出来"(结构稳健性)。后者更可靠。
2. 训练免费
ASMI 不需要重新训练模型,不需要额外的标注数据,只需要在推理时做多次掩码前向传播。虽然比单次推理贵(需要约 40 次前向传播),但比采样一致性方法便宜(后者需要生成完整回答)。
3. "评测盲区定律"再添一例
这篇论文揭示了一个被忽视的失败模式:自信但脆弱。传统评测只看"平均准确率"或"平均置信度校准",完全看不到这个子集。就像医学检查只看平均血压,看不到"血压正常但心率变异度低"的高危人群。
这和之前观察到的几篇论文形成共振:
- Progressive Cramming:99% token 准确率掩盖 100% 生成失败
- Token Budget:96.5% vs 11.5% 的双峰命运,早期就编码在表示中
- QuantiBias:量化在标准安全检查的盲区里引入偏见
---
诚实的局限
论文没有回避局限:
1. 计算开销:40 次前向传播对实时部署不友好。论文给出了近似方案(Top-K 掩码),但精度有所下降。
2. 只测了注意力层:MLP 层、残差流的其他组件没有涉及。注意力通路脆弱性可能只是冰山一角。
3. 适用边界窄:只在 grounded QA 上有效,参数化 QA 上失效。这意味着 ASMI 不能作为通用不确定性估计器,需要根据任务类型选择。
4. 模型规模:主要在 1B-8B 模型上测试。更大模型上注意力通路的行为可能不同——更稳健还是更脆弱,目前不清楚。
---
对工程实践的启示
如果你在做一个 RAG 系统(有上下文的问答),ASMI 值得考虑。具体场景:
- 高 stakes 部署:医疗、法律、金融问答,错误的代价远高于多算 40 次前向传播的成本
- RAG 系统的 confidence routing:用 ASMI 判断哪些查询需要检索增强、哪些可以直接回答、哪些需要人工审核
- 模型选型:比较不同模型在"自信但脆弱"子集上的表现,这比平均准确率更能反映模型的可靠性
---
一句话总结
模型的自信有两种:一种是"怎么扰动都稳"的稳健自信,一种是"稍微一碰就碎"的脆弱自信。ASMI 是第一个在注意力通路层面区分这两种自信的训练免费方法——它不替代传统置信度,而是补上了传统置信度看不见的那一半世界。
---
> 论文:Attention-Path Fragility as an Uncertainty Signal in Large Language Models > 作者:Minsoo Kim, Sungyoung Ji, Kisung Moon, Ilyong Yoon > 发布日期:2026-08-11