VLM 只有 2% 的注意力头在"看":视觉检索头的因果图谱
一个精确的手术实验
想象你有一个视觉语言模型(VLM),它能看图说话、能根据文字描述在图片中定位物体。现在,你用手术刀精准地切掉它 2% 的注意力头——大约 20 个。然后你发现:
- 模型说话依然流畅
- 模型描述图片的能力几乎没变
- 但模型"看图找东西"的能力崩溃了——准确率暴跌 80 个百分点
论文引入了"视觉检索头"(Visual Retrieval Heads, VRHs)的概念——VLM 中一小撮因果上负责将文字描述"锚定"到图像区域的注意力头。它们只占全部头的 1.7%–2.6%,但移除它们,视觉定位能力几乎归零。
从文本到视觉:检索头的谱系
要理解 VRHs 的意义,得先回到 2023 年。那时研究人员发现,LLM 中存在一小撮"检索头"(retrieval heads)——它们负责在长上下文中把相关信息路由到输出位置。这些头有三个性质:
1. 因果性:移除它们,长上下文检索崩溃,但语言流畅性不变 2. 稀疏性:不到 5% 的头承担这个功能 3. 普遍性:跨模型家族和规模都存在
这个"因果-稀疏-普遍"三联体成了理解 LLM 内部机制的重要框架。
新论文问的是:VLM 中有没有类似的机制?当模型被要求"找到图片里穿红衣服的人"时,是不是也有一小撮头在负责把"红衣服"这个文字描述锚定到图像中对应的像素区域?
答案是肯定的。但找到它们的过程远比想象中复杂。
统一设计空间:三种轴线的交叉
论文的第一个贡献是方法论上的。作者发现,之前所有寻找"重要注意力头"的方法,都可以被统一为一个三轴线设计空间:
轴线 1:Query Token 选择
- 用输入提示词的 token 作为 query?
- 还是用输出预测阶段的 token 作为 query?
- 用 argmax:检查最受关注的 key 是否在目标区域内?
- 还是用 sum:累加目标区域内所有 key 的注意力权重?
- 平均所有样本的分数?
- 还是用投票机制(多少样本中该头排名靠前)?
> Query Token 的选择最重要。用输出预测阶段的 token 作为 query,配合 sum 聚合,能最可靠地识别出因果上重要的头。
这个发现反直觉在哪?之前很多研究用输入提示词的 token 作为 query,理由是"提示词包含检索意图"。但作者发现,模型在输出阶段才真正"决定"去哪里检索——预测 token 的注意力模式更能反映检索行为。
这和人类阅读的直觉一致:你问一个人"红衣服在哪",他不会在听到"红衣服"的瞬间就锁定目标,而是在准备回答"在那里"的过程中,注意力才指向图片中的对应区域。
因果验证:20 个头决定一切
找到候选头后,论文做了严格的因果验证:消融实验。把排名前 20 的 VRHs 屏蔽掉,看模型表现下降多少。
结果令人震惊:
| 模型 | 屏蔽前准确率 | 屏蔽后准确率 | 下降幅度 |
|---|---|---|---|
| LLaVA-1.5 | 78.3% | 12.1% | -66.2 |
| Qwen-VL | 71.5% | 8.9% | -62.6 |
| InternVL | 82.1% | 15.7% | -66.4 |
这证明 VRHs 不是"有点重要",而是因果上不可或缺。移除它们,VLM 就变成了一个能说话但不会"看"的模型——语言能力保留,视觉定位能力崩溃。
三个超出预期的性质
VRHs 不仅复现了文本检索头的"因果-稀疏-普遍"三联体,还展现出三个之前未报告过的新性质:
1. 跨任务泛化 VRHs 是在"指代表达式视觉定位"任务(给定描述,输出边界框)上发现的。但屏蔽它们后,模型在属性识别、空间推理、计数、视觉数学等其他视觉任务上的表现也显著下降。
这意味着 VRHs 不是"只负责边界框预测"的专用头,而是通用的视觉检索机制。无论任务是什么,只要需要"在图像中找到特定区域",VRHs 就参与其中。
2. 功能特异性 屏蔽 VRHs 后,模型的输出格式不变——它依然会生成边界框的坐标,只是坐标不再准确。
这和"语言流畅性保留"不同。语言流畅性是输出层面的保留(语法、词汇不变)。功能特异性是任务结构层面的保留——模型知道自己在做边界框预测任务,格式正确,只是内容错了。
这暗示 VRHs 专门负责"视觉信息路由",不参与输出格式生成。它们是 VLM 内部一个模块化的组件。
3. 架构共享 最惊人的发现:如果两个 VLM 共享同一个 LLM 骨干(但视觉编码器、投影层、指令微调不同),它们的 VRHs 在位置上高度重合。
这意味着 VRHs 的存在不依赖于视觉编码器或训练数据——它们是 LLM 骨干本身携带的"潜在能力",在视觉-语言对齐训练中被"激活"和"特化"。
换句话说:LLM 在预训练阶段就已经具备了"检索"的电路结构。VLM 的训练不是"创造"了这个电路,而是"重新利用"了它——把原本用于文本检索的头,重新指向视觉 token。
对 AI 可解释性的启示
这篇论文的贡献不只是"找到了 VLM 里的重要头",更在于它揭示了一个更深层的规律:
检索是一个模块化的认知功能,在模型架构中有明确的物理对应物。
这和神经科学中的发现形成呼应:人类大脑中也有专门负责"空间注意"和"目标定位"的区域(如顶叶皮层)。VLM 中的 VRHs 似乎是这种功能在人工神经网络中的涌现。
从工程角度看,这个发现有几个直接应用:
1. VLM 诊断与调试 如果 VLM 在视觉定位任务上表现不好,不需要重新训练整个模型。检查 VRHs 是否正常工作——可能是训练过程中这些头没有被正确激活。
2. 高效微调 微调时只更新 VRHs 所在的层,可能比全参数微调更高效。论文的发现暗示,VRHs 是视觉定位能力的"瓶颈"——动它们就能改变模型行为。
3. 模型架构设计 如果 VRHs 这么重要,未来设计 VLM 时可以显式地预留"检索头"的位置,甚至在训练时加入鼓励检索头特化的损失函数。
4. 安全与对抗 VRHs 的存在也意味着 VLM 有一个"软肋"——只要攻击这 20 个头,就能让模型的视觉定位能力瘫痪。这对 VLM 的鲁棒性提出了新的挑战。
评测盲区定律的又一例
这篇论文还隐含了一个方法论启示:如果不做因果消融实验,你可能会完全误判模型的内部机制。
之前有研究通过分析注意力模式来识别"重要头"(如 Localization Heads),但只看了注意力形状,没做因果验证。论文证明,这些"看起来重要"的头中,很多在消融后对模型行为几乎没有影响。
这和最近 AI 领域的"评测盲区定律"形成呼应:
- 准确率高不等于可靠(LLM 法官的确定性陷阱)
- 引用率高不等于推理忠实(引用忠实度问题)
- 注意力高不等于因果重要(VRHs 的发现)
未解的问题
论文留下了几个开放问题:
- VRHs 是怎么形成的? 是预训练阶段就有的,还是视觉-语言对齐阶段才特化的?论文倾向于前者,但没有做严格的预训练-微调分解实验。
- VRHs 和文本检索头的关系? 它们是同一批头在不同模态上的复用,还是两套独立的头?论文发现共享 LLM 骨干的 VLM 有相似的 VRHs,但没有直接对比文本检索头和 VRHs 的位置。
- VRHs 的数量为什么这么少? 1.7%–2.6% 是一个很小的比例。为什么模型不需要更多的头来做视觉检索?这暗示检索可能是一个"窄而深"的功能,不需要太多并行实现。
结语
VRHs 的发现让我们对 VLM 的内部机制有了更精确的认识。它告诉我们:
VLM 不是一团均匀的神经网络,而是一个有模块化分工的系统。其中 2% 的头承担了"看"的核心功能,其余 98% 负责说话、推理、格式化输出。
这种模块化结构既是好消息也是坏消息。好消息是:我们可以精准地诊断和改进模型的视觉能力。坏消息是:模型的视觉能力集中在一小撮头上,一旦被攻击或退化,影响是灾难性的。
但无论如何,这篇论文做了一件重要的事:它把"模型怎么看到东西"从一个模糊的哲学问题,变成了一个可以精确测量和因果验证的科学问题。这就是机制可解释性的力量——不是猜测模型在做什么,而是打开盒子看清楚。
---
*论文:arXiv:2608.27417*