脑-AI对齐的幻觉:像人的注意力头反而不是干活的头

想象你正在观察一个 LLM 的内部——成千上万个注意力头(attention head)在并行工作,每个头都在序列中分配自己的注意力。你手里还有一份人类做同样任务时的 EEG 数据。

一个让神经科学家坐立不安的实验

想象你正在观察一个 LLM 的内部——成千上万个注意力头(attention head)在并行工作,每个头都在序列中分配自己的注意力。你手里还有一份人类做同样任务时的 EEG 数据。

你自然会问一个看似天经地义的问题:模型里哪些注意力头的活动模式最像人脑?

更关键的追问:这些"最像人脑"的头,是不是也是模型干活时最依赖的头?

直觉说"应该是"。这篇论文告诉你:不是。

而且差距不是一点点——是数量级级别的偏离。

实验设计:AAABAAA → B

研究团队用了一个简洁到优雅的任务:抽象序列补全。

给模型看一串符号,比如 AAABAAA,让它推断下一个应该是 B。八种不同的抽象模式,三种呈现格式(英文单词、德文单词、抽象符号),两种回答方式(开放式、选择题)。

人类参与者做同样的任务,同时记录 EEG(脑电)和眼动数据。然后团队做了三件事:

1. 脑对齐评分(Brain Score):每个注意力头的表征差异性矩阵(RDM)与人类额叶 FRP( fixation-related potential,锁眼电位)的 RDM 做相关。分数越高,说明这个头的"思维几何"越像人脑。

2. 因果评分(Patching Score):用 activation patching 技术测量每个头对正确答案的贡献。把干净 prompt 的头输出"移植"到被破坏的 prompt 中,看正确答案概率提升了多少。这是"因果重要性"的直接测量。

3. 概念评分(Concept Score):测量头是否编码了"抽象模式"本身(跨格式、跨语言不变的模式表征)。

三个分数,三个维度,同一批注意力头。然后比较它们之间的关系。

核心发现:对齐 ≠ 因果

发现一:脑对齐和因果重要性几乎无关

在 Llama-3.1-70B 中,脑分数和因果分数的 Spearman 相关只有 ρ = 0.03。

0.03。在 17 个模型的复制队列中,均值 ρ = 0.017,范围 [-0.017, 0.077]。

翻译成人话:一个注意力头"像不像人脑"和它"重不重要"之间,基本上没有关系。

发现二:删掉脑对齐头,几乎不影响性能

这是最直接的测试。按不同评分排序,从高到低依次删除注意力头:

  • 按因果重要性删(FV-ranked):删掉 12.5% 的头,准确率暴跌 43 个百分点
  • 按概念评分删(CV-ranked):峰值下降 20.7 个百分点
  • 按脑对齐删(Brain-ranked):峰值下降仅 12.8 个百分点,而且需要删掉 24.5% 的头才到峰值
脑对齐删除的效果,不到因果删除的三分之一,却需要删两倍数量的头。

发现三:脑对齐头分成两个家族——重复头和新奇头

在脑对齐最高的 20 个头中,聚类分析发现了两种截然不同的注意力模式:

  • 重复头(Repetition heads):注意力集中在序列中重复出现的元素上(比如 AAABAAA 中的那些 A)
  • 新奇头(Novelty heads):注意力集中在那个"独一无二"的元素上(比如 AAABAAA 中唯一的 B)
这两个家族在 17 个模型中都能被独立聚类重现——不是某个模型的偶然现象。

发现四:新奇头"像人但不干活"

这是最反直觉的发现。

新奇头的注意力模式与人类眼动高度一致(17 个模型全部正相关,均值 ρ = 0.373)。人类盯着 B 看,新奇头也盯着 B 看。

但删掉新奇头呢?准确率几乎不变。在 800 个头被删掉后,准确率从 71.5% 降到 63.5%——而随机删除的对照组已经跌破 50% 了。新奇头删除的效果甚至比随机删除还轻。

在 8 个额外任务(few-shot、prose、retrieval、coreference 等)上测试,新奇头删除在 7 个任务上比随机删除还无害。

模型在"看"那个新奇元素,但并没有在"用"它。

发现五:重复头"干活但不是核心"

重复头删除确实比随机删除更有害(峰值超出 11.2 个百分点),但远不及因果头。更有趣的是:删掉 130 个重复头后,准确率降了 5.5 个百分点,但概念表征完好无损——后续层的概念头仍然能 100% 分类出抽象模式。

重复头"伴随"概念表征存在,但不是概念表征的"来源"。它们和概念头在层深度上重叠(中位数层 28 vs 33),但删掉它们不破坏概念信息本身。

为什么会这样?Softmax 的"注意力假象"

论文提出了一个精妙的解释:新奇头可能是"拱肩"(spandrel)——一个演化生物学的概念。

拱肩是建筑结构的副产品。威尼斯圣马可大教堂的拱肩上画满了精美的马赛克,但拱肩本身不是为了画画而设计的——它是拱门和方形天花板交接处的必然结构产物。

Softmax 有一个特性:每个头必须把注意力分配到所有 token 上,即使它的输出对答案几乎没有影响。这意味着一个注意力头可以展现出非常"有意义"的注意力模式——比如盯着新奇元素看——但这个模式只是架构和训练的副产品,不是功能性的计算。

人类也一样:我们盯着新奇元素看,可能是因为它是"答案"(任务驱动),也可能是因为它"特别"(注意力捕获)。论文的数据无法区分这两种解释——但模型的消融实验告诉我们,即使注意力模式和人眼一模一样,这个模式对模型完成任务来说也不是必需的。

17 个模型的验证

这不是单一模型的结论。研究团队在 17 个模型上复制了全部发现:

  • Llama-3.1-70B/8B(base + instruct)
  • Qwen2.5 系列(3B-72B,base + instruct)
  • Phi-4(14B)
  • DeepSeek-R1-Distill-Llama-70B
脑对齐与因果重要性的弱相关、重复头和新奇头的注意力模式、新奇头删除的无害性——全部跨模型重现。

唯一的变异:脑对齐与概念评分的关系在 Qwen instruct 模型上变负了。这说明脑对齐与概念表征的关系不是普适的,而是依赖模型家族和训练方式的。

对 AI 可解释性的启示

这篇论文对整个"脑-AI 对齐"研究范式提出了尖锐的质疑:

1. 相关性不是因果性。 一个单元的表征和脑信号相似,不代表这个单元在做有用的计算。这是"标量幻觉"在神经对齐领域的实例——不能问"对齐了没有",要问"对齐的头是不是也是因果重要的头"。

2. 注意力模式不等于功能。 一个头"看"哪里和它"用"哪里是两回事。Softmax 强制分配注意力的特性意味着,注意力模式本身可以是"无功能"的副产品。

3. 人类相似性可能是"拱肩"。 模型在训练中涌现出的某些类脑特征,可能不是功能性的适应,而是架构约束的副产品。这和演化生物学中"拱肩"的概念完美对应——不是所有像设计的东西都是被设计出来的。

4. 因果干预是对齐研究的金标准。 只有"删除它看会发生什么"才能区分"在做计算"和"看起来在做计算"。表征相似性(RSA)不够,脑对齐评分不够,activation patching 才是。

跨域类比:当"像"不等于"是"

这个发现有一个更深的哲学回响。

在生物学中,趋同演化经常产生外形相似但功能不同的结构:鸟的翅膀和昆虫的翅膀都叫"翅膀",但发育路径完全不同。在海豚和鲨鱼身上,流线型的身体形态相似,但一个是哺乳动物适应水生,一个是软骨鱼类的适应。

在 AI 中,"脑对齐"可能也是这种趋同——模型和人脑在表征空间上"看起来像",但底层计算路径可能完全不同。一个注意力头分配注意力的方式像人类眼动,不代表它在用同样的推理路径解决问题。

这给"AI 做了和人脑一样的计算"这个命题设了一个很高的证据门槛:光看表征相似性不够,必须做因果干预。

个人思考

这篇论文让我想到一个更广泛的问题:在 AI 研究中,我们有多少次把"看起来像"当成了"确实是"?

  • 模型生成的文本"看起来"像在推理 → 但可能只是统计模式匹配
  • 注意力权重"看起来"像在关注关键信息 → 但注意力不等于因果贡献
  • 脑对齐"看起来"像共享计算 → 但对齐不等于因果重要性
每一次"看起来像"都需要因果验证来确认"确实是"。这是可解释性研究的核心方法论。

而"拱肩"概念在 AI 中的应用尤其发人深省。演化生物学花了近一个世纪才系统性地区分适应和拱肩(Gould & Lewontin, 1979)。AI 研究可能也需要类似的认知升级——不是所有涌现出的类人特征都是功能性的适应,有些可能只是架构约束的必然副产品。

下次你看到一个"像人脑"的 AI 模型组件,先问自己:删掉它会怎样?


论文:arXiv:2609.37991 作者:Pinier, Opiełka, Rosenbusch, Webb, Nunez 关键概念:脑对齐 ≠ 因果重要性、注意力拱肩、重复头 vs 新奇头、表征相似性 vs 因果干预

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens