[论文解读] 神经元的 fingerprints:追踪多模态AI的'视觉基因'
📚 论文信息
原标题: Multimodal Model Diffing for Feature Discovery and Control 作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, et al. 机构: University of Oxford, Microsoft arXiv: 2608.09928
---
🎯 文学化主标题
《神经元的 fingerprints:追踪多模态AI的"视觉基因"》---
🔍 生活化比喻
想象一个双语者的大脑。当她从单语环境切换到双语环境时,哪些神经元被"重新布线"了?哪些原本只处理语言的神经元现在开始处理视觉信息?如果我们能精确定位这些变化,是否就能控制她的语言能力、视觉理解,甚至阻止某些不安全的想法?
MMDiff就是这样一把"解剖刀"——它追踪多模态训练如何改变语言模型的内部结构。
---
📖 循序渐进
🌱 第一阶段:稀疏自编码器(SAE)——AI的显微镜
神经网络就像一个黑箱。SAE就像一台显微镜,能把神经网络的激活状态分解成可解释的特征方向。
比如,某个特征方向可能对应:
- "红色的圆形物体"
- "文字'危险'"
- "空间关系'在...上方'"
🌿 第二阶段:模型差异比较(Model Diffing)
但问题在于:当你直接在多模态模型上训练SAE时,得到的是一团混乱——既有继承自语言模型的特征,也有多模态训练新增的特征,混在一起难以区分。
MMDiff的解决方案:比较两个版本的SAE: 1. 基础语言模型SAE(只处理文本) 2. 多模态适应SAE(处理图文)
通过对比,找出被多模态训练"改写"的特征。
🌳 第三阶段:特征级控制
找到这些特征后,MMDiff可以:
- 因果移除(Causal Removal):精确定位并移除某个特征,观察特定能力是否下降
- 方向操控(Steering):增强或抑制某个特征,提升或降低对应能力
🔬 科学严谨
技术pipeline
1. 多模态SAE训练 从基础语言模型的SAE出发,在多模态数据上继续训练,保持特征索引对齐。
2. 适应特征识别 通过两个信号筛选:
- 几何重定向:decoder方向的余弦相似度(低相似度 = 大幅改变)
- 视觉能量:在视觉输入下的平均激活强度
- 比较目标分布(如空间推理问题)和基线分布(普通VQA)
- 筛选在目标分布上显著更活跃的特征
- 通过词汇不变性检验,排除纯文本提示的干扰
实验结果
在三个MLLM家族上验证(LLaVA-MORE, PaliGemma 2, InternVL3.5):
| 任务 | 因果移除效果 | 操控提升 |
|---|---|---|
| 空间推理 | -12% | +3.6% |
| OCR | -17% | +1.8% |
| 多模态安全 | ASR降低24% | — |
---
🎨 文学趣味
> "MMDiff像是一位神经考古学家,在多层Transformer的废墟中挖掘——不是寻找完整的文明,而是寻找那些被多模态训练'改写'的神经元指纹。每一个被识别的特征,都是通往AI内心世界的一扇窗。"
---
*解读:小凯 | 费曼风格深度解读* #论文 #arXiv #CV #可解释性 #SAE #小凯