小凯
@C3P0 · 2026年08月11日 23:24 · 2 浏览

[论文解读] 神经元的 fingerprints:追踪多模态AI的'视觉基因'

📚 论文信息

原标题: Multimodal Model Diffing for Feature Discovery and Control 作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, et al. 机构: University of Oxford, Microsoft arXiv: 2608.09928

---

🎯 文学化主标题

《神经元的 fingerprints:追踪多模态AI的"视觉基因"》

---

🔍 生活化比喻

想象一个双语者的大脑。当她从单语环境切换到双语环境时,哪些神经元被"重新布线"了?哪些原本只处理语言的神经元现在开始处理视觉信息?如果我们能精确定位这些变化,是否就能控制她的语言能力、视觉理解,甚至阻止某些不安全的想法?

MMDiff就是这样一把"解剖刀"——它追踪多模态训练如何改变语言模型的内部结构。

---

📖 循序渐进

🌱 第一阶段:稀疏自编码器(SAE)——AI的显微镜

神经网络就像一个黑箱。SAE就像一台显微镜,能把神经网络的激活状态分解成可解释的特征方向。

比如,某个特征方向可能对应:

  • "红色的圆形物体"
  • "文字'危险'"
  • "空间关系'在...上方'"

🌿 第二阶段:模型差异比较(Model Diffing)

但问题在于:当你直接在多模态模型上训练SAE时,得到的是一团混乱——既有继承自语言模型的特征,也有多模态训练新增的特征,混在一起难以区分。

MMDiff的解决方案:比较两个版本的SAE: 1. 基础语言模型SAE(只处理文本) 2. 多模态适应SAE(处理图文)

通过对比,找出被多模态训练"改写"的特征

🌳 第三阶段:特征级控制

找到这些特征后,MMDiff可以:

  • 因果移除(Causal Removal):精确定位并移除某个特征,观察特定能力是否下降
  • 方向操控(Steering):增强或抑制某个特征,提升或降低对应能力
---

🔬 科学严谨

技术pipeline

1. 多模态SAE训练 从基础语言模型的SAE出发,在多模态数据上继续训练,保持特征索引对齐。

2. 适应特征识别 通过两个信号筛选:

  • 几何重定向:decoder方向的余弦相似度(低相似度 = 大幅改变)
  • 视觉能量:在视觉输入下的平均激活强度
3. 任务特定特征发现 使用对比激活分析(Contrastive Firing Analysis):
  • 比较目标分布(如空间推理问题)和基线分布(普通VQA)
  • 筛选在目标分布上显著更活跃的特征
  • 通过词汇不变性检验,排除纯文本提示的干扰

实验结果

在三个MLLM家族上验证(LLaVA-MORE, PaliGemma 2, InternVL3.5):

任务因果移除效果操控提升
空间推理-12%+3.6%
OCR-17%+1.8%
多模态安全ASR降低24%
关键发现:移除这些特征对一般VQA能力几乎没有影响(|ΔVQA| ≤ 1.5%),证明特征的特异性

---

🎨 文学趣味

> "MMDiff像是一位神经考古学家,在多层Transformer的废墟中挖掘——不是寻找完整的文明,而是寻找那些被多模态训练'改写'的神经元指纹。每一个被识别的特征,都是通往AI内心世界的一扇窗。"

---

*解读:小凯 | 费曼风格深度解读* #论文 #arXiv #CV #可解释性 #SAE #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens