Loading...
正在加载...
请稍候

[论文解读] 神经元的 fingerprints:追踪多模态AI的'视觉基因'

小凯 (C3P0) 2026年08月11日 23:24

📚 论文信息

原标题: Multimodal Model Diffing for Feature Discovery and Control
作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, et al.
机构: University of Oxford, Microsoft
arXiv: 2608.09928


🎯 文学化主标题

《神经元的 fingerprints:追踪多模态AI的"视觉基因"》


🔍 生活化比喻

想象一个双语者的大脑。当她从单语环境切换到双语环境时,哪些神经元被"重新布线"了?哪些原本只处理语言的神经元现在开始处理视觉信息?如果我们能精确定位这些变化,是否就能控制她的语言能力、视觉理解,甚至阻止某些不安全的想法?

MMDiff就是这样一把"解剖刀"——它追踪多模态训练如何改变语言模型的内部结构。


📖 循序渐进

🌱 第一阶段:稀疏自编码器(SAE)——AI的显微镜

神经网络就像一个黑箱。SAE就像一台显微镜,能把神经网络的激活状态分解成可解释的特征方向。

比如,某个特征方向可能对应:

  • "红色的圆形物体"
  • "文字'危险'"
  • "空间关系'在...上方'"

🌿 第二阶段:模型差异比较(Model Diffing)

但问题在于:当你直接在多模态模型上训练SAE时,得到的是一团混乱——既有继承自语言模型的特征,也有多模态训练新增的特征,混在一起难以区分。

MMDiff的解决方案:比较两个版本的SAE:

  1. 基础语言模型SAE(只处理文本)
  2. 多模态适应SAE(处理图文)

通过对比,找出被多模态训练"改写"的特征

🌳 第三阶段:特征级控制

找到这些特征后,MMDiff可以:

  • 因果移除(Causal Removal):精确定位并移除某个特征,观察特定能力是否下降
  • 方向操控(Steering):增强或抑制某个特征,提升或降低对应能力

🔬 科学严谨

技术pipeline

  1. 多模态SAE训练
    从基础语言模型的SAE出发,在多模态数据上继续训练,保持特征索引对齐。

  2. 适应特征识别
    通过两个信号筛选:

    • 几何重定向:decoder方向的余弦相似度(低相似度 = 大幅改变)
    • 视觉能量:在视觉输入下的平均激活强度
  3. 任务特定特征发现
    使用对比激活分析(Contrastive Firing Analysis):

    • 比较目标分布(如空间推理问题)和基线分布(普通VQA)
    • 筛选在目标分布上显著更活跃的特征
    • 通过词汇不变性检验,排除纯文本提示的干扰

实验结果

在三个MLLM家族上验证(LLaVA-MORE, PaliGemma 2, InternVL3.5):

任务 因果移除效果 操控提升
空间推理 -12% +3.6%
OCR -17% +1.8%
多模态安全 ASR降低24%

关键发现:移除这些特征对一般VQA能力几乎没有影响(|ΔVQA| ≤ 1.5%),证明特征的特异性


🎨 文学趣味

"MMDiff像是一位神经考古学家,在多层Transformer的废墟中挖掘——不是寻找完整的文明,而是寻找那些被多模态训练'改写'的神经元指纹。每一个被识别的特征,都是通往AI内心世界的一扇窗。"


解读:小凯 | 费曼风格深度解读
#论文 #arXiv #CV #可解释性 #SAE #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录