📚 论文信息
原标题: Multimodal Model Diffing for Feature Discovery and Control
作者: Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, et al.
机构: University of Oxford, Microsoft
arXiv: 2608.09928
🎯 文学化主标题
《神经元的 fingerprints:追踪多模态AI的"视觉基因"》
🔍 生活化比喻
想象一个双语者的大脑。当她从单语环境切换到双语环境时,哪些神经元被"重新布线"了?哪些原本只处理语言的神经元现在开始处理视觉信息?如果我们能精确定位这些变化,是否就能控制她的语言能力、视觉理解,甚至阻止某些不安全的想法?
MMDiff就是这样一把"解剖刀"——它追踪多模态训练如何改变语言模型的内部结构。
📖 循序渐进
🌱 第一阶段:稀疏自编码器(SAE)——AI的显微镜
神经网络就像一个黑箱。SAE就像一台显微镜,能把神经网络的激活状态分解成可解释的特征方向。
比如,某个特征方向可能对应:
- "红色的圆形物体"
- "文字'危险'"
- "空间关系'在...上方'"
🌿 第二阶段:模型差异比较(Model Diffing)
但问题在于:当你直接在多模态模型上训练SAE时,得到的是一团混乱——既有继承自语言模型的特征,也有多模态训练新增的特征,混在一起难以区分。
MMDiff的解决方案:比较两个版本的SAE:
- 基础语言模型SAE(只处理文本)
- 多模态适应SAE(处理图文)
通过对比,找出被多模态训练"改写"的特征。
🌳 第三阶段:特征级控制
找到这些特征后,MMDiff可以:
- 因果移除(Causal Removal):精确定位并移除某个特征,观察特定能力是否下降
- 方向操控(Steering):增强或抑制某个特征,提升或降低对应能力
🔬 科学严谨
技术pipeline
-
多模态SAE训练
从基础语言模型的SAE出发,在多模态数据上继续训练,保持特征索引对齐。 -
适应特征识别
通过两个信号筛选:- 几何重定向:decoder方向的余弦相似度(低相似度 = 大幅改变)
- 视觉能量:在视觉输入下的平均激活强度
-
任务特定特征发现
使用对比激活分析(Contrastive Firing Analysis):- 比较目标分布(如空间推理问题)和基线分布(普通VQA)
- 筛选在目标分布上显著更活跃的特征
- 通过词汇不变性检验,排除纯文本提示的干扰
实验结果
在三个MLLM家族上验证(LLaVA-MORE, PaliGemma 2, InternVL3.5):
| 任务 | 因果移除效果 | 操控提升 |
|---|---|---|
| 空间推理 | -12% | +3.6% |
| OCR | -17% | +1.8% |
| 多模态安全 | ASR降低24% | — |
关键发现:移除这些特征对一般VQA能力几乎没有影响(|ΔVQA| ≤ 1.5%),证明特征的特异性。
🎨 文学趣味
"MMDiff像是一位神经考古学家,在多层Transformer的废墟中挖掘——不是寻找完整的文明,而是寻找那些被多模态训练'改写'的神经元指纹。每一个被识别的特征,都是通往AI内心世界的一扇窗。"
解读:小凯 | 费曼风格深度解读
#论文 #arXiv #CV #可解释性 #SAE #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。