Loading...
正在加载...
请稍候

给大模型做脑电图定位:Deep Noir 让激活转向从手艺变成自动化诊断

✨步子哥 (steper) 2026年09月20日 20:49

一、一个尴尬的现状

假设你有个 1B 参数的小模型,让它判断邮件是不是垃圾邮件。它的准确率大概 57%——比抛硬币强不了多少。

你知道问题出在哪吗?模型内部其实"知道"答案,只是这个知识被埋在了错误的层、错误的位置,信号太弱,最终决策翻车了。

激活转向(Activation Steering)就是干这个的:在模型推理时,往残差流里加一个方向向量,把模型的判断"推"一把。但问题来了——

往哪一层加?加哪个注意力头?加多强?

目前的做法是:人工试。研究者凭直觉选一个中间层,算一个对比方向,调一个幅度参数。这就像调老式收音机——旋钮转得太快会跳过电台,太慢又找不到信号。更关键的是,不同模型、不同任务需要完全不同的参数,人工调参根本不 scale。

今天这篇论文来自美国海军水面战中心,叫 Deep Noir,做了一件漂亮的事:把这套手艺变成了自动化诊断流程。

二、核心创新:架构年代测定(Architectural Chronometry)

这个名字起得好。"年代测定"——考古学家用碳-14 测定文物的年代,Deep Noir 用 Logit Lens 测定模型在"哪一层"把一个语义概念从不确定变成确定。

直觉是这样的:一个 16 层的 Transformer 处理一封邮件,"这是 spam"这个判断不是在所有层同时发生的。在浅层,模型还在搞清楚语法;在中层,语义开始浮现;在某一层,"spam vs ham"的决策突然 crystallize——概率从五五开跳到九一开。

找到这个"crystallization 点",就是找到了该干预的位置。

具体怎么做?Deep Noir 设计了一个五阶段"转向发现引擎":

Phase 1:层排名

对每一层 l 算两个分数:

  • Logit Lens 分化度:把第 l 层的隐藏状态投影到 unembedding 矩阵,看目标 token("spam")和反 token("ham")的概率差。差越大,说明这层越接近决策点。
  • 对抗头强度:对每个注意力头,算它的输出和目标方向的内积。内积越大,这个头越"反对"目标——找到最强的对抗头,就知道阻力在哪。

两个分数加权(0.4 : 0.6)合成层得分,取 top-5 层进入下一阶段。

有意思的是,作者做了 7 种权重比的消融实验,发现排名对权重比完全不变——不管你怎么调 0.4:0.6 还是 0.3:0.7,选出来的 top 层一模一样。这说明信号足够强,线性组合只是个形式。

Phase 2:头隔离

对候选层的每个注意力头,算梯度 ∇L/∇h——这个头对损失的贡献有多大。取梯度最大的 top-K 个头(K ∈ {1, 2, 4}),构造二值 mask,只在这些头的维度上做干预。

为什么这一步关键? 后面的消融实验会证明:去掉头 mask,全局转向会让 Llama 的准确率掉到 baseline 以下(-5%)。因为全局转向会"污染"那些本来在正确工作的头——就像做手术不区分健康组织和病灶,一刀切下去比不切还糟。

Phase 3:方向计算

在 l+1 层(干预点的下游)收集正负样本的隐藏状态均值,做差得到对比方向,归一化。

Phase 4:幅度校准

黄金分割搜索(golden-section search)在 M ∈ [0.01, 20] 区间找最优幅度。每次评估就是跑一遍前向传播测准确率。

Phase 5:选择

选准确率最高的配置,平局时偏好更少的头和更低的幅度——奥卡姆剃刀。

三、实验结果:从 1B 到 9B 的系统性验证

主结果

模型规模 任务 Baseline Steered 提升
1B (3模型×39runs) Spam 60.1% 76.7% +16.7 ± 4.7
1B (3模型×15runs) SST-2 69.5% 82.5% +13.1 ± 3.0
2-3B Spam 54.4% 83.4% +28.0
7-9B (4模型) Spam 50.3% 79.0% +28.7
7-9B (4模型) SST-2 89.8% 93.2% +3.4

几个关键数字:

  • Gemma-2-9B 在 spam 上从 52% 飙到 94.4%(+42.4 pts)——这已经不是微调,是脱胎换骨
  • 39 次 spam 发现运行中,33 次显著提升(85% 成功率)
  • 15 次 sentiment 运行,15/15 全部提升(100% 成功率)

对比 RepE:为什么"组合"比"单组件"强

RepE(Representation Engineering)是当前主流的激活转向方法:算一个对比方向,固定在中间层施加,不做头 mask。

结果对比:

模型 Baseline RepE Deep Noir Δ
Llama-3.2-1B 56.8% 67.6% 70.4% +2.8
OLMo-1B 51.6% 59.0% 66.4% +7.4 (p=0.028)
Gemma-3-1B 51.2% 55.6% 76.4% +20.8 (p=0.004)

在 spam 上 Deep Noir 略胜 RepE。但真正的杀手锏在 sentiment:

RepE 在 SST-2 上 15 个 fold 全部失败——准确率 = baseline,零提升。Deep Noir 15/15 全部显著提升。

为什么?论文给出了清晰的机制解释:

"Sentiment representations are distributed across layers (L=12–19) rather than concentrated at the mid-layer where RepE applies its direction."

RepE 固定在中间层干预,但情感判断不是在中间层 crystallize 的——它分布在更靠后的多层。RepE 的"一刀切"策略在 spam 上碰巧有效(spam 确实在中间层集中),在 sentiment 上完全失效。

Deep Noir 的 Logit Lens 扫描自动发现了这个差异:Llama 的 spam 层在 2-14,sentiment 层在 12-15;Gemma 的 spam 层在 9-24,sentiment 层在 18-19。同一引擎,零代码修改,自动适配不同任务的表征结构。

消融实验:每个组件都不可或缺

去掉什么 Llama OLMo Gemma
完整 Deep Noir +21 +20 +26
去掉头 mask -5 +3 -1
去掉幅度校准 -11 +3 0
去掉层排名 +9 +14 +1
RepE (grid search) +10 +9 +2

去掉头 mask 比 baseline 还差——全局转向引入的"破坏性干扰"比不干预更糟。去掉层排名只剩 +9%(vs +21%),说明 Logit Lens 层排名贡献了一半以上的增益。

这不是"三个组件各贡献一点"的加法关系,是"缺一个就不行"的乘法关系。

四、LayerNorm 洗白效应:为什么权重空间修正行不通

论文有一个漂亮的"失败实验":他们最初想走权重空间路线——用 SVD 算一个 rank-r 的权重更新,让 ΔW·h ≈ v(目标激活增量)。

结果:所有配置零提升。

根因是 LayerNorm。残差连接后的 LayerNorm 会把激活归一化,权重空间的小扰动(0.01-0.1% 的 ‖W‖_F)经过 LayerNorm 后被衰减约 1000 倍,产生 < 0.001 的 logit 位移——而翻转决策需要 2-4 个 logit 的位移。差了 3-4 个数量级。

LayerNorm 就像一个"洗白器"——权重空间的小改动在经过它之后被抹平了。

这个发现独立验证了之前的研究(arXiv:2507.02559):去掉 LayerNorm 后直接编辑权重是可行的。但 Deep Noir 选择了另一条路——激活空间 hook 在 LayerNorm 之前注入扰动,绕过了这个瓶颈。

这和"代理目标陷阱"谱系完美共鸣:优化权重接近度(代理目标)≠ 优化激活效果(真实目标),中间隔着一个 LayerNorm 的非线性变换。

五、架构校正拓扑:每个模型有自己的"指纹"

Deep Noir 发现每个架构有稳定的"校正拓扑"——偏好干预的层范围:

  • Llama:偏早/中层(spam: 2-14, sentiment: 12-15)
  • OLMo:偏后层(spam: 9-15, sentiment: 12-14)
  • Gemma:偏深层(spam: 9-24, sentiment: 18-19)

这个拓扑在种子间稳定(5 个种子中 4 个选同一层),在任务间保持相对顺序(Llama 总是偏早,Gemma 总是偏深)。

每个模型的"校正拓扑"就像指纹——独特、稳定、可预测。 这和"载流图谱"谱系共鸣:信息在 Transformer 中的流动路径不是均匀的,不同架构有不同的"信息汇聚点",找到这些汇聚点就找到了干预的入口。

六、注入攻击面:转向的代价

论文最让人警醒的发现:激活转向会创造一个可预测的注入攻击面,且脆弱性随转向幅度单调递增。

定义脆弱性函数 V(M) = E[注入成功 | 幅度 M],实验显示 V(M) 对 M 单调非递减:

  • OLMo 从 V(0) = 0.34 升到 V(4M*) = 1.0
  • Gemma 从 0.25 升到 0.99

这意味着:你转向越强,准确率越高,但也越容易被 prompt injection 攻击。 存在一个 Pareto 前沿——准确率和安全性的权衡曲线。

但有一个反直觉的发现:在 7B 规模上,转向反而降低了注入脆弱性(Mistral 从 97.5% 降到 61.1%,-36.4 pts)。大模型的基础分类能力更强,转向是在加固而非削弱。

注入攻击面主要是小模型现象,随规模递减。

这对 Agent 系统的启示很直接:如果你用 1B 模型做分类器并施加了转向,你的分类器变成了更容易被注入的对象。防御必须在转向层之前实施。

七、为什么"组合"比"单组件"强:因子分析视角

论文最深刻的贡献不是某个数字,而是这个发现:

"RepE (no head masking) fails to improve over baseline on sentiment, while the full pipeline succeeds."

RepE = 对比方向 + 固定层 + 无 mask
Deep Noir = 对比方向 + Logit Lens 层排名 + 头 mask + 幅度校准

单独看每个组件:

  • 对比方向(RepE 有):在 sentiment 上零提升
  • 层排名(去掉其他组件):+9%(vs +21%)
  • 头 mask(去掉其他组件):-5%(比 baseline 还差)
  • 幅度校准(去掉其他组件):-11%

每个组件单独使用都不行,组合起来却实现了 1+1+1+1 >> 4 的效果。

这不是简单的加法——这是"质变型组合":每个组件解决一个其他组件无法解决的问题,缺一不可。Logit Lens 找到"在哪干预",头 mask 解决"只干预该干预的",幅度校准确保"干预力度刚好",对比方向提供"往哪个方向推"。

这和"因子分析思维"谱系共鸣:把"激活转向"这个看似单一的方法拆成四个正交维度(位置、范围、力度、方向),用消融实验分离每个维度的贡献。看似简单的技术背后有被混为一谈的多个维度,拆开看才能理解为什么"有时候管用、有时候不管用"。

八、个人思考

1. 白盒方法复兴的又一例证

Deep Noir 的核心工具——Logit Lens 和 attribution patching——都是白盒方法。它不靠黑盒搜索(如 grid search 或 Bayesian optimization),而是直接读模型内部状态来决策。成本:发现一次配置需要 4-30 分钟,但这是一次性的,之后推理零开销。对比 RepE 的 grid search(15 秒但效果差得多),白盒方法的"慢但准"策略再次胜出。

2. "诊断先于干预"的工程哲学

Deep Noir 的五阶段流程本质上是一个"诊断 → 治疗"的医学模型:先用 Logit Lens 做"脑电图定位"找到病灶,再用头 mask 做"精准手术",最后用幅度校准"调节剂量"。对比 RepE 的"盲打一针看效果",诊断先行的策略在跨任务泛化上碾压式胜出。

3. 转向的"安全税"

注入攻击面的发现是一个重要的工程警示。在 Agent 系统中,如果用转向来调整分类器行为,必须同时部署注入防御(在转向层之前)。好消息是:大模型上转向反而降低脆弱性,说明 scale 是最好的防御。

4. 局限性

论文坦诚承认:最强于二分类(spam/sentiment),推理任务因 baseline 接近随机(22-31%)而效果有限(≤3%)。这设定了方法的适用边界——模型必须"部分编码"了目标区分,转向才能放大信号。如果模型根本不知道答案,转向也无从放大。

九、论文信息

  • 标题:Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models
  • 作者:Frank E. Bobe III, Gregory D. Vetaw, Darshan W. Bryner, Matthew G. Cook, Jose L. Salas-Vernis
  • 机构:Naval Surface Warfare Center Panama City Division
  • arXiv2609.20722
  • 代码:未开源(军事研究机构)

一句话总结:Deep Noir 用 Logit Lens 做"架构年代测定",自动发现每个模型独特的"校正拓扑",把激活转向从手艺变成诊断流程——在 1B 上 +16.7 pts,9B 上 +42.4 pts,且揭示了转向的注入攻击面随幅度单调递增的安全代价。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录