一、一个尴尬的现状
假设你有个 1B 参数的小模型,让它判断邮件是不是垃圾邮件。它的准确率大概 57%——比抛硬币强不了多少。
你知道问题出在哪吗?模型内部其实"知道"答案,只是这个知识被埋在了错误的层、错误的位置,信号太弱,最终决策翻车了。
激活转向(Activation Steering)就是干这个的:在模型推理时,往残差流里加一个方向向量,把模型的判断"推"一把。但问题来了——
往哪一层加?加哪个注意力头?加多强?
目前的做法是:人工试。研究者凭直觉选一个中间层,算一个对比方向,调一个幅度参数。这就像调老式收音机——旋钮转得太快会跳过电台,太慢又找不到信号。更关键的是,不同模型、不同任务需要完全不同的参数,人工调参根本不 scale。
今天这篇论文来自美国海军水面战中心,叫 Deep Noir,做了一件漂亮的事:把这套手艺变成了自动化诊断流程。
二、核心创新:架构年代测定(Architectural Chronometry)
这个名字起得好。"年代测定"——考古学家用碳-14 测定文物的年代,Deep Noir 用 Logit Lens 测定模型在"哪一层"把一个语义概念从不确定变成确定。
直觉是这样的:一个 16 层的 Transformer 处理一封邮件,"这是 spam"这个判断不是在所有层同时发生的。在浅层,模型还在搞清楚语法;在中层,语义开始浮现;在某一层,"spam vs ham"的决策突然 crystallize——概率从五五开跳到九一开。
找到这个"crystallization 点",就是找到了该干预的位置。
具体怎么做?Deep Noir 设计了一个五阶段"转向发现引擎":
Phase 1:层排名
对每一层 l 算两个分数:
- Logit Lens 分化度:把第 l 层的隐藏状态投影到 unembedding 矩阵,看目标 token("spam")和反 token("ham")的概率差。差越大,说明这层越接近决策点。
- 对抗头强度:对每个注意力头,算它的输出和目标方向的内积。内积越大,这个头越"反对"目标——找到最强的对抗头,就知道阻力在哪。
两个分数加权(0.4 : 0.6)合成层得分,取 top-5 层进入下一阶段。
有意思的是,作者做了 7 种权重比的消融实验,发现排名对权重比完全不变——不管你怎么调 0.4:0.6 还是 0.3:0.7,选出来的 top 层一模一样。这说明信号足够强,线性组合只是个形式。
Phase 2:头隔离
对候选层的每个注意力头,算梯度 ∇L/∇h——这个头对损失的贡献有多大。取梯度最大的 top-K 个头(K ∈ {1, 2, 4}),构造二值 mask,只在这些头的维度上做干预。
为什么这一步关键? 后面的消融实验会证明:去掉头 mask,全局转向会让 Llama 的准确率掉到 baseline 以下(-5%)。因为全局转向会"污染"那些本来在正确工作的头——就像做手术不区分健康组织和病灶,一刀切下去比不切还糟。
Phase 3:方向计算
在 l+1 层(干预点的下游)收集正负样本的隐藏状态均值,做差得到对比方向,归一化。
Phase 4:幅度校准
黄金分割搜索(golden-section search)在 M ∈ [0.01, 20] 区间找最优幅度。每次评估就是跑一遍前向传播测准确率。
Phase 5:选择
选准确率最高的配置,平局时偏好更少的头和更低的幅度——奥卡姆剃刀。
三、实验结果:从 1B 到 9B 的系统性验证
主结果
| 模型规模 | 任务 | Baseline | Steered | 提升 |
|---|---|---|---|---|
| 1B (3模型×39runs) | Spam | 60.1% | 76.7% | +16.7 ± 4.7 |
| 1B (3模型×15runs) | SST-2 | 69.5% | 82.5% | +13.1 ± 3.0 |
| 2-3B | Spam | 54.4% | 83.4% | +28.0 |
| 7-9B (4模型) | Spam | 50.3% | 79.0% | +28.7 |
| 7-9B (4模型) | SST-2 | 89.8% | 93.2% | +3.4 |
几个关键数字:
- Gemma-2-9B 在 spam 上从 52% 飙到 94.4%(+42.4 pts)——这已经不是微调,是脱胎换骨
- 39 次 spam 发现运行中,33 次显著提升(85% 成功率)
- 15 次 sentiment 运行,15/15 全部提升(100% 成功率)
对比 RepE:为什么"组合"比"单组件"强
RepE(Representation Engineering)是当前主流的激活转向方法:算一个对比方向,固定在中间层施加,不做头 mask。
结果对比:
| 模型 | Baseline | RepE | Deep Noir | Δ |
|---|---|---|---|---|
| Llama-3.2-1B | 56.8% | 67.6% | 70.4% | +2.8 |
| OLMo-1B | 51.6% | 59.0% | 66.4% | +7.4 (p=0.028) |
| Gemma-3-1B | 51.2% | 55.6% | 76.4% | +20.8 (p=0.004) |
在 spam 上 Deep Noir 略胜 RepE。但真正的杀手锏在 sentiment:
RepE 在 SST-2 上 15 个 fold 全部失败——准确率 = baseline,零提升。Deep Noir 15/15 全部显著提升。
为什么?论文给出了清晰的机制解释:
"Sentiment representations are distributed across layers (L=12–19) rather than concentrated at the mid-layer where RepE applies its direction."
RepE 固定在中间层干预,但情感判断不是在中间层 crystallize 的——它分布在更靠后的多层。RepE 的"一刀切"策略在 spam 上碰巧有效(spam 确实在中间层集中),在 sentiment 上完全失效。
Deep Noir 的 Logit Lens 扫描自动发现了这个差异:Llama 的 spam 层在 2-14,sentiment 层在 12-15;Gemma 的 spam 层在 9-24,sentiment 层在 18-19。同一引擎,零代码修改,自动适配不同任务的表征结构。
消融实验:每个组件都不可或缺
| 去掉什么 | Llama | OLMo | Gemma |
|---|---|---|---|
| 完整 Deep Noir | +21 | +20 | +26 |
| 去掉头 mask | -5 | +3 | -1 |
| 去掉幅度校准 | -11 | +3 | 0 |
| 去掉层排名 | +9 | +14 | +1 |
| RepE (grid search) | +10 | +9 | +2 |
去掉头 mask 比 baseline 还差——全局转向引入的"破坏性干扰"比不干预更糟。去掉层排名只剩 +9%(vs +21%),说明 Logit Lens 层排名贡献了一半以上的增益。
这不是"三个组件各贡献一点"的加法关系,是"缺一个就不行"的乘法关系。
四、LayerNorm 洗白效应:为什么权重空间修正行不通
论文有一个漂亮的"失败实验":他们最初想走权重空间路线——用 SVD 算一个 rank-r 的权重更新,让 ΔW·h ≈ v(目标激活增量)。
结果:所有配置零提升。
根因是 LayerNorm。残差连接后的 LayerNorm 会把激活归一化,权重空间的小扰动(0.01-0.1% 的 ‖W‖_F)经过 LayerNorm 后被衰减约 1000 倍,产生 < 0.001 的 logit 位移——而翻转决策需要 2-4 个 logit 的位移。差了 3-4 个数量级。
LayerNorm 就像一个"洗白器"——权重空间的小改动在经过它之后被抹平了。
这个发现独立验证了之前的研究(arXiv:2507.02559):去掉 LayerNorm 后直接编辑权重是可行的。但 Deep Noir 选择了另一条路——激活空间 hook 在 LayerNorm 之前注入扰动,绕过了这个瓶颈。
这和"代理目标陷阱"谱系完美共鸣:优化权重接近度(代理目标)≠ 优化激活效果(真实目标),中间隔着一个 LayerNorm 的非线性变换。
五、架构校正拓扑:每个模型有自己的"指纹"
Deep Noir 发现每个架构有稳定的"校正拓扑"——偏好干预的层范围:
- Llama:偏早/中层(spam: 2-14, sentiment: 12-15)
- OLMo:偏后层(spam: 9-15, sentiment: 12-14)
- Gemma:偏深层(spam: 9-24, sentiment: 18-19)
这个拓扑在种子间稳定(5 个种子中 4 个选同一层),在任务间保持相对顺序(Llama 总是偏早,Gemma 总是偏深)。
每个模型的"校正拓扑"就像指纹——独特、稳定、可预测。 这和"载流图谱"谱系共鸣:信息在 Transformer 中的流动路径不是均匀的,不同架构有不同的"信息汇聚点",找到这些汇聚点就找到了干预的入口。
六、注入攻击面:转向的代价
论文最让人警醒的发现:激活转向会创造一个可预测的注入攻击面,且脆弱性随转向幅度单调递增。
定义脆弱性函数 V(M) = E[注入成功 | 幅度 M],实验显示 V(M) 对 M 单调非递减:
- OLMo 从 V(0) = 0.34 升到 V(4M*) = 1.0
- Gemma 从 0.25 升到 0.99
这意味着:你转向越强,准确率越高,但也越容易被 prompt injection 攻击。 存在一个 Pareto 前沿——准确率和安全性的权衡曲线。
但有一个反直觉的发现:在 7B 规模上,转向反而降低了注入脆弱性(Mistral 从 97.5% 降到 61.1%,-36.4 pts)。大模型的基础分类能力更强,转向是在加固而非削弱。
注入攻击面主要是小模型现象,随规模递减。
这对 Agent 系统的启示很直接:如果你用 1B 模型做分类器并施加了转向,你的分类器变成了更容易被注入的对象。防御必须在转向层之前实施。
七、为什么"组合"比"单组件"强:因子分析视角
论文最深刻的贡献不是某个数字,而是这个发现:
"RepE (no head masking) fails to improve over baseline on sentiment, while the full pipeline succeeds."
RepE = 对比方向 + 固定层 + 无 mask
Deep Noir = 对比方向 + Logit Lens 层排名 + 头 mask + 幅度校准
单独看每个组件:
- 对比方向(RepE 有):在 sentiment 上零提升
- 层排名(去掉其他组件):+9%(vs +21%)
- 头 mask(去掉其他组件):-5%(比 baseline 还差)
- 幅度校准(去掉其他组件):-11%
每个组件单独使用都不行,组合起来却实现了 1+1+1+1 >> 4 的效果。
这不是简单的加法——这是"质变型组合":每个组件解决一个其他组件无法解决的问题,缺一不可。Logit Lens 找到"在哪干预",头 mask 解决"只干预该干预的",幅度校准确保"干预力度刚好",对比方向提供"往哪个方向推"。
这和"因子分析思维"谱系共鸣:把"激活转向"这个看似单一的方法拆成四个正交维度(位置、范围、力度、方向),用消融实验分离每个维度的贡献。看似简单的技术背后有被混为一谈的多个维度,拆开看才能理解为什么"有时候管用、有时候不管用"。
八、个人思考
1. 白盒方法复兴的又一例证
Deep Noir 的核心工具——Logit Lens 和 attribution patching——都是白盒方法。它不靠黑盒搜索(如 grid search 或 Bayesian optimization),而是直接读模型内部状态来决策。成本:发现一次配置需要 4-30 分钟,但这是一次性的,之后推理零开销。对比 RepE 的 grid search(15 秒但效果差得多),白盒方法的"慢但准"策略再次胜出。
2. "诊断先于干预"的工程哲学
Deep Noir 的五阶段流程本质上是一个"诊断 → 治疗"的医学模型:先用 Logit Lens 做"脑电图定位"找到病灶,再用头 mask 做"精准手术",最后用幅度校准"调节剂量"。对比 RepE 的"盲打一针看效果",诊断先行的策略在跨任务泛化上碾压式胜出。
3. 转向的"安全税"
注入攻击面的发现是一个重要的工程警示。在 Agent 系统中,如果用转向来调整分类器行为,必须同时部署注入防御(在转向层之前)。好消息是:大模型上转向反而降低脆弱性,说明 scale 是最好的防御。
4. 局限性
论文坦诚承认:最强于二分类(spam/sentiment),推理任务因 baseline 接近随机(22-31%)而效果有限(≤3%)。这设定了方法的适用边界——模型必须"部分编码"了目标区分,转向才能放大信号。如果模型根本不知道答案,转向也无从放大。
九、论文信息
- 标题:Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models
- 作者:Frank E. Bobe III, Gregory D. Vetaw, Darshan W. Bryner, Matthew G. Cook, Jose L. Salas-Vernis
- 机构:Naval Surface Warfare Center Panama City Division
- arXiv:2609.20722
- 代码:未开源(军事研究机构)
一句话总结:Deep Noir 用 Logit Lens 做"架构年代测定",自动发现每个模型独特的"校正拓扑",把激活转向从手艺变成诊断流程——在 1B 上 +16.7 pts,9B 上 +42.4 pts,且揭示了转向的注入攻击面随幅度单调递增的安全代价。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。