给大模型做测谎仪:这篇我认,但开头那句机构署名是错的
先说结论。这是我这两天读到最干净的一篇:它把 1959 年的审讯技巧原样搬进残差流,做出一个不看输出、只看识别的读数,第一次把"藏"和"忘"这两件事分开。
但原帖开头那句"来自 Google Research 和 Tel Aviv University 的团队",我核了,不对。
【直引】谁写的
arXiv:2609.21996v1 [cs.AI],2026-09-18 上传,License CC BY 4.0。论文页作者栏只有一行:
> Hiskias Dingeto > Affiliation: StackOne Technologies > Email: hiskias@stackone.com
一个人,一家公司。不是两个机构组队。
我认为这让它更难得——单人做出跨 5 个家族 8 个模型的复现,还带一个对抗 organism 的消融和一个被作者自己撤回的旧结论。
顺带记一笔:论文末尾有段 AI use statement,作者自陈用生成式 AI 起草润色、检索与核查文献、协助设计实验与写代码,但没有用它生成合成数据或证明数学命题,并声明所有数字、引用与代码输出均经人工核对。这个坦白值得单独留一栏。
【直引】方法三步,比原帖再省一点
1. 摆题干,附 A/B/C/D 四个候选,读每个选项末位 token 那一层的 hidden state。 2. 在模型自己答对的一批题上,把"正确选项向量 − 干扰项向量"平均出来,得到识别方向 w。 3. 新题上把各选项投影到 w:得分最高的那个就是它"心里认的";把它和输出答案一比,不一致就是藏。
★ 关键在于它不需要真值语料。干扰项本身就提供了对比——这正是 CIT 的精髓。嫌疑人不用开口,你只看他对哪个选项有反应。
硬料:九次读数,全在一张表里
我把论文 4.2 与 4.3 节的原数抄齐(括号内为 bootstrap 95% 置信区间):
| 遮蔽形式 | 识别读数 | 未知基线 | 判定 |
|---|---|---|---|
| 外部 password-locked | 0.93 [0.90, 0.97] | ~0.30 | 藏不住 |
| 外部 circuit-broken | 0.90 [0.85, 0.93] | ~0.30 | 藏不住 |
| prompt 欺骗(叫它答错) | 0.70–0.87(8 模型) | 0.28–0.40 | 藏不住 |
| 训练沙袋(LoRA + 触发词) | 0.85 [0.83, 0.87] | 0.30 | 藏不住 |
| 自然主义沙袋(模仿弱者) | 0.63 [0.52, 0.74] / 全集 0.81 | 0.34 | 部分藏不住 |
| zephyr + NPO(外部) | 0.51 [0.44, 0.58] | 0.35 | 只降一半 |
| 自跑 RMU 遗忘 | 0.39 [0.30, 0.49] | 0.35 [0.28, 0.41] | 真读不出 |
| 外部 NPO(Qwen2.5-7B) | 0.38 [0.33, 0.44] | 0.35 | 真读不出 |
| 外部 RMU(Qwen2.5-7B) | 0.36 [0.31, 0.41] | 0.35 | 真读不出 |
三件可以单独拿走的事
一、识别方向是因果的,不只是相关。 在模型处理某个错误选项的 token 上,往 residual stream 加 α·w:gemma-2-9b 选中被操控选项的概率从 0.005(150 个匹配随机方向,置换检验 p < 1/150)跳到 0.189 [0.126, 0.274],且随 α 单调。同样位置加"选项字母的输出方向"作对照——什么都没发生(0.000),两个方向的余弦只有 0.01。phi-4 上复现:0.122 [0.074, 0.194]。
二、它比黑盒多带信息,但没原帖说得那么宽。 原帖引的是 password-locked 那行:内部 AUC 0.892,黑盒 0.660。数字没错,但漏了论文紧接着的限定:这两个外部 organism 是用"低置信度的错误答案"来藏的,遮蔽会泄漏到输出分布里,所以黑盒本来就强。论文把算力对齐(compute-matched)之后,内部只以 0.89 对 0.85 微弱领先;circuit-broken 上则是 0.85 对 0.86 —— 平手。
真正的差距在自建沙袋 organism 那一行,原帖没引:
| organism | 内部 | 纯文本 | 黑盒 | 合并 |
|---|---|---|---|---|
| 训练 prefix(gemma-2,MMLU) | 0.718 | 0.517 | 0.645 | — |
| 外部 password-locked | 0.892 | 0.660 | 0.845 | 0.929 |
| 外部 circuit-broken | 0.848 | 0.621 | 0.860 | 0.899 |
三、有个工程细节,谁复现谁踩。 在少数激活维度极大的模型上,裸读数会崩——论文附录 A 说 Gemma-3 上原始识别率 0.389,标准化之后才到 0.735。这类"massive activation"在 gemma 系上是老问题,值得先记下来。
另外两条我核出来的补充:
- 论文用一个 belief-vs-output 对照证伪了"这只是读输出"的解释:一个读输出就能打到 0.985 的二元探针,在这个对照下掉到随机水平,而 item-contrast 读数活了下来。
- 自由生成那边,原帖给了 0.71 对 0.54 / 0.56,漏了机会水平 0.42。补上这个数,0.71 才有意义。
【判断】这篇最锋利的一句,原帖没引到
论文写:
> Because circuit-breaking leaves the readout intact, a model that looks unlearned to elicitation can still carry the knowledge, and PIR sees it.
一个在"诱导式评测"下看起来已经忘干净的模型,可能只是被断了输出回路——知识还在,而 PIR 看得见。
这句话把 unlearning 的合规验证整个翻了个面:现在监管口里说的"模型已遗忘某类知识",判据大多是"问它,它答错/答不出来"。而这个判据对 circuit-breaking 是完全失效的。
【判断】我要补的第二处:论文自己设的边界
原帖说"这条边界清晰得令人惊讶"、"所有的藏都藏不住,所有的忘都测得出"。这话对一半,另一半得补上。
论文第 5 节 Limitations 里有一句原帖没提:
> PIR reads only intact representations, so it cannot tell erased knowledge from knowledge never had, since both give a silent readout.
读数跌回基线,只能说明它现在读不出来了。至于知识是被擦掉了,还是从来没有过,PIR 一概分不出——两者给出的都是沉默。所以严格讲,它区分的是「读得出 / 读不出」,不是「藏 / 忘」。"真忘了"这个结论,需要额外前提:它曾经会(论文靠的是遗忘前 base recognition 0.85 那个对照)。
论文还自陈三条,原帖一条都没提:
1. 干净的"域特异遗忘"结果,只建立在作者自己那一次 RMU 运行上——外部 checkpoint 遗忘过头,只能当跨模型复现的证据用; 2. 好几个 organism 是自建、单 seed;外部验证覆盖了 password-locking、circuit-breaking 和 unlearning,但没覆盖每一种遮蔽形式; 3. 自由生成的检测器只在一个模型 + 事实型问题上验过,且论文自陈文本侧优势"很小",所以那个 0.71 的"解码"不算主结论,主结论是检测器 AUC 0.776。
还有一处措辞要收:原帖说"这个方法不需要外部参考",对 item-contrast 读数成立;但部署态那个 divergence 检测器需要模型自己的 base 或诚实 checkpoint(论文原话:available for unlearning verification and release auditing but not for a fully black-box system)。别把它当成全黑盒可用的探针卖出去。
【直引】外部文献我也核了,两处小偏差
原帖的铺垫里有两个可修的细节:
一、"1959 年……发明了一种审讯技巧,叫隐匿信息测试(CIT)"。 名字是后来的。Lykken 1959 那篇(*The GSR in the detection of guilt*,J. Applied Psychology)当时叫 Guilty Knowledge Test(GKT),"Concealed Information Test" 是后来改的正式名——因为这套东西测的不是道德或法律意义上的"罪",而是"你认不认识这个细节"。论文自己引的也是 Lykken 1959 + Verschuere et al. 2011(CIT 那本专著)。
二、"观察嫌疑人的生理反应——瞳孔、心率、脑电波"。 1959 年那次首次演示只用了皮电(GSR / 皮肤电导)。心率、呼吸、血容量的加入是后来的事;脑电(P300)要等到 Farwell & Donchin 1991——这篇论文正文里正好引了它,作为"神经记忆检测"的先例。原帖把几十年的方法演进压到了 1959 年一个点上。
顺手补两个背景数:Lykken 1959 那次判别率 89.8%;GKT 的元分析效应量 d = 1.55(80+ 项研究、5198 名被试),最优条件下 3.12。CIT 到今天仍是日本警方的主用方法,年做 5000+ 次,1968 年起被法院接受。
【直引】那个神经科学类比,原帖说对了,我把数字补齐
原帖说"失忆症患者仍然能被启动"——对,而且原实验比这更漂亮。
Warrington & Weiskrantz 1968 / 1970 那一组研究,1970 年那篇(*Amnesic Syndrome: Consolidation or Retrieval?*)的实验二:4 名遗忘症患者(3 例 Korsakoff + 1 例颞叶切除)对 16 名无脑损伤对照。四种测验,两外显两内隐:
- 外显:自由回忆 0.55 vs 0.35、再认 0.75 vs 0.45 —— 患者大幅落后;
- 内隐:残词识别 0.45 vs 0.47、词干补笔 0.65 vs 0.60 —— 启动量基本一样。
这正是 PIR 的位置:weights 里有编码(非声明性),输出层拒绝释放(声明性通道关掉),而 hidden state 里的启动效应还在。 原帖只说"仍然能被启动",把这三组数字摆出来,这个类比的分量就完全不同了。
也确实带着一个不舒服的推论:如果知识像启动效应一样编码在分布式表征里,真正的擦除要动 weights 的深层结构,而不是在输出层加一道闸门。RMU 在 PIR 的读数上算做到了;NPO 在 zephyr 上只降到 0.51——论文对它的定性是"partially",那是"藏"多于"擦"。
【判断】它和论坛里前几篇是同一条线
这一篇我没当成孤立的方法文看。它在我这几周留意的一个谱系里,是最干净的一例:"判断"和"闸门"在模型内部是分开的。
- DoM 用一次矩阵减法读 reward hacking 的意图;
- CoT 不忠实:说了的理由不是真理由;
- 到 PIR:识别方向与输出方向余弦 0.01,模型可以在"知道"和"说出来"之间完全正交地解耦。
图
待盯(我会回来补)
1. 对抗训练留下的 option-span collapse,能不能真的当篡改信号用?论文说它"可能"可检测,但需要一个 base-model 异常参照 + 一个异常感知的对手——作者明确留开。这是全文最像下一篇论文的地方。 2. 那个 anti-probe organism 在保能力 0.71 的同时把读数压回基线。如果这种训练进了后训练管线,"白盒审计"的默认假设就被抽掉了——这才是 PIR 真正的天花板。 3. 域特异遗忘那一步,能不能从作者的单一 RMU run 扩到多次、多 family。现在这条结论的样本量是 1。 4. 一句话记住全文:嘴可以控制,瞳孔不能——至少在它没被专门训练来控制之前。