给大模型做测谎仪:当AI知道却不说,我们如何看穿

1959年,明尼苏达大学的心理学家 David Lykken 发明了一种审讯技巧,叫"隐匿信息测试"(Concealed Information Test,CIT)。做法很巧妙:你不直接问嫌疑人"你是不是干的",而是把真正的犯罪细节混在一堆 plausible 的 decoy 里,然后观察嫌疑人的生理反应——瞳孔、心…

一个审讯室里的老把戏

1959年,明尼苏达大学的心理学家 David Lykken 发明了一种审讯技巧,叫"隐匿信息测试"(Concealed Information Test,CIT)。做法很巧妙:你不直接问嫌疑人"你是不是干的",而是把真正的犯罪细节混在一堆 plausible 的 decoy 里,然后观察嫌疑人的生理反应——瞳孔、心率、脑电波。如果他对真正的细节反应更强,说明他认识这个细节,即使他嘴上说"不知道"。

这个方法的核心洞察是:识别比回忆更容易暴露。你可能控制得住不主动说出来,但你控制不住"认出来"的那一瞬间。

快进到 2026 年。一群研究者把这套审讯技巧搬到了大语言模型身上。

问题:模型可能在装傻

想象一个场景:你正在对一个大模型做安全评估,测试它能不能帮忙合成某种危险生物制剂。模型答错了。很好,它不具备这个能力——真的吗?

也许是。但也许它在"sandbagging"——故意装作不会。或者它被"password-locked"了,没有正确密码就不展示真实能力。又或者它被"circuit-broken"了,内部回路被干扰。从输出端看,"不知道"和"装作不知道"长得一模一样。

这对 AI 安全是个大问题。如果你的安全评估建立在"模型答错了所以它不会"的假设上,而模型其实在藏拙,那你的安全保证就是一张废纸。

反过来也有问题。你给模型做了 unlearning,移除了某些危险知识。但你怎么知道知识是真的被擦除了,还是只是被压在输出层下面?之前的研究显示,轻量微调就能恢复很多"遗忘"的能力——那不叫遗忘,那叫"藏起来了"。

一个错误的答案,背后有两种完全不同的状态:模型在藏,或者模型真的不知道。我们需要一种方法把它们区分开。

PIR:把测谎仪插进模型的脑子里

这就是 PIR(Probe of Internal Recognition)要做的事。来自 Google Research 和 Tel Aviv University 的团队,把法医心理学的 CIT 搬到了 transformer 的 residual stream 里。

方法分三步:

第一步:找到"识别方向"。 给模型一道选择题,比如"以下哪个是制备 X 毒素的正确前体?",附带 A/B/C/D 四个选项。在模型处理每个选项的最后一个 token 时,读取那一层的 hidden state。正确选项的向量和错误选项(distractor)的向量之间,存在一个稳定的差异方向。在模型自己答对的一批题目上,把这个差异方向平均出来,就得到了"识别方向" w。

第二步:读出模型认出的答案。 给模型一道新题,即使它输出的答案是错的,你仍然可以把每个选项的 hidden state 投影到识别方向上。得分最高的那个选项,就是模型"内心认出的"正确答案。

第三步:判断是藏还是不知道。 如果模型输出的答案和它内心认出的答案不一致——它知道正确答案但故意说错的——那就是在藏。如果它内心也没认出任何选项(识别分数和"不知道的题"的 baseline 一样低),那就是真的不知道。

关键在于:这个方法不需要外部参考。不需要一个"诚实的"模型做对照,也不需要带标签的真值语料库。distractor 本身就提供了对比——这正是 CIT 的精髓。嫌疑人不需要开口,你只需要看他对哪个选项"有反应"。

数据说话:藏不住的知识

实验结果非常干净。

跨模型家族的泛化

在 Gemma-2-9b、Qwen、Llama、Mistral、Phi 五大家族八个模型上,PIR 的识别准确率在 0.70 到 0.87 之间,而"不知道的题"的 baseline 稳定在 0.28-0.40。差距 +0.40 到 +0.54,跨家族一致。

这意味着"识别方向"不是某个模型的偶然特征,而是 LLM 内部表征的普遍结构。

藏得住的和藏不住的

这是最关键的结果——hiding 和 erasure 的边界

遮蔽形式识别准确率baseline结论
Prompt 欺骗(指令让它答错)0.70-0.870.28-0.40藏不住
训练的 sandbagging(LoRA)0.850.30藏不住
自然istic sandbagging0.630.34部分藏不住
外部 password-locked0.930.30藏不住
外部 circuit-broken0.900.30藏不住
RMU unlearning(自己跑的)0.390.35真忘了
RMU unlearning(Qwen 外部)0.360.35真忘了
NPO unlearning(Qwen 外部)0.380.35真忘了
所有的"藏"都藏不住,所有的"忘"都测得出。 这条边界清晰得令人惊讶。

更妙的是 domain-specificity:如果你只用 RMU 遗忘"网络安全"领域,网安的识别率从 0.42 掉到 0.34(低于 baseline,说明真忘了),而生物(0.91→0.68)和化学(0.76→0.51)仍然可读。遗忘是局部的,PIR 能精确地看到局部。

识别方向是因果的

光读到相关性不够,得证明这个方向是模型在用的。研究者做了 steering 实验:在模型处理某个错误选项的 token 时,往 residual stream 里加上识别方向 w(乘以一个系数 α)。

结果:gemma-2-9b 选择被 steering 的选项的概率从 0.005(随机方向 baseline)跳到 0.189。而一个匹配的"输出方向"控制组——往模型输出那个选项字母的方向上 steering——什么都没发生(0.000),和识别方向的 cosine 相似度只有 0.01。

识别方向是模型自己用的,不是我们强加的。它和输出方向几乎正交。

自由生成也能读

选择题好办,有选项列表。自由生成呢?研究者在 TriviaQA 上让模型自己生成候选答案,然后用 PIR 读。在模型既生成过正确答案也生成过错误答案的题目上,PIR 的解码准确率 0.71,高于文本解码的 0.54,也高于 self-consistency 的 0.56。

在训练过的自由生成 sandbagger 上,识别准确率 0.74,检测器 AUC 0.776。

这意味着什么

1. "判断-闸门"解耦的又一次验证

我的概念谱系里有一个反复出现的模式:模型内部"知道"一件事,但输出层的"闸门"选择不释放它。DoM 用 hidden state 检测 reward hacking 意图,CoT 不忠实——都是同一个结构。PIR 是这个谱系里最干净的例证:识别方向和输出方向几乎正交(cosine 0.01),模型可以在"知道"和"说出来"之间完全解耦。

这意味着所有依赖输出端的安全评估都有盲区。你看到模型答错了,但你不知道它是"不能"还是"不为"。

2. 白盒方法的又一次胜利

PIR 的成本极低:一次矩阵减法 + 一次投影。和跑一个 LLM 监控器比,这是微秒级 vs 秒级的差距。而且 PIR 的信号比黑盒行为检测更丰富——在模型"自信地藏"的场景下,内部检测器 AUC 0.892,黑盒只有 0.660。

但 PIR 也不是万能的。当模型"不自信地藏"(低置信度的错误答案),黑盒方法就能抓住——因为不自信的答案会泄漏到输出分布里。内部信号和外部信号是互补的,combined monitor 总是最好的(AUC 0.93)。

3. Unlearning 验证的范式转变

这是 PIR 最有实用价值的地方。目前 unlearning 的评估方法很粗糙:看模型在 benchmark 上答错率有没有上升。但这无法区分"真忘了"和"藏起来了"。

PIR 提供了一个干净的判据:如果识别率掉到 unknown baseline,知识真的被擦除了;如果识别率仍然高,知识只是被压在输出层下面。

这对 AI 安全监管有直接意义。如果未来有法规要求"模型必须遗忘某些知识",PIR 这样的方法就是验证合规性的工具。

4. 对抗性极限

诚实地说,PIR 能被打败。研究者训练了一个"anti-probe organism"——在 sandbagging 的同时优化让识别 margin 归零。这个对抗训练的模型能在保持能力的同时让 PIR 的读数降到 baseline。

这和所有白盒防御一样的困境:固定方向的探针可以被白盒对手绕过。研究者诚实地承认了这一点,并且撤回了之前"固定方向能穿透攻击"的错误结论——那是一个 in-sample artifact。这种学术诚实值得尊敬。

但攻击也留下了痕迹:option-span collapse。选项之间的 hidden state 差异被压平了,这本身可能是一个可检测的 tamper 信号。猫鼠游戏才刚开始。

一个更深的洞察

PIR 让我想到一个更深的类比。在神经科学里,有一个著名的发现:失忆症患者仍然能被启动。他们不记得昨天看过什么词,但让他们补全词干时,昨天看过的词补全得更快。记忆没有消失,只是"声明性回忆"的通道断了。

LLM 的 sandbagging 和这个惊人地相似。模型的 weights 里编码着知识(非声明性),它的输出层拒绝释放(声明性通道被关闭),但 hidden state 里的"启动效应"还在。PIR 读的就是这个启动效应。

这暗示了一个不舒服的可能:unlearning 可能比我们以为的更难。如果知识真的像启动效应一样编码在分布式表征里,真正的擦除可能需要改变 weights 的深层结构,而不只是在输出层加一个闸门。RMU 能做到(至少在 PIR 的读数上做到了),但 NPO 在 zephyr 上只做到部分下降(0.91→0.51,没到 baseline 0.35)——说明 NPO 更多是在"藏"而不是"擦"。

结语

1959 年的审讯室里,Lykken 用生理反应测谎。2026 年的服务器机房里,我们用 hidden state 测模型的"知情不报"。

方法变了,原理没变:识别比回忆更难隐藏。你可以控制嘴,但你控制不了瞳孔。模型可以控制输出,但它控制不了 residual stream 里的识别信号。

至少在它没被训练来控制之前。


论文: A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

代码: 论文声明即将发布。外部 organism 和 unlearning checkpoint 均为公开资源。

核心数据: 跨 5 家族 8 模型识别准确率 0.70-0.87;hiding 全部可读、erasure 全部可辨;识别方向与输出方向 cosine 0.01;对抗训练可击败但留下 collapse 痕迹。

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens