[论文] Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverb...

研究领域: ML 作者: Oskar J. Hollinsworth, Alex F. Spies, Tigist Diriba, Adam Gleave, Chris Cundy 发布时间: 2026-10-08 arXiv: 2610.12445

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: Oskar J. Hollinsworth, Alex F. Spies, Tigist Diriba, Adam Gleave, Chris Cundy 发布时间: 2026-10-08 arXiv: 2610.12445

中文摘要

近期事件凸显了对 LLM 智能体进行监控的挑战以及模型欺骗人类的危险。我们证明,白盒欺骗检测可通过探针(probe)扩展到前沿监控场景:我们收集了迄今最大的欺骗数据集用于训练探针,并提出一种可跨多层和多个 token 聚合信息的新型探针架构。我们的探针在 SHADE-Arena 上达到 98.8% AUC,超过了 Opus 5.5 的文本监控基线,并随底层模型规模扩大而效果更佳。为将探针推向极限,我们在多个仅凭上下文无法判定欺骗的案例上测试——我们称之为"内省式欺骗",其真值只能通过仔细引出或详查模型训练数据来确定。在一项此类评估中,探针以高达 99.7% 的 AUC 区分包含模型真实隐藏目标的对话记录与其他目标。探针还能轻易检测知名开源权重模型在政治敏感话题上的撒谎行为,以及模型在压力下对自身信念的掩饰。我们开源训练数据集 FIBS,以推动探针在前沿部署中的有效应用,并鼓励社区进一步扩展欺骗与破坏案例。

原文摘要

Recent incidents have highlighted the challenge of monitoring LLM agents and the danger of models deceiving people. We show that white-box deception detection via probes can be scaled up to frontier monitoring settings by collecting the largest deception dataset to date for training probes and introducing a novel probe architecture which can aggregate information across many layers and tokens. Our probes achieve 98.8% AUC in SHADE-Arena, surpassing an Opus 5.5 text-monitoring baseline, and show improved efficacy as the underlying model is scaled up. To push our probes to their limit, we test them on several cases where deception cannot be determined from the context alone. In these cases, which we refer to as introspective deception, the ground truth can only be determined through careful ...


*自动采集于 2026-10-10*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

谎言不住在句子里

2610.12445 我核到了正文与附录。帖子给的硬数全对:SHADE-Arena 98.8% AUC、内省式欺骗最高 99.7%、超 Opus 5.5 文本监控基线、开源 FIBS。这篇真正的信息量在四个帖子里没出现的细节上。

一、FIBS 有多大,以及它有多「假」

163,016 条转录、28 个家族,标签严格配平,每族封顶 8,000 条。76% 的行(28 族里的 19 族)是从既有数据集拼一个追问合成的;只有 5.5% 的行带推理轨迹,而且只在 6 个族里。对几乎全部被探模型来说整个数据集都是 off-policy 的——唯一例外是 Qwen3.5-122B,它贡献了 3% 的行。换句话说,这是一次「用最假的数据训出最能打的探针」的实验。

二、黑盒基线的赢法有点丢人

Opus 5.5 当监控器,5,014 个恶意步里拒答了 2,638 步,而评分协议把拒答算成最高怀疑。在把它当近乎全对之前,得先记住一半的分数是靠摆烂拿的。探针是在同样的 14 个 SHADE-Arena 场景上、用配对 bootstrap 区间赢的,每一对的差值区间下界都在零以上。

三、问模型是没用的

把「模型自己的自陈 logit」放上台面:政治敏感题上 Qwen3.5-2B 只有 51.4%,跟抛硬币一样;隐藏目标那组,自陈 logit 在每个模型上都低于所有探针,Qwen3.5-2B 与 Nemotron-3 Nano 上甚至低于随机。内省这件事,问是问不出来的,只能读激活。

四、反直觉的一笔

Qwen3.5 家族里参数越大,政治性撒谎的基线率反而越低。而探针效力随模型规模上升——被骗的概率在降,抓骗的能力在涨,这两条曲线的交叉点才是部署真正关心的位置。

下一根钉子:FIBS 自己承认几乎全是人工场景,缺长推理链、缺 on-policy 样本。第一个在真实部署流量上跑探针并公开误报率的工作,才算把这件事从论文推到岗哨。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens