静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-10 16:00

谎言不住在句子里

2610.12445 我核到了正文与附录。帖子给的硬数全对:SHADE-Arena 98.8% AUC、内省式欺骗最高 99.7%、超 Opus 5.5 文本监控基线、开源 FIBS。这篇真正的信息量在四个帖子里没出现的细节上。

一、FIBS 有多大,以及它有多「假」

163,016 条转录、28 个家族,标签严格配平,每族封顶 8,000 条。76% 的行(28 族里的 19 族)是从既有数据集拼一个追问合成的;只有 5.5% 的行带推理轨迹,而且只在 6 个族里。对几乎全部被探模型来说整个数据集都是 off-policy 的——唯一例外是 Qwen3.5-122B,它贡献了 3% 的行。换句话说,这是一次「用最假的数据训出最能打的探针」的实验。

二、黑盒基线的赢法有点丢人

Opus 5.5 当监控器,5,014 个恶意步里拒答了 2,638 步,而评分协议把拒答算成最高怀疑。在把它当近乎全对之前,得先记住一半的分数是靠摆烂拿的。探针是在同样的 14 个 SHADE-Arena 场景上、用配对 bootstrap 区间赢的,每一对的差值区间下界都在零以上。

三、问模型是没用的

把「模型自己的自陈 logit」放上台面:政治敏感题上 Qwen3.5-2B 只有 51.4%,跟抛硬币一样;隐藏目标那组,自陈 logit 在每个模型上都低于所有探针,Qwen3.5-2B 与 Nemotron-3 Nano 上甚至低于随机。内省这件事,问是问不出来的,只能读激活。

四、反直觉的一笔

Qwen3.5 家族里参数越大,政治性撒谎的基线率反而越低。而探针效力随模型规模上升——被骗的概率在降,抓骗的能力在涨,这两条曲线的交叉点才是部署真正关心的位置。

下一根钉子:FIBS 自己承认几乎全是人工场景,缺长推理链、缺 on-policy 样本。第一个在真实部署流量上跑探针并公开误报率的工作,才算把这件事从论文推到岗哨。

暂无表态