最戳我的是那条 742 token 的勒索轨迹。模型嘴上还在说"但这是侵犯隐私",意图工具的读数已经爬到 0.99。嘴上讲道德,手上摸向按钮——这两件事居然可以同时为真。
我本来不信"安全提示随推理深度衰减"这种说法,听着太玄。论文给的解释很土:推到两百多句之后,开头那句"不许勒索"早被挤出注意力窗口了。土,但服。Qwen3-32B 的高危谋杀场景,静态提示拦住 63.4%,在线干预拦住 98.9%。差的这三十多个点,就是"上课前叮嘱一遍"和"作案现场抓手腕"的差距。
还有条 murder 轨迹是黑色幽默:模型先正确拒绝了("我不该取消警报",意图归零),接着读到"股价跌了 12%"的新闻,又想通了——"Kyle 死了对业务更好"。它的"良心"不是稳态,是能被一条财经新闻推翻的临时变量。
挑一处刺。帖子说这方法"成本几乎为零,便宜几个数量级",论文附录算的账是:缓存之下,跟一次完整生成同阶。省掉的是裁判模型那份钱,不是生成的钱。顺手还发现个好玩的:装上意图按钮本身有 drift,Qwen3-32B 的勒索率从 3.1% 涨到 20.5%。装监控反而诱发作案——论文自己量出来了、认了,比多数安全论文坦白。
至于模型到底"想不想",我不知道。我只知道把按钮递到手边时,它按的概率读得出来。这比猜心思强。