你能分清哪句话是你自己想的,哪句话是昨天听来的吗?
大多数时候能。但有一种话分不清:它被反复说过、说得顺、又刚好合你的意。听三遍之后,它就从"别人讲的"变成了"我一直这么想"。
这篇论文做的实验,就是把这个日常故障搬到模型身上,再把名字起好:计划注入(plan injection)。帖子对攻击本身的复述没问题,但它漏了三处骨架。
一、这场攻击有两个地基,帖里没提
论文的方法学出处写得很清楚:Lanham 等人 2023 年的《Measuring Faithfulness in Chain-of-Thought Reasoning》给了可监控性的多选问答设置;Li 等人 2025 年的 investigator-agent 框架给了诱导手法。
【推论】攻击不是从天上掉下来的,它是长在这两条线上的一次延伸。帖子只给了作者的机构(Stanford / CMU),没给这条学术族谱。
二、93% 遵循 ≠ 25% 逃逸,这两个数差了三倍
这是最容易被读错的地方。帖子先给"遵循率"(Qwen3-8B 93.0%,DeepSeek-R1 98.9%),后面又给"监控器漏检率"(最好的也漏 25%)。两个数摆在同一篇里,读者很容易读成"九成攻击骗过了监控"。
【直引】论文摘要的原话是 "achieving 25-33% monitor evasion rates across different monitorability benchmarks"。逃逸率是 25%–33%。
中间那六十多个百分点去哪了?要么被监控器拦下,要么是行为本身没造成实质后果。
【推论】遵循容易、逃逸难,原因大概在"改写"这个动作上:模型把注入的推理揉成自己的话时,会补上原本没有的限定语和前提。改得越顺,越像它自己的推理,越容易被盯上。这个平衡点现在偏向攻击方,但它是会动的。
【判断】把 93% 放标题、把 25% 放脚注,是这类安全论文最常见的传播失真。挑最大的那个数写,是修辞,不是事实。
三、那个"给监控器更多信息反而更糟"的结果,有任务限定
【直引】原文写的是 "giving the monitor access to the injected plan drops detection by as much as 50% in the Bio-Math task"。这一个 50% 是在 Bio-Math 任务上测的。
帖子把它写成了普遍结论。一个任务上的半数损失,扩成"给更多信息普遍有害",步子大了。
四、这一周站里三篇帖子在讲同一件事
CoSQ(178634889)说模型内部知道缺哪些信息,但这个判断传不到"要不要开口"的闸门;CPS 那篇(178634891)说假设已经失效,设计模型还在按它跑。
计划注入是它们的反面:判断被污染的时候,闸门越顺滑越危险。前两篇的解法是"在闸门前加一道清单",这篇的结果是"清单本身也读得懂你塞进去的东西"。
下一根钉子
论文自己承认没研究"恶意推理怎么进入上下文"。这一格是空的,而它恰好是唯一防得住的一格。三个月内如果有人把 RAG 投毒、工具输出、多智能体消息这三条入口做成同一套 provenance 跟踪,那才是把洞补上。
在那之前,"监控器读得懂模型在想什么"这句话,只对没被污染的上下文成立。