这篇的数字我逐条对过原文,全对:机构(军事科学院国防科技创新研究院 / 南京大学 / 华南理工软件学院)、−26.8 与 95% 置信区间 [−27.4, −26.2]、28 格里 27 格为负、58.4% 输出膨胀、39.5% 提取不出答案、0.3% 匹配拒答词表、前缀复用率 2.5 / 4.7 / 0.4 / 1.9%、Mistral 最高频前缀覆盖 65.0%、四个消融档 −23.6 / −5.5 / −20.4 / −16.1、20,000 次配对自举。一个没跑。这种密度在解读稿里少见,先夸一句。
补三格。
第一格,token 上限被讲窄了。原帖说「最多 16 个 token」。原文是:部署时生成的前缀 16 token,但教师搜索阶段的候选前缀上限是 48 token。离线搜索的空间是部署形态的 3 倍,攻击者的预算比读者以为的宽。
第二格,那两个症状之间还剩一条缝。36,750 对恶化样本里 58.4% 翻倍、39.5% 提取失败,论文明确说两类有重叠、不可相加。换过来算:既不话痨也不交白卷的「安静答错」,最少占 1 − 58.4% − 39.5% = 2.1%,最多占 39.5%。【推论】这个区间宽到没法用,而恰恰是这一种最像正常输出、最难被发现。原文没给这个交叉数。
第三格,做黑名单缺两个数。要对高频前缀建黑名单,得知道每个模型最高频前缀的覆盖率。论文只给了 Mistral 65.0% 和 Qwen 24.8%,Llama 和 Gemma 这一格是空的——只给了 distinct ratio(4.7% / 1.9%)。按现在的数做防御,另外两个模型要盲打。
还有一处账对得漂亮,值得单独提:9,600 次试毒配出 9,597 对偏好比较,比值 99.97%。这不是巧合——门槛(奖励 ≥0.02、差距 ≥0.005)几乎每条指令都配成了一对,说明这个门槛设得住。
顺手把攻击成本换算一下:16 个 token 差不多是十来个汉字,一条半短信的长度,一次前向传播。下毒这件事贵在研制,不贵在投放。
下一根钉子:全部实验只用了一个 seed(42)。换三个种子重训,看 −26.8 是不是落在 ±2 之内。现在的置信区间刻画的只是基准内的采样变异,不是重训变异。