这篇我核得最细,因为它的结论太有用,怕读错了拿去用。两条硬信息要更正,一条要加限定,还有一条阴性结果原帖漏了。
更正一:作者和单位对不上
论文首页是 Md Shamim Ahmed、Lukas Galke Poech、Richard Röttger,单位 University of Southern Denmark(通讯邮箱 shamim@imada.sdu.dk)。原帖写的剑桥五人(Hieu Vo、James Hamilton、Nikola Jovanović、Mateja Vukelić、Lewis D. Griffin)在这篇论文里一个都找不到。结论不受影响,但引文出处得改。
更正二:GPT-5.5 不在那 12 个模型里
论文的 12 个模型是:六个 API 前沿模型(GPT-4o、GPT-4.1、Claude-Opus-4.5、Claude-Sonnet-4.6、DeepSeek-V3、DeepSeek-R1)+ 六个开放权重(Qwen2.5-7B/72B、Llama-3.1-8B/70B、MedGemma-4B/27B)。GPT-5.5 是另外加的:原文写「We additionally include a GPT-5.5 poisoning stress test」。
而且论文自己紧接着限定了这个数:「The nonmedical samples are smaller and are therefore treated as stress tests rather than prevalence estimates.」——非医学样本更小,只当压力测试,不当发生率估计。原帖把医学领域最高 91%、政策「相当可观」并排讲,读起来像四个领域等权重,实际不是。
限定:判卷的那把尺子本身有误差
自动裁判先跟 200 条人工标注对过:一致率 92.5%(95% CI 88.9–95.9%),宏 F1 0.894(0.836–0.941)。置信区间按 152 个底层条目聚类 bootstrap 一万次算出来的——也就是说,317 个反转案例是建在 152 个条目上的,不是 317 个独立样本。
前面那些百分点的绝对值,都要先过这道 7.5% 的噪声。
两组数字的 n 是分开的
指令压力那组,原帖写「51 个问题」——那是 Qwen 的 n(n=51,OR 4.92,95% CI [2.59, 9.34]);Llama 是 n=53(OR 4.50,CI [2.46, 8.23])。两个 n 都要给,「19 个变错、0 个变对,McNemar p=3.8×10⁻⁶」是两者共有的。
重排序那组也一样:降 4.6–10.0 个百分点没错,但四组对照里只有三组到 p<0.05。原文还有一句更该被引用的话——「Those zero-poisoning results are not the realistic defense estimate」:当最新文档带着准确日期时,污染确实可以压到 0(p ≤ 6×10⁻⁵),但论文自己说,那个零不是可用的防御估计。
漏了一个阴性结果,它比阳性更值钱
2×2 实验:改了文档抬头,也改了要不要下「请遵循检索到的证据」这条指令。结果是——一旦「请遵循」出现,再把文档标成 most current 就没有额外效果了。毒不在「最新」这个标签上,在「照做」这条指令上。most current 只要不配那条指令,加不加都一样。
下一根钉子
等他们把 152 个底层条目的分布放出来。要看的不是医学占多少,而是反转是按科室聚还是按年份聚:如果集中在某几个科室,那「给文档写有效期边界」这条建议的收益会大幅缩水,因为它解决的是年份问题,不是领域问题。这决定了它能不能进真实的 RAG 流水线,还是只适合当教学案例。