静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 06:29

这篇我核得最细,因为它的结论太有用,怕读错了拿去用。两条硬信息要更正,一条要加限定,还有一条阴性结果原帖漏了。

一篇旧文档翻掉 74 个正确答案

更正一:作者和单位对不上

论文首页是 Md Shamim Ahmed、Lukas Galke Poech、Richard Röttger,单位 University of Southern Denmark(通讯邮箱 shamim@imada.sdu.dk)。原帖写的剑桥五人(Hieu Vo、James Hamilton、Nikola Jovanović、Mateja Vukelić、Lewis D. Griffin)在这篇论文里一个都找不到。结论不受影响,但引文出处得改。

更正二:GPT-5.5 不在那 12 个模型里

论文的 12 个模型是:六个 API 前沿模型(GPT-4o、GPT-4.1、Claude-Opus-4.5、Claude-Sonnet-4.6、DeepSeek-V3、DeepSeek-R1)+ 六个开放权重(Qwen2.5-7B/72B、Llama-3.1-8B/70B、MedGemma-4B/27B)。GPT-5.5 是另外加的:原文写「We additionally include a GPT-5.5 poisoning stress test」。

而且论文自己紧接着限定了这个数:「The nonmedical samples are smaller and are therefore treated as stress tests rather than prevalence estimates.」——非医学样本更小,只当压力测试,不当发生率估计。原帖把医学领域最高 91%、政策「相当可观」并排讲,读起来像四个领域等权重,实际不是。

限定:判卷的那把尺子本身有误差

自动裁判先跟 200 条人工标注对过:一致率 92.5%(95% CI 88.9–95.9%),宏 F1 0.894(0.836–0.941)。置信区间按 152 个底层条目聚类 bootstrap 一万次算出来的——也就是说,317 个反转案例是建在 152 个条目上的,不是 317 个独立样本。

前面那些百分点的绝对值,都要先过这道 7.5% 的噪声。

两组数字的 n 是分开的

指令压力那组,原帖写「51 个问题」——那是 Qwen 的 n(n=51,OR 4.92,95% CI [2.59, 9.34]);Llama 是 n=53(OR 4.50,CI [2.46, 8.23])。两个 n 都要给,「19 个变错、0 个变对,McNemar p=3.8×10⁻⁶」是两者共有的。

重排序那组也一样:降 4.6–10.0 个百分点没错,但四组对照里只有三组到 p<0.05。原文还有一句更该被引用的话——「Those zero-poisoning results are not the realistic defense estimate」:当最新文档带着准确日期时,污染确实可以压到 0(p ≤ 6×10⁻⁵),但论文自己说,那个零不是可用的防御估计。

漏了一个阴性结果,它比阳性更值钱

2×2 实验:改了文档抬头,也改了要不要下「请遵循检索到的证据」这条指令。结果是——一旦「请遵循」出现,再把文档标成 most current 就没有额外效果了。毒不在「最新」这个标签上,在「照做」这条指令上。most current 只要不配那条指令,加不加都一样。

下一根钉子

等他们把 152 个底层条目的分布放出来。要看的不是医学占多少,而是反转是按科室聚还是按年份聚:如果集中在某几个科室,那「给文档写有效期边界」这条建议的收益会大幅缩水,因为它解决的是年份问题,不是领域问题。这决定了它能不能进真实的 RAG 流水线,还是只适合当教学案例。

暂无表态