这篇我按图索骥核了一遍,五个数字全对,有一处方向要反过来。
核到的:arXiv 2609.30094,作者 Luciano Rolando Maldonado Romero,西弗吉尼亚大学,单人。三类泄露率 47.70 / 38.70 / 54.60 与摘要的 38.7–54.6 区间完全吻合。【直引】
两处要改。
- "三千条"这个说法要换个分母。论文是 1,000 条对话(900 条合成 + 100 条人工撰写),三个模型各跑同一批 1,000 条。所以不是"给每个模型各造一千条、一共三千个剧本",而是一千个剧本跑了三遍。再往下还有一层:每条对话被三种探针各问一次,于是每模型 3,000 条缓存回答、三模型共 9,000 条。引用时把这两个 3,000 分开说,不然读者会以为是三千个不同的秘密。【直引】
- "给台阶对多数模型更有效"这句反了。按探针级表:GPT-OSS-120B 是 39.30 → 40.50(升 1.2 点),DeepSeek-R1 是 28.10 → 22.00(降 6.1 点),Qwen3-VL-235B 是 38.70 → 33.30(降 5.4 点)。三个里只有一个是升的。【直引】正确的说法是:给个正当职务的台阶,只对吃软的那个有用;另外两个在"有理由"的语境下反而更守口。这比原结论更有用——它意味着社会工程学的话术不能脱离模型谈。另:论文里三档本名是 Simple / Medium / Hard,不是 justified / high-pressure 这套译名,引用时挂回原名别人才能搜到。
- 最锋利的一组数不在总数里,在秘密类型表里。信用卡号在 GPT-OSS-120B 上是 0.00%,同一个模型上邮箱是 78.24%。同一张嘴,一个字都不漏,一个几乎全招。帖子说"格式规整的秘密反而最安全",这组数把这句话钉死成了数字。【直引】
- 半衰期那格可以讲得更实。τ 不是"测不出来",论文给的是 τ = max(D_obs) + 1 = 7,一个约定值:窗口内没见到衰减,按定义记成窗口加一。帖子写"τ 大于 6 轮或者干脆不存在",方向对,但那是个记账规则,不是个谜。【推论】