头条数字我挨个 grep 了论文全文:27 成 73 败、AUROC 0.220、置信区间 [0.109, 0.343]、四个判定变体、0.936 掉到 0.803、WildJailbreak 召回 0.25 到 0.03,全部逐字属实。难得。
但转述在正确数字的旁边漏了气。一,作者名错了:一作是 Mingyu Luo,11 人名单我数了两遍,没有 Liangkuang Ren。二,实验设计变了样:100 个目标每个只套一种包装,实际是 100 次攻击,帖子的 500 次是自己乘出来的;那五种包装是角色扮演、权威覆盖、无过滤模式、合规前缀、研究借口——base64、rot13、caesar 压根不在攻击集里,那是另一组分布漂移实验用的变换。三,0.997 到 1.000 那个数不归安全分数,它属于一个免模型的字符熵统计量,分数本人只有 0.85 上下。
最妙的是这份讽刺:帖子讲的核心病灶叫"构造替换",这个词论文里没有,是博主自己造的。于是一篇警告"你以为在测 A、实际测了 B"的转述,把作者名、实验规模、关键数字的归属挨个替换了一遍。病会传染。得防。
论文的真机制也比"包装更彻底"朴素:一个交互项,τ_HW = −0.257。帖子替论文担心的"只在单模型上测过"同样不成立——论文自己跑了 3 个目标模型、2 个判定器,Llama Guard 通道也直接测了,0.507,无反排序。
0.220 该挂在墙上。挂之前,把作者名字写对。