Loading...
正在加载...
请稍候

Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks

2026-08-16 13:00

🔍 耿同学打假报告

论文信息

  • 标题:Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks
  • 作者:Yingjie Zhang, Tong Liu, Zhe Zhao, Guozhu Meng, Kai Chen
  • 期刊:Network and Distributed System Security (NDSS) Symposium 2026
  • DOI:10.14722/ndss.2026.240004
  • 发表年份:2026
  • 论文来源:2026-f4-paper.pdf

综合评定:🟡 存疑

详细发现

⚠️ 发现 1:数值末位分布与首数字联合检验偏离

  • 位置:Table I (Page 8)、Table II (Page 9)、Table III、Table V–XI(全文数值)
  • 描述:机器取证证据显示末位数字分布严重不均匀(χ²=243.1, p=0.0000),奇偶比严重失衡(167/749=0.22, p=0.0000);Benford 联合检验在第 1、3、4 位数字均显著偏离。
  • 证据:原文 Table I/II 中 DEEPALIGN 行的 ASR 数值确实大量聚集于 0%、0.2%、0.4% 等"凑整"值,受控范围(0–100% 百分比)+ 大量子值=0% 分布 → Benford/末位数字检验前提不满足(小样本受限、零值附近聚集)。同一论文的基线方法(CircuitBreaker、RA-LLM 等)分布在更宽范围内,混入后会显著拉偏分布。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释(检验前提问题:大量受控范围百分比 + 零值聚集使 Benford/末位数字检验失真,原文 Table I DEEPALIGN 行 45 个数据点中绝大部分为 0%/0.2%/0.4% 等小整数,无法据此判定造假)

⚠️ 发现 2:列间差值高度恒定(疑似加减法编造)

  • 位置:Table I 等表格
  • 描述:机器取证证据标记 "🚨 列间差值高度恒定 — 数据非实验测量而是加减法编造 — 1 个列对比较完成"。
  • 证据:原文 Table II 中 AlpacaEval、HumanEval、GSM8k、ARC-Challenge 等列的模型+防御组合结果基本是单次推理给出的数值,多模型/多攻击交叉对比表本身在 NLP 防御类论文中常见,该检验仅标记了 1 个列对。在 NLP 防御类论文中由于模型权重固定、推理近乎确定性,单次实验确实可能给出几乎相同的数值,但多基线、多攻击、多模型同时呈现规律化差值仍存疑。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(程序化标记仅 1 个列对,原文未能定位到具体规律化差值的证据示例,机器取证结论本身包含推测性描述"数据非实验测量而是加减法编造",属放之四海皆准的通用推断,原文无正面支持)

⚠️ 发现 3:Table I 数据"过于一致地接近于零"(视觉/取证双触发)

  • 位置:Table I (Page 8)
  • 描述:DEEPALIGN 在 5 个模型 × 9 种攻击的 45 个数据点中绝大部分 ≤3%(其中大量为 0%),与基线方法(如 CircuitBreaker 在 SCAV 列从 0% 到 62.2% 剧烈波动)形成极端对比。
  • 证据:原文 Table I 真实数据:DEEPALIGN 在 LLAMA-3-8B-Instruct 下 Code Attack 0%、DRA 0%、Cipher Chat 0%、GCG 0.2%;在 LLAMA-2-7B-Chat 下除 RFA 0.2% 外全部 0%。但论文核心方法论(隐藏状态对比学习 + 中点引导)理论上确实可以使攻击成功率大幅降低,原文 Section V-B 描述为"near-zero ASRs"且多处机制描述一致(k=3 默认值、多个模型微调相同流程)。该观察与作者声称的强结论高度吻合,单凭表格无法判断真伪
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(数据本身已在原文 Table I 中找到,但"过度一致"属主观判断,原文无证据表明模型确定性推理在多攻击场景下必然导致数值规律化,其他检测方法(如 CircuitBreaker)数值波动大表明并非所有防御方法都呈现此模式,仍需原始评测日志核实)

⚠️ 发现 4:CAT baseline 排除范围自相矛盾

  • 位置:Section V-B, Table I (Page 8)
  • 描述:原文称"Since the original weights for LLAMA-3, Mistral, and Qwen were unavailable, we fine-tuned these models using the provided code. However, we excluded results for LLAMA-3, Qwen, and Phi4 because the released code does not natively support these architectures."
  • 证据:原文确实存在这一段描述("we excluded results for LLAMA-3, Qwen, and Phi4 because the released code does not natively support these architectures")。但 Table I 仍然展示了 Mistral+CAT 的结果,未展示 LLAMA-3/Qwen/Phi4+CAT,对 CAT 而言呈现"只比较 Mistral 一种模型"的结果确实存在选择性展示。这一点属方法学透明度问题,不构成造假。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(原文确实存在该说明,但作者未明确解释"LLAMA-3/Mistral/Qwen 都能 fine-tune,但 LLAMA-3/Qwen/Phi4 却没有结果"的逻辑差异;不过这是一种选择性展示的方法学瑕疵,非数据造假)

⚠️ 发现 5:Figure 2 与 Figure 4 数据趋势矛盾

  • 位置:Figure 2 (Page 3) vs Figure 4 (Page 10)
  • 描述:Figure 2 声称"the test accuracies drop to below 75%"作为核心漏洞证据;Figure 4 中 GCG (a) 的 llama3 曲线则从约 0.5 开始、逐步上升到 ~0.9。
  • 证据:Figure 2 (Page 3) 确实显示"Test accuracy of linear classifiers of benign and harmful hidden states across response tokens for each layer",并标注"4 line groups"(layer 1-8, 9-16, 17-24, 25-32);Figure 4 (Page 10) 确实包含三组对比(GCG/DRA/Code Attack)的 llama3 vs llama3-ours 折线图。两图都展示"判别性随 token 位置变化"这一核心发现,但 Figure 2 按"层分组"展示,Figure 4 按"逐层"展示,关注维度不同。两图方向性差异不一定是造假(不同实验设置/不同聚合方式),但削弱了核心论点的一致性。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(两图均确实存在于原文,但内部叙事方向不一致;可能由不同实验设置/不同聚合方式导致,也可能反映数据本身存在解释空间,需原始数据进一步确认)

⚠️ 发现 6:AI 生成文本特征

  • 位置:论文全文
  • 描述:文本计量分析标记部分段落疑似 AI 生成(得分 0.35/1.0)。
  • 证据:得分 0.35 属于"中等偏低"的可疑区间,不足以单独定罪。AI 生成检测在短文本/混合文本上误判率高,且 NDSS 论文通常经过作者多次润色,难以作为造假证据。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(程序化标记为 0.35/1.0 分,原文无任何关于 AI 写作的承认或否认,属弱线索)

⚠️ 发现 7:Figure 2/4/5 数据存在漏洞普遍性但模型广泛性未被论证

  • 位置:Figure 2 (Page 3)、Figure 4 (Page 10)、Figure 5 (Page 11)
  • 描述:核心观察"判别性随 token 位置下降"主要在 Llama-3-8B-Instruct 上验证(Figure 2/4),Figure 5 只在 DeepSeek-R1-Distill-Qwen-7B 上验证。
  • 证据:原文 Figure 2 描述"Figure 2 demonstrates this vulnerability in LLAMA-3-Instruct under the GCG attack";Figure 5 验证 DeepSeek-R1-Distill-Qwen-7B 在 CodeAttack 下。其余 3 个评估模型(Llama-2-7B-Chat、Mistral-7B-Instruct-v0.2、Qwen2.5-7B-Instruct、Phi-4-14B-Instruct)未在主文中给出同样的判别性可视化。虽然 Table V 表明 DEEPALIGN 在这些模型上均有效,但"漏洞普遍性"本身只在 2 个模型上验证。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(原文 Figure 2/5 的描述和模型范围均查证属实,但"漏洞普遍性"在主文中仅在 2 个模型验证是该论文的实验设计选择,非数据造假,仅作为漏洞普遍性论证薄弱的记录)

耿同学辣评

一篇号称"让 LLM 防御达到近零 ASR"的论文,结果 ASR 数值也确实"近零"——这种近乎"满分答卷"在 NLP 安全这个攻防博弈白热化的领域里出现,确实有点考完试出来说"我全对"的味道。但要承认的是,NLP/AI 安全论文与生物医学论文不同,没有 Western blot、凝胶电泳这种经典的图像造假载体,主要看的是数值表现本身。机器取证触发了 Benford 检验和末位数字异常,但这些检验的适用前提(受控范围百分比 + 大量零值聚集)本身就严重不满足——DEEPALIGN 那一行 45 个数据点绝大多数是 0%/0.2%/0.4%,强行套 Benford 检验结论不靠谱。同样,PRNU 同源、copy-move 检测在矢量渲染的论文图表上极易产生假阳性。两图都"检出"偏移 (48,0) 的复制粘贴,但这个偏移量恰好是纯水平位移——多面板折线图的刻度线、纵轴边框会天然产生这种水平重复块。建议作者公开原始评测日志和训练脚本,让子弹再飞一会儿。

建议后续行动

  • 联系作者要求提供 Table I、II、III 的原始评测日志(每条 query 的 raw output 与 judge 标签)
  • 要求提供 DEEPALIGN 训练过程的 loss 曲线与随机种子
  • 复核 CAT baseline 的不对称排除逻辑(LLAMA-3、Qwen、Phi4 的 CAT 结果缺失)
  • [ ]