Loading...
正在加载...
请稍候

DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
  • 作者:Haoyang He, Jiangning Zhang, Hongxu Chen, Xuhai Chen, Zhishan Li, Xu Chen, Yabiao Wang, Chengjie Wang, Lei Xie
  • 机构:浙江大学 (Zhejiang University), 腾讯优图实验室
  • 期刊/会议:疑似 AAAI 2024 或其他顶级 AI 会议(根据引用格式推断)
  • 来源:DiDA.pdf

综合评定:🟠 高度可疑

这篇论文提出了一种基于扩散模型的多类异常检测框架 DiAD。虽然创新性听起来不错,但在数学公式、实验数据稳定性以及硬件可行性上存在诸多令人困惑的疑点。如果这是真金白银的实验结果,那作者的显卡一定有着与众不同的物理法则。

详细发现

发现 1:第六式 - 数学公式自摆乌龙(公式计算了个寂寞)

  • 位置:Method 章节,公式 (9) 及其上下文
  • 描述:文中声称使用余弦相似度计算异常分数。公式 (9) 写为:
    \(M_n(x_0, \hat{x}_0) = 1 - \frac{(\Psi^n(x_0, \hat{x}_0))^T \cdot \Psi^n(x_0, \hat{x}_0)}{||\Psi^n(x_0, \hat{x}_0)|| \cdot ||\Psi^n(x_0, \hat{x}_0)||}\)
  • 证据
    1. 根据描述,\(\Psi\) 是一个特征提取器,输入应为单张图片。但公式中 \(\Psi\) 却同时输入了 \(x_0\)\(\hat{x}_0\)
    2. 退一步讲,假设 \(\Psi(x_0, \hat{x}_0)\) 输出一个向量,上述公式计算的是该向量的自相关(平方)除以范数的平方。根据向量点乘性质,\(\frac{A^T \cdot A}{||A|| \cdot ||A||} = 1\)
    3. 因此,整个公式简化为 \(1 - 1 = 0\)。这意味无论输入什么图片,计算出的异常分数在理论上永远是 0。
    4. 如果作者真的用这个公式跑出了实验结果,那结果全是 0;如果结果不是 0,说明论文中的公式和代码里用的完全是两码事,属于严重的图文不符或笔误。
  • 严重程度:🔴 实锤(公式错误) / 🟠 高度可疑(代码与论文一致性存疑)

发现 2:第五式/第六式 - 硬件可行性存疑(V100 显存突破天际)

  • 位置:Implementation Details & Appendix Table 11
  • 描述:作者声称在单张 NVIDIA Tesla V100 (32GB) 上训练模型,Batch Size 设为 12。
  • 证据
    1. 论文 Table 11 列出了模型参数量:
      • SD Denoising Network: 859M
      • SG Network: 471M
      • Autoencoder: 83.7M
      • 总参数量约为 1.4 Billion
    2. 这是一个庞大的模型。训练 1.4B 参数的模型,如果使用 Adam 优化器,仅模型参数、梯度和优化器状态就需要至少 1.4B * 12 bytes ≈ 16.8 GB 显存(FP32)。
    3. 还要加上 Batch Size 为 12 的前向激活值。UNet 结构的激活值非常占显存。
    4. 在单张 32GB V100 上,塞下 1.4B 模型并开启 BS=12 的训练,在常规设置下几乎必然 OOM(Out of Memory)。除非作者使用了未说明的极度激进的显存优化技术(如 CPU Offloading, Gradient Checkpointing 等),否则这个实验配置不合常理。
  • 严重程度:🟠 高度可疑

发现 3:第二式 - 数据过于完美(随机数生成器都不如)

  • 位置:Appendix, Table 10 (Effect of DDIM sampler steps)
  • 描述:验证 DDIM 采样步数对结果影响的消融实验。
  • 证据
    • 从 Step 10 到 Step 200,seg 指标的数据为:96.8, 96.8, 96.7, 96.7, 96.8
    • cls 指标的数据为:97.2, 97.1, 97.0, 96.8, 96.9
    • 在如此大范围的步数变化(20到200)中,指标的波动极小(仅在小数点后一位抖动),且呈现出一种诡异的对称或周期性(96.8 -> 96.7 -> 96.7 -> 96.8)。
    • 通常扩散模型随步数增加会有明显的性能爬升或波动,如此平滑且几乎不变的数据,让人怀疑是否是编造的,或者实验根本没有真正进行多次独立验证。
  • 严重程度:🟡 存疑(也可能是模型确实极其稳定,但结合其他疑点,很难让人信服)

发现 4:第三式 - 无法进行图片复用/拼接检测

  • 位置:全文 Figures
  • 描述:由于当前输入为纯文本格式,无法获取论文中的图片文件(如 Figure 1, 2, 4, 5 等)。
  • 证据:无法进行像素级比对、噪点分析或 Photoshop 痕迹检测。
  • 严重程度:N/A(信息不足)

发现 5:第一式 - 文本描述的对比可能存在误导

  • 位置:Introduction & Figure 1
  • 描述:作者声称 LDM 会产生 "semantic errors",而自己的方法能保留语义。
  • 证据:虽然在文本上逻辑自洽,但在没有原始图片的情况下,无法确认 Figure 1 展示的 "Bad Case" 是否是为了突出自己方法而刻意挑选的极端情况。这属于写作技巧范畴,不算造假,但读者需警惕。

耿同学辣评

这篇论文的公式(Eq. 9)简直是数学界的“无效社交”——算了一大圈,结果全是 0。这就像你写了一段惊天动地的代码,最后发现 return 0; 写死在了第一行。

更离谱的是,作者试图让我们相信,能用一台 32GB 显存的 V100,把一个 14 亿参数的巨型模型跑出 Batch Size 12 的效果。这显卡是镶了金边还是通了量子纠缠?如果是真的,建议作者下次论文投 Nature,标题就叫《如何在 32GB 显存里装下整个世界》。

这数据稳得就像我那从不变心的体重秤,只不过我的体重秤是坏了,这数据是不是也“坏”了?

建议后续行动

  • 联系作者要求提供原始代码:特别是 Eq. 9 的实现部分,确认是否真的计算了余弦相似度(如果是,则公式写错;如果不是,则结果造假)。
  • **要求