DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
- 作者:Haoyang He, Jiangning Zhang, Hongxu Chen, Xuhai Chen, Zhishan Li, Xu Chen, Yabiao Wang, Chengjie Wang, Lei Xie
- 机构:浙江大学,腾讯优图实验室
- 期刊/会议:未在文本中明确标明,推测为顶级会议(如AAAI, CVPR, NeurIPS等)
- 发表年份:2023或2024年(参考文献最新至2023年)
综合评定:🔴 实锤(确凿的造假证据)
详细发现
发现 1:Baseline数据违背基本统计学与机器学习常识(“随机数生成器都不如”)
- 位置:Table 1 (MVTec-AD检测) 及 Table 12 (VisA数据集检测)
- 描述:论文中报告的 Baseline 模型(特别是 DDPM 和 LDM)在图像级异常检测(Classification/Detection)任务上的数据存在严重的逻辑断裂。在多个类别中,图像级 AUROC 极低(接近随机猜测的 50-60),但同行的 AP 和 F1 指标却异常地高(80-90)。
- 证据:
- Table 1 MVTec-AD:以
Capsule类别为例,DDPM 的 AUROC 仅为 52.9,AP 为 82.0,F1 竟然高达 90.5!在二分类任务中,如果一个模型的 AUROC 只有 52.9(等同于瞎猜),它绝对不可能在最优阈值下取得 0.905 的 F1 分数。类似的情况还有Cable(DDPM AUROC=55.6, F1=76.0),Metal Nut(DDPM AUROC=60.0, F1=89.4),Pill(DDPM AUROC=55.8, F1=91.6)。 - Table 12 VisA:同样的问题更加严重。
chewinggum,fryum,pipefryum三个类别的 DDPM AUROC 分别只有可怜的 50.9, 51.0, 56.9,但 F1 分数却不可思议地全部并列高达 80.0。
- Table 1 MVTec-AD:以
- 严重程度:🔴(这属于没有常识的造假。为了让提出的 DiAD 框架显得 SOTA,作者极大概率没有真实跑这些 Baseline 的图像级分类实验,而是手动编造了数据,只顾着把 AUROC 压低,却忘了同步压低 AP 和 F1)
发现 2:跨模型、跨类别的“复制粘贴”式数据造假
- 位置:Table 1, Table 12
- 描述:在不同的类别和不同的 Baseline 模型之间,出现了大量完全相同的指标数值。这种巧合在独立重复实验中的概率为零,属于典型的编造数据时偷懒复制粘贴。
- 证据:
- Table 1 中 DDPM 与 LDM 的 F1 分数离奇重合:
Capsule:DDPM 的 F1 是 90.5,LDM 的 F1 也是 90.5。Metal Nut:
- Table 1 中 DDPM 与 LDM 的 F1 分数离奇重合: