DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
- 作者:Haoyang He, Jiangning Zhang, Hongxu Chen, Xuhai Chen, Zhishan Li, Xu Chen, Yabiao Wang, Chengjie Wang, Lei Xie
- 机构:Zhejiang University; Youtu Lab, Tencent
- 发表年份:推测为 2023/2024 年(基于参考文献时间)
- 论文来源:DiDA.pdf
综合评定:🟠 高度可疑
论文提出了一种基于扩散模型的多类别异常检测框架,整体逻辑严密,实验丰富。但在核心定量实验表格中,发现了多处严重的平均值计算错误,且部分数据存在违背统计学常理的巨大矛盾(AUROC与AP的极度割裂)。这些异常难以用简单的“笔误”来解释,强烈暗示论文在数据整理或报告过程中存在不诚实行为。
详细发现
发现 1:数据造假检测 —— 指标平均值与实际数据严重不符(凭空拔高)
- 位置:Table 1, Table 3
- 描述:论文中给出的 Ours 方法的 Mean(平均值)行数据,与上方 15 个类别的数据通过算术平均计算得出的真实值严重不符。特别是 Table 1 中的 APcls,作者报告了 99.0,但根据表格数据手算仅为 98.37。
- 证据:
- Table 1 (Detection):
- AUROCcls: 报告
97.2,实际计算值(99.7+94.8+89.0+99.5+99.1+95.7+90.7+99.7+99.8+95.1+99.4+98.5+99.8+96.8+99.7)/15 = 97.08。 - APcls: 报告
99.0,实际计算值(96.5+98.8+97.5+99.7+96.0+98.5+99.7+99.9+99.6+99.1+99.9+99.8+99.7+99.9+100.0)/15 = 98.37。差距高达 0.6,在 99% 的尺度上这是巨大的差异。
- AUROCcls: 报告
- Table 3 (Localization):
- AUROCseg: 报告
96.8,实际计算值为97.08(作者报告的值反而比实际低,可能存在修改局部数据后未更新 Mean 的情况)。
- AUROCseg: 报告
- Table 1 (Detection):
- 严重程度:🔴
发现 2:统计学异常检测 —— AUROC 与 AP 的统计学悖论
- 位置:Table 3 (Pixel-level localization)
- 描述:在异常定位任务中,Ours 方法在多个类别上出现了 AUROC 极高(接近满分)而 AP 极低(远低于对比方法)的诡异现象。这在统计学上极不自然。
- 证据:
- Transistor 类别: Ours 方法 AUROCseg 高达 99.8(几乎完美),但 APseg 仅为 15.6。对比 RD4AD (AUROC 85.9, AP 42.3) 和 UniAD (AUROC 97.9, AP 59.5)。如果模型真的能将像素区分得如此之好(AUROC 99.8),其 AP 不可能低至 15.6,这通常意味着模型产生了海量的假阳性,但这又会拉低 AUROC。这种“AUROC 满分但 AP 垮掉”的数据极大概率是数据操纵或生成错误的结果。
- Metal Nut 类别: Ours 方法 AUROCseg 97.3,但 APseg 仅为 30.0。而对比方法 RD4AD (AUROC 93.8, AP 62.3) 表现出正常的相关性。Ours 在 AUROC 领先 3.5 个点的情况下,AP 竟然落后 32 个点。
- 严重程度:🔴
发现 3:文本方法学异常 —— 复制粘贴残留
- 位置:Appendix -> Table 10 Caption
- 描述:在表格标题中,作者将 DiAD 写成了 UiAD。
- 证据:原文写道 "In order to accelerate the sampling speed in the denoising process, UiAD adopts the DDIM sampling strategy." 考虑到对比方法中有 UniAD,这极可能是作者在修改其他论文的模板或复制粘贴时的残留。虽然笔误本身不严重,但结合数据异常,增加了论文粗制滥造的嫌疑。
- 严重程度:🟡
耿同学辣评
兄弟们,这篇论文的实验数据玩了一手“障眼法”。Table 1 里的 AP 平均分硬生生被拔高了 0.6 个点,这是把审稿人当人肉计算器不检查吗?更离谱的是 Table 3 里的 Transistor,AUROC 考了 99.8 分,AP 却只有 15.6 分,这种“高分低能”的数据简直比“随机数生成器”还要魔幻。这就像是你说你高考数学考了 149 分,结果选择题只对了 3 道一样,怎么着,大题全是蒙对的呗?
建议后续行动
- 联系作者要求提供原始数据:特别是 Table 1 和 Table 3 的原始 log 文件,核实 Mean 值和 AP/AUROC 异常的类别。
- 在 PubPeer 上提出质疑:针对平均值计算错误和统计学悖论进行提问。
- 向期刊编辑部举报:建议作者先在 PubPeer 回应,若无合理解释再考虑举报。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。