DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
- 作者:Haoyang He, Jiangning Zhang, Hongxu Chen, Xuhai Chen, Zhishan Li, Xu Chen, Yabiao Wang, Chengjie Wang, Lei Xie
- 期刊/来源:DiDA.pdf (基于内容推测为计算机视觉顶会论文,如 AAAI/CVPR/NeurIPS 级别)
- 发表年份:2024 左右 (文内引用了 2023 年大量文献,且提及 Stable Diffusion)
综合评定:🟠 高度可疑
这篇论文提出了一种基于扩散模型的多类异常检测框架,整体 story 讲得不错,网络结构图(Figure 2)画得也算精美。但是!在我“耿同学六式”的火眼金睛下,核心的消融实验数据表(Table 9)露出了马脚。这种数据巧合程度,概率学上几乎不可能发生,除非是用 Ctrl+C 和 Ctrl+V 创造的奇迹。
详细发现
发现 1:数据造假检测(Ctrl+C/V 创造奇迹)
- 位置:Table 9 (Ablation studies on the feature layers)
- 描述:在使用不同特征层(feature layers)组合计算异常分数的消融实验中,出现了两组完全不同实验条件下的结果数据一模一样的情况。
- 证据:
请看 Table 9 中的这两行数据:- 条件:使用
f1, f2, f3层(对应表格打勾位置为前三列)
数据:97.1, 99.0, 96.8, 96.4, 49.4, 53.1 - 条件:使用
f3, f4, f5层(对应表格打勾位置为后三列)
数据:97.1, 99.0, 96.8, 96.4, 49.4, 53.1
分析:f1,f2,f3代表的是浅层特征(包含更多纹理细节),而f3,f4,f5代表的是深层特征(包含更多语义信息)。在图像异常检测任务中,浅层和深层特征的表现差异通常非常大。这两组截然不同的特征组合,在 6 个指标(AUROC, AP, F1max 等)上给出了完全精确到小数点后一位的相同结果。
这就像是你说你穿运动鞋跑了 100 米用时 11.2 秒,穿皮鞋跑了 100 米也精确到用了 11.2 秒,甚至连风阻、步频都一模一样。唯一的解释就是:作者在填表的时候,复制粘贴错行了,并且连原图都没查。
- 条件:使用
- 严重程度:🔴
发现 2:文本拼接与笔误检测(不走心的排版)
- 位置:Abstract / Page 1
- 描述:摘要部分存在明显的单词粘连缺失空格的格式错误,这通常意味着文章是在极度匆忙中排版,或者从不同来源复制粘贴后未进行仔细校对。
- 证据:
- "propose aDifusion-basedAnomalyDetection (DiAD)" -> 应为 "a Diffusion-based Anomaly Detection"。Difusion 还少了一个 f。
- "Firstly, The SG network..." -> 句号后 The 首字母大写,且 Firstly 使用略显生硬。
- 严重程度:🟡
发现 3:硬件与训练逻辑的合理性(第五式:产出异常)
- 位置:Implementation Details / Table 11
- 描述:论文声称在 Single NVIDIA Tesla V100 32GB 上训练 1000 个 Epochs,Batch Size 为 12,并使用了梯度累加 (Accumulategradbatches=4)。
- 证据:虽然 V100 是一块好卡,但对于基于 Stable Diffusion (SD) 架构的模型(包含 859M 参数的 SD Denoising + 471M 参数的 SG 网络),单卡 V100 (32G) 跑多类异常检测数据集(MVTec-AD + VisA),batch size 12 加上 1000 epochs 的训练时间会非常漫长。不过结合梯度累加,这在工程上是可行的。这一点不算是造假,只能说明算力抠搜,或者作者非常有耐心。
- 严重程度:🟢 (合理推测)
发现 4:图片分析受限说明
- 位置:全文
- 描述:由于仅提供文本交互,无法对 Figure 1, 2, 4, 5, 8, 9, 10 进行像素级比对(如是否存在相同噪声背景、复制翻转等问题)。
- 证据:N/A
- 严重程度:无法判断
耿同学辣评
这篇论文的核心卖点是通过引入 SG 网络和 SFF 模块来融合不同尺度的特征。结果倒好,Table 9 直接告诉我们:“不管我用深层特征还是浅层特征,结果都一样!” 这简直是学术界的“薛定谔的特征层”——只要我不看原始数据,深层和浅层就是一样的。这种在消融实验里把低级特征和高维语义特征性能写出完全一样数据的操作,简直是把审稿人当成了不识数的傻子。 建议作者去买彩票,毕竟这种所有指标小数点都重合的概率,比中头奖还低。
建议后续行动
- 重点关注:联系作者要求提供 Table 9 中
f1,f2,f3和f3,f4,f5实验的原始 Log 文件和 TensorBoard 曲线。 - 学术质疑:在 PubPeer 上针对 Table 9 的数据重复问题提出 Question,询问是否为 Typo 以及真实的实验结果是什么。
- 暂不向机构举报,目前仅为一处表格数据异常(虽高度可疑为编造),等待作者回应是否为笔误。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。