DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection
- 作者:Haoyang He, Jiangning Zhang, Hongxu Chen, Xuhai Chen, Zhishan Li, Xu Chen, Yabiao Wang, Chengjie Wang, Lei Xie
- 期刊:未知(从格式看应为顶级会议如 CVPR/ICCV/NeurIPS 或顶级期刊 TIP/TMM,文中引用包含 2023 年文献,推测发表于 2023-2024 年左右)
- DOI:未提供
- 发表年份:2023/2024
- 论文来源:DiDA.pdf
综合评定:✅ 清白
详细发现
发现 1:数据逻辑自洽性检查
- 位置:Abstract & Table 1 & Table 3
- 描述:检查摘要中声称的核心指标是否与正文表格数据一致。摘要声称在 MVTec-AD 数据集上取得了
96.8/52.6(localization AUROC/AP) 和97.2/99.0(detection AUROC/AP)。 - 证据:
- 检查 Table 1 (Detection):Mean 行,Ours 列数据为
97.2/99.0/96.5。摘要中的97.2和99.0对应 AUROCcls 和 APcls,数据完全吻合。 - 检查 Table 3 (Localization):Mean 行,Ours 列数据为
96.8/52.6/55.5。摘要中的96.8和52.6对应 AUROCseg 和 APseg,数据完全吻合。 - 在造假论文中,作者经常在摘要中夸大数据或抄错数字,但这篇论文的数据引用非常严谨。
- 检查 Table 1 (Detection):Mean 行,Ours 列数据为
- 严重程度:✅ 正常(加分项)
发现 2:公式排版/解析乱码
- 位置:Preliminaries - 公式 (2)
- 描述:公式 (2) 的逆扩散过程中出现了奇怪的字符
ȷ和ff。 - 证据:文本显示为
xt−1= 1/√αt ȷ xt−...。这大概率是 PDF 文本提取时对长括号或特殊符号(如\mathlarger或[)的识别错误,或者是原作者在 LaTeX 排版时使用了非常规宏包导致的渲染乱码。虽然不影响数学逻辑的正确性,但属于排版瑕疵。 - 严重程度:🟡 存疑(排版瑕疵,非数据造假)
发现 3:硬件配置与训练时间线
- 位置:Implementation Details & Table 11
- 描述:作者使用单张 NVIDIA Tesla V100 32GB 显卡,Batch Size 设为 12,Accumulate grad batches 设为 4,训练 1000 个 Epochs。模型包含 SD Denoising Network (859M) 和 SG Network (471M)。
- 证据:对于扩散模型(通常极度吃显存),在 V100(2017 年架构)上跑通如此庞大的参数量(总计超过 1.3B),且能设置 Batch Size 为 12,这在工程上是可能的,但效率极低。考虑到论文发表于 2023 年后,当时 A100/H100 已普及,使用老旧的 V100 训练如此大的模型虽然显得“艰苦”,但在时间逻辑上是成立的(不存在设备未上市的问题)。
- 严重程度:✅ 正常
发现 4:数据波动规律性(深度学习指标)
- 位置:Table 10 (Ablation studies on DDIM sampler steps)
- 描述:检查不同采样步数下的指标稳定性。
- 证据:在 Steps 为 10, 20, 50, 100, 200 时,seg AUROC 指标分别为
96.8, 96.8, 96.7, 96.7, 96.8。这种“横盘”且数字来回横跳(96.8 -> 96.7 -> 96.8)的现象,非常符合深度学习在固定测试集上评估时的真实情况——由于精度限制,微小改进无法体现在小数点后一位。如果造假,往往会编造一个单调递增或递减的完美曲线。 - 严重程度:✅ 正常
发现 5:图片与视觉结果
- 位置:全文 Figures
- 描述:论文包含大量网络结构图(Fig 2, 3)和可视化结果图(Fig 1, 4, 5, 7, 8, 9, 10)。
- 证据:由于当前输入为纯文本,无法进行像素级分析。但文本描述中未发现明显的“一图多用”线索,且图片说明(Caption)与正文描述高度一致。
- 严重程度:ℹ️ 无法判断(文本模式限制)
耿同学辣评
这篇论文简直是“实诚人的代表作”!摘要里报的数据,表格里一行不多一行不少地对得严丝合缝;公式写得虽然像被外星人敲过键盘(那个奇怪的 ȷ 和 ff 是怎么回事?),但逻辑依然坚挺。最让人心疼的是,都 2023 年了还在用祖传的 V100 硬扛 13 亿参数的扩散模型,batch size 还能开到 12,这显卡估计干活的时候风扇转得像直升机起飞吧?虽然没抓到造假,但这排版和硬件配置,妥妥的“经费有限但干活卖力”的高校实苦型课题组啊!
建议后续行动
- 无需联系作者,这是一篇逻辑自洽的正常论文
- 建议作者检查一下 LaTeX 源码中的公式 (2) 排版问题
- 关于此论文的质疑暂时解除
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
特别声明:本次检测基于纯文本输入,无法对图像进行像素级查重(第一式、第三式受限),主要侧重于数据逻辑与文本一致性分析。