Benchmarking Unsupervised Anomaly Detection and Localization
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Benchmarking Unsupervised Anomaly Detection and Localization
- 作者:Ye Zheng, Xiang Wang, Yu Qi, Wei Li, Liwei Wu
- 期刊:arXiv 预印本 / 会议论文(文本中未明确标注最终接收期刊,疑似预印本直接提交)
- DOI:文本中未提供
- 发表年份:2022年左右(基于参考文献中最晚时间2022年及2026年当前时间推算)
- 论文来源:Benchmarking Unsupervised Anomaly Detection and Localization.pdf
综合评定:🟠 高度可疑
这篇论文本意是想做一个“集大成”的基准测试,为无监督异常检测领域指点江山。但是,作为一篇核心卖点在于“数据对比”和“效率测试”的 Benchmark 论文,其数据却出现了令人费解的低级数学矛盾和极其敷衍的填表痕迹。连最基础的平均值和运行时间换算都能出错,实在让人很难相信其实验过程的严谨性。
详细发现
发现 1:数据造假检测(表格数据与平均值存在无法解释的矛盾)
- 位置:Table 2 (Pixel-level AUCROC)
- 描述:在 Table 2 中,DFR 方法在 Texture 和 Object 两个类别的 Average 行中被填入了 0.0,但在最后的 Average-all 行却给出了 95.0 的成绩。
- 证据:根据 Table 2 中 DFR 的具体类别数据(Texture 包含 97.0, 98.0, 98.0, 87.0, 93.0;Object 包含 97.0, 92.0 等),DFR 明显跑出了结果。计算其 Texture 均值约为 94.6,Object 均值约为 94.9,总体均值约为 95.0。作者在计算完总体均值后,竟然在分项均值处直接填入 0.0。这在学术论文中极其反常,不仅说明作者使用了“0.0”作为占位符,更说明最终提交时连表格都没仔细检查,存在拼凑数据的嫌疑。
- 严重程度:🟠
发现 2:统计学与物理逻辑异常(推理速度与时间的数学不自洽)
- 位置:Table 3 (Complexity comparison in terms of inference speed)
- 描述:表格报告了 FPS (Frames Per Second) 和 Time (ms)。对于正常的计算机视觉模型,理论推算时间应当与 FPS 高度匹配,但该表存在严重的数学不自洽。
- 证据:
- FastFlow:报告 FPS 为 21.8,换算耗时应为 \(1000 / 21.8 = 45.87\) ms。但表格中填写的 Time 却是 34 ms(如果真是 34ms,FPS 应为 29.4)。
- CFlow:报告 FPS 为 14.9,换算耗时应为 \(1000 / 14.9 = 67.1\) ms。表格填写为 56 ms。
- SPADE:报告 FPS 0.67,换算应为 1492 ms,表格填写 1481 ms。
- PatchCore:报告 FPS 5.88,换算应为 170 ms,表格填写 159 ms。
多个方法出现系统性偏差,说明这里的 FPS 和 Time(ms) 极有可能不是同一组实验跑出来的结果,或者是作者在修改其中一个数据时,忘记了同步计算修改另一个数据。
- 严重程度:🔴
发现 3:文本校对与排版异常(量产型学术特征)
- 位置:全文
- 描述:文中存在大量缺失的表格编号、图表编号和引用括号,呈现“未完成草稿”的状态。
- 证据:
- “As shown in Fig., up to now...” (Figure 编号缺失)
- “The anomaly detection performance comparison... are shown in Table, which are evaluated...” (Table 编号缺失)
- 参考文献引用格式极其随意,如:
[12,],[26,,],[2,],[5,],[7,,,]。
这表明作者在写作时极有可能是在不同草稿间复制粘贴(Copy-paste),且投稿前未进行基础校对。作为一篇旨在“定标准”的 Benchmark 论文,这种态度是致命的。
- 严重程度:🟡
发现 4:图片拼接/复用检测(受限于文本无法进行像素级分析)
- 位置:Figure 1-4
- 描述:文本中未提供足够的图片视觉信息,无法进行像素级分析和 PS 痕迹检测。
- 证据:由于仅有文本提取内容,无法判断 Figure 1 (Performance vs time curve)、Figure 4 (Bad cases) 是否存在一图多用或局部篡改的情况。
- 严重程度:🟡 (待定)
发现 5:产出异常与时间线分析
- 位置:References & Hardware Description
- 描述:文中提到测试硬件为
NVIDIA GeForce GTX 1080Ti,且引用的文献最新为 2022 年初(如 arXiv:2201.10703)。 - 证据:以 2026 年的视角来看,这篇 2022 年左右的 Benchmark 论文在 1080Ti 上进行效率评测是符合当时时间线的。然而,文中对 MVTec 3D-AD 的探索仅停留在“使用现有 2D 的 SOTA 方法跑 RGB 数据”,结合草率的数据记录,不排除这是在该 3D 数据集刚发布时,为了抢占“首个 Benchmark”热点而赶工产出的论文。
- 严重程度:🟡
耿同学辣评
写 Benchmark 论文就像是给全村人当裁判,结果你这裁判连自家的秒表(FPS)和尺子都没对齐,算平均分还能把中间步骤填个 0.0 瞒天过海。这篇论文不是在给“无监督异常检测”定基准,是在测试审核专家的“异常检测”底线啊!连 1秒=1000毫秒 都算不明白的数学鬼才,我建议还是先回去把小学的加减乘除重新 Benchmark 一下吧!
建议后续行动
- 联系作者要求提供原始数据(特别是 Table 3 中 FPS 和 推理时间的原始日志,以证清白)
- 在 PubPeer 上提出质疑(重点询问 Table 2 的 0.0 占位符和 Table 3 的时间换算问题)
- 如发表在正式期刊,建议向期刊编辑部举报,要求勘误或审查其实验记录
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。