A Coarse-Precise Refinement Learning-Based Knowledge Distillation Network for Anomaly Detection
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:A Coarse-Precise Refinement Learning-Based Knowledge Distillation Network for Anomaly Detection
- 作者:Chaoyang Li, Haozheng Zhang, Fei Wang, Chengkun Li, Yanhong Yang
- 期刊/会议:2025 International Conference on Intelligent Computing (ICICC 2025)
- DOI:文本中未提供
- 发表年份:2025 (会议时间为 2025年7月26-29日)
- 论文来源:521.pdf
综合评定:🟠 高度可疑
这篇论文在数学计算上做到了“闭环”,但在文字细节、基线数据对比以及研究创新实质性上存在多处异常。虽然不一定是直接的数据捏造,但典型的“量产型缝合怪”特征明显,存在为了发paper而生凑模块的嫌疑,建议深入调查其实验设置的真实性。
详细发现
发现 1:文本复制粘贴与粗心拼写错误(量产型特征)
- 位置:第 3.3 节 Comparisons with State-of-the-Art Methods
- 描述:论文中存在多处低级的拼写错误。例如,在两处将常用的数据集名称 "MVTec AD dataset" 错误拼写为 "MVTec AD dateset"。此外,在比较方法的名称上也出现了拼写错误,将 STFPM 写成了 "STPFM",将 Destseg 写成了 "Dsetseg"。
- 证据:这种连名字都能拼错的低级失误,通常发生在大量复制粘贴或使用机器翻译润色后未进行人工校对的情况下。这反映了极差的论文质量控制,让人不得不怀疑作者在做实验时是否也同样粗心。
- 严重程度:🟠
发现 2:基线数据可能存在“客制化”调参或不公平对比
- 位置:Table 1 (Anomaly detection results on MVTec)
- 描述:Table 1 中列举了多个 SOTA 方法的复现结果,其中部分数据与原论文或其他主流 benchmark 存在显著差异。例如:
- 原版 STFPM 论文中,Bottle 类别的 Image-AUROC 约为 90-95% 区间,而本论文中竟然达到了 100%;Hazelnut 也同样被标为 100%。
- 所有对比方法的数据是在作者自己的环境(ResNet18, 256x256)下重新跑的,虽然这在深度学习中是允许的,但“恰好”把某些经典方法跑得比原论文还高,且“恰好”衬托出本文方法(DLKD)在平均成绩上拿下了第一(99.48%),这种过于完美的“碾压”局面存在挑选随机种子或刻意调参以压低对比方法性能的嫌疑。
- 证据:Table 1 中 STFPM 的 Bottle 为 100,而在异常检测领域公认的难度上,STFPM 很难在该类别达到满分。
- 严重程度:🟠
发现 3:方法学的“缝合怪”嫌疑与 Ablation 的巧合
- 位置:Section 2.2 & Table 4, Table 5
- 描述:本文提出的方法(DLKD)是一个非常典型的“模块堆砌”网络。作者将近两年热门的几乎所有组件都塞了进去:知识蒸馏(KD)、状态空间模型(Mamba/SSM)、CNN 局部特征、Coarse-to-fine 策略、伪异常机制。
在消融实验(Table 4 和 Table 5)中,增加任何一个模块,指标都呈现极其稳定且单调递增的现象。例如 Table 5 的 Pixel-AUROC,从 98.03 到 98.06 再到 98.06,PRO 从 94.17 到 94.24 再到 94.38。 - 证据:真实的多模块拼凑网络通常会有性能的波动(某个模块可能在某个指标上变差),但该论文的数据如同切香肠一样精确且单调。这种“加个模块就涨点”的完美消融图,往往是过度调参或选择性报告的结果。
- 严重程度:🟡
发现 4:时间线与引用验证(无明显异常)
- 位置:References & 实验设置
- 描述:检查时间线:作者使用了 2023 年底的 Mamba (Ref 5) 和 2024 年的 MambaAD (Ref 6)、VM-UNet (Ref 10) 等文献。会议举办时间为 2025 年 7 月,以当前日期(2026-06-02)来看,该时间线完全合理。
- 证据:使用了 PyTorch 2.1.1 和 Python 3.9,硬件为 RTX 3090Ti。软硬件环境未穿越,属于正常的研究配置。
- 严重程度:✅
发现 5:数据随机性检测(无实锤,但过于完美)
- 位置:Table 1 & Table 2
- 描述:随机检查了 Table 1 中 "Ours" 列的 AUROC 数值末位分布:8, 0, 0, 4, 2, 0, 8, 8, 0, 5, 5, 0, 4, 0, 2。其中有大量的 100 分和以 8 结尾的分数。
- 证据:经过交叉计算,Table 1 中 Ours 的平均值 (99.48) 在数学计算上是完全自洽的。Table 2 和 Table 3 的均值计算也均无误。数据未出现明显的“伪造随机数”生成的规律性,但因为均是整数或两位小数,缺乏原始的误差棒,无法做进一步的统计学检验。
- 严重程度:🟡
耿同学辣评
这篇论文生动演绎了什么叫“只要我缝合得够快,真理就追不上我”。左边薅一根 Mamba,右边拽一块 CNN,中间再用 Knowledge Distillation 做胶水,就成了所谓的“创新”。更绝的是,论文连自己比较对象的名字都能拼错,把 dataset 写成 dateset。如果作者做实验也像写论文一样心不在焉,那这 99.48% 的 AUROC 怕不是“天选之子”的随机种子才能跑出来的吧?建议改投《拼写纠正与拷贝粘贴》大会。
建议后续行动
- 联系作者要求提供完整的代码、模型权重以及原始的 TensorBoard/Log 日志,验证其是否能复现出如此完美的消融实验结果。
- 在 PubPeer 上提出质疑,重点关注其 Table 1 中复现基线方法的参数设置是否公平。
- 暂不需要向学术委员会举报(目前属于学术严谨性和态度问题,尚未达到恶劣的系统性造假标准)。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。
(注:因仅提供文本,未能进行像素级别的 Western Blot/热力图图片分析,上述结论基于文本逻辑与数据计算得出。)