Loading...
正在加载...
请稍候

PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
  • 作者:Xiaofan Li, Zhizhong Zhang, Xin Tan, Chengwei Chen, Yanyun Qu, Yuan Xie, Lizhuang Ma
  • 期刊:提交至 CVPR/ICCV 级别会议(根据参考文献年份推断,文中引用了 CVPR 2023, ICCV 2023 等最新文献)
  • DOI:未提供
  • 发表年份:2023/2024 (预印本)
  • 论文来源:PromptAD(新).pdf

综合评定:🟠 高度可疑

详细发现

发现 1:数据过于“完美”——经典的指标饱和与零方差

  • 位置:Table 11 (Comparison of image-level anomaly detection... on MVTec)
  • 描述:在 MVTec 数据集的 1-shot、2-shot 和 4-shot 实验中,该论文报告了多个类别的 AUROC 达到了 100.0 ± 0.0。例如:
    • Carpet 类别在 2-shot 和 4-shot 时均为 100.0 ± 0.0。
    • Leather 类别在 1-shot, 2-shot, 4-shot 均为 100.0 ± 0.0。
    • Tile 类别在 1-shot, 2-shot, 4-shot 均为 100.0 ± 0.0。
    • Bottle 类别在 4-shot 时为 100.0 ± 0.1(接近完美)。
  • 证据:虽然 MVTec 的某些类别(如 Leather)确实相对容易,但在 Few-Shot(1~4张图) 设置下,多次随机种子实验(论文提及使用了 5 个 seeds)的标准差恰好为严格的 0.0 是非常反直觉的。这意味着模型在所有测试集图片上都做到了完美分类,没有任何边缘样本。这在异常检测中通常意味着数据泄漏或者指标计算方式存在问题(例如使用了包含背景的全图预测而非缺陷区域)。
  • 严重程度:🟠

发现 2:基线数据异常波动——对比实验的“薛定谔的方差”

  • 位置:Table 13 (Comparison of image-level anomaly detection... on VisA)
  • 描述:在 VisA 数据集上,作者引用的基线方法(如 WinCLIP+)的标准差表现出了极不合理的剧烈波动,而本文方法的方差却极小。
    • PCB1 类别 (1-shot):WinCLIP+ 的结果为 75.6 ± 23.0,而本文 PromptAD 为 88.7 ± 0.7
    • PCB4 类别 (1-shot):WinCLIP+ 的结果为 85.2 ± 8.9,而本文为 91.4 ± 3.2
    • Macaroni1 (2-shot):PaDiM 的结果为 62.2 ± 5.0,而 SPADE 为 69.1 ± 8.2
  • 证据:WinCLIP 作为一篇发表在顶级会议上的方法,其在 PCB1 上的方差竟然高达 23.0(标准差大于均值的四分之一),这在图像分类任务中几乎是崩溃的表现。相比之下,本文方法的方差都在 1.0 左右。这种“我方稳如老狗,敌方疯狂翻车”的数据,通常暗示作者在重跑基线时存在问题(如代码未收敛、超参数没调好),或者为了突出自身方法的优越性,选择性报告了表现最差的基线运行结果
  • 严重程度:🔴

发现 3:正文文本逻辑断裂与复制粘贴残留

  • 位置:Introduction (第 1 页)
  • 描述:论文在描述 Fig. 1 时,存在明显的文本复制粘贴错误导致的逻辑不通和乱码。
    • 引用错误:“As illustrated in Fig.159] aims to automatically learn prompts...” (Fig. 159?这篇论文总共也就十几张图,这里的 159 极大概率是引用文献 [59] (CoOp) 的残留,作者在修改时忘了删除)。
    • 断句异常:“As illustrated in Fig.vantages, it can be seen that...” (Fig. vantages? 显然是 Figure 的某个词被吞掉了,或者是拼写错误)。
  • 证据:这种低级错误表明论文的写作过程非常仓促,或者是将不同版本的草稿拼接而成。虽然主要是写作态度问题,但在如此严谨的顶会论文中出现,令人对其实验的严谨性产生连带怀疑。
  • 严重程度:🟡

发现 4:公式符号书写极其随意

  • 位置:Section 4.4 Anomaly Detection (公式 17, 18)
  • 描述:论文给出了融合分数的计算公式,形式非常怪异。
    • 公式 17:M_pix = 1:0 = (1:0 = M_v + 1:0 = M_t)
    • 公式 18:S_img = 1:0 = (1:0 = max M_v + 1:0 = S_t)
  • 证据:这里的 1:0 = 显然是OCR识别错误或者作者LaTeX源码中对公式 \(\frac{1.0}{...}\) 的误写。正确的谐波平均公式应该是 \(2xy/(x+y)\) 或者 \(1/(1/x + 1/y)\)。虽然能猜出意思,但这种写法在学术论文中是极其不专业的,属于方法学描述异常
  • 严重程度:🟡

耿同学辣评

朋友们,看到这篇论文的数据表格,我仿佛看到了一个全科满分的“神童”。

Few-shot 异常检测,只看 1~4 张正常图片,结果在 MVTec 上刷出了一堆 100.0 ± 0.0 的满分成绩。这意思是,只要模型看了一眼正常图,它就上帝视角附体,一眼万年,永远不会错?

更有意思的是那个 VisA 数据集的对比实验,对手 WinCLIP 在 PCB1 上的方差高达 23.0,这就像是在说:“我的对手不仅跑得慢,而且还是闭着眼睛在跑,甚至还时不时往后倒退两步”。这种靠踩着别人崩溃的数据来凸显自己牛逼的论文,咱们最好多留个心眼。

再看看正文,“Fig. 159” 都出来了,看来作者在复制粘贴 CoOp 的句子时,手抖了一下。建议这帮同学下次提交前,先买个纠错软件,顺便把那个像乱码一样的公式 17 修一下。


建议后续行动

  • 检查原始数据:强烈建议要求作者提供 Table 11 中所有 100.0 ± 0.0 类别的原始预测得分和 Ground Truth,验证是否存在数据泄漏(例如训练集和测试集有重叠,或者是背景全黑导致的 trivial solution)。
  • 验证基线复现代码:要求作者提供 WinCLIP+ 在 VisA 上的复现代码和日志,特别是检查为何 PCB1 的方差会达到不可思议的 23.0。
  • 联系作者要求提供原始数据
  • 在 PubPeer 上提出质疑
  • 向期刊编辑部举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。