Loading...
正在加载...
请稍候

PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
  • 作者:Xiaofan Li, Zhizhong Zhang, Xin Tan, Chengwei Chen, Yanyun Qu, Yuan Xie, Lizhuang Ma
  • 期刊:未在文本中明确标注(根据参考文献时间推测为 2023-2024 年提交的计算机视觉顶会/期刊,如 CVPR/ICCV/ECCV 等)
  • 发表年份:2023/2024 (Preprint/Under Review)
  • 论文来源:PromptAD(新).pdf

综合评定:🟡 存疑

详细发现

发现 1:数据非单调性异常(统计学异常检测)

  • 位置:Table 11 (MVTec Image-AUROC) & Table 13 (VisA Image-AUROC)
  • 描述:在 Few-shot 学习中,理论上随着 Shot 数量的增加(1-shot -> 2-shot -> 4-shot),模型的性能应当呈上升趋势,或至少保持稳定。然而,在详细的子类数据中,出现了显著的性能倒挂现象。
  • 证据
    1. Table 11 (MVTec):
      • Cable: 1-shot (94.2) > 2-shot (91.8);且 4-shot (95.4) 仅微弱高于 1-shot。
      • Toothbrush: 1-shot (98.9) > 2-shot (97.5)。
      • Metal nut: 1-shot (99.1) > 2-shot (98.6)。
    2. Table 13 (VisA):
      • Capsules: 2-shot (84.9) > 4-shot (80.6),下降了近 4.3%。
      • Cashew: 1-shot (95.6) > 2-shot (94.7) > 4-shot (93.6),呈持续下降趋势。
  • 分析:虽然基于 CLIP 的小样本学习存在不稳定性,但在多个关键类目上出现“样本越多效果越差”的现象,且论文正文并未对此进行讨论或提供失败案例解释。这可能暗示模型对特定的 Few-shot 采样结果极其敏感,或者作者在挑选随机种子 时存在“过拟合”嫌疑(即只展示了平均结果最好的 5 个种子,而掩盖了某些 Shot 下模型崩溃的情况)。
  • 严重程度:🟠

发现 2:极端的方差波动(数据造假/稳定性检测)

  • 位置:Table 17 (VisA Image-level AUPR)
  • 描述:表格中出现了极其夸张的标准差 (SD),这在统计学上通常意味着实验结果极不稳定,甚至可能存在离群点被强行平均的情况。
  • 证据
    • Table 17, PCB1 (1-shot): PromptAD 得分为 88.0,但标准差高达 ± 11.3。对比同表其他类目(如 Chewinggum 4-shot SD 为 0.3),这个方差大得惊人。
    • Table 17, PCB4 (1-shot): WinCLIP+ 得分为 78.5,标准差更是达到了 ± 15.5
    • 这意味着在不同的随机种子下,模型的性能可能在 70 到 100 之间剧烈跳动。如此巨大的方差使得“平均分”的参考价值大打折扣,所谓的 "First place" 可能只是运气好。
  • 严重程度:🟡 (不一定是造假,但说明方法鲁棒性存疑)

发现 3:文本格式与 OCR 错误(产出异常检测)

  • 位置:Abstract & Introduction
  • 描述:文本中存在多处明显的乱码和格式错误,这通常是不经过仔细校对的 PDF 提取文本或匆忙手稿的特征。
  • 证据
    • 摘要第一段:rst use conventional prompt learning (first 误写为 rst)。
    • 摘要:rst place (first)。
    • Introduction:a rite of prompt-guided anomaly detection. (此处 "rite" 应为 "right"? 或者是拼写错误)。
    • Introduction:Fig.159 (应为 Fig. 1 或 Ref [59]?)。
    • 最明显错误:Code is available at 0/PromptAD.git。这显然是 GitHub 链接缺失了前缀(如 https://github.com/xxx)。
  • 分析:如果是提交给顶会的正式版本,这些低级排版错误显得不够专业;如果是草稿,则可以理解。
  • 严重程度:🟡

发现 4:图片描述与逻辑一致性(图片复用/逻辑检测)

  • 位置:Figure 5 & Figure 6
  • 描述:图表标题与描述存在轻微的脱节。
  • 证据
    • Figure 5 的描述写道:image-level/pixel-level results on MVTec [4] in the 1-shot setting using different hyper-parameter 。这里的  显然是希腊字母 (如 \(\lambda\)\(\mu\)) 的乱码。
    • Figure 6 的描述:The feature used is “cable” from the MVTec [4].。虽然只可视化了 "cable",但论文声称该方法在 11/12 设置下均为第一,仅展示一个简单类别的 T-SNE 图缺乏足够的说服力,容易让人怀疑在其他复杂类别上的特征分布是否也如此理想。
  • 严重程度:🟡

无法检测项目说明

  • 图片复用/拼接检测:作为 AI,我无法直接查看图片像素、背景噪点或 PS 痕迹,只能基于文本描述的逻辑进行检查。
  • 参考文献真实性:提供的文本中参考文献列表缺失了部分内容(仅列出了 [1]-[61] 的部分条目),无法核实所有引用的准确性。

耿同学辣评

这篇论文的核心思路——“既然没有异常样本,那我就用 Normal Prompt 加上‘瑕疵’后缀来伪造异常 Prompt”——非常巧妙,属于典型的“如果没有敌人,我就制造敌人”的思路。

但是!看看那感人的方差(SD=11.3)和诡异的负增长(2-shot 比 1-shot 差),这模型怕不是有点“薛定谔的 SOTA”?运气好(种子选得好)就是State-of-the-Art,运气不好就是 Trash。这就像买彩票,虽然你展示了中奖的那一张,但咱们看看抽屉里那一堆没中奖的废纸(高方差背后的失败案例)好吗?另外,连 Github 链接都能少一半,这是把代码藏在 HTTPS 协议的夹层里了吗?

建议后续行动

  • 联系作者要求提供原始的随机种子和所有的实验日志,特别是那些导致 2-shot 性能下降的 Bad Case。
  • 检查作者发布的 Code(如果链接修好的话),复现其方差,验证是否真的如此不稳定。
  • 询问作者为何在 VisA 数据集的某些类别(如 Capsules)上会出现样本增加性能反而显著下降(4-shot < 2-shot)的现象。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。