PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:PromptAD: Learning Prompts with only Normal Samples for Few-Shot Anomaly Detection
- 作者:Xiaofan Li, Zhizhong Zhang, Xin Tan, Chengwei Chen, Yanyun Qu, Yuan Xie, Lizhuang Ma
- 期刊:未在文本中明确标注(根据参考文献时间推测为 2023-2024 年提交的计算机视觉顶会/期刊,如 CVPR/ICCV/ECCV 等)
- 发表年份:2023/2024 (Preprint/Under Review)
- 论文来源:PromptAD(新).pdf
综合评定:🟡 存疑
详细发现
发现 1:数据非单调性异常(统计学异常检测)
- 位置:Table 11 (MVTec Image-AUROC) & Table 13 (VisA Image-AUROC)
- 描述:在 Few-shot 学习中,理论上随着 Shot 数量的增加(1-shot -> 2-shot -> 4-shot),模型的性能应当呈上升趋势,或至少保持稳定。然而,在详细的子类数据中,出现了显著的性能倒挂现象。
- 证据:
- Table 11 (MVTec):
- Cable: 1-shot (94.2) > 2-shot (91.8);且 4-shot (95.4) 仅微弱高于 1-shot。
- Toothbrush: 1-shot (98.9) > 2-shot (97.5)。
- Metal nut: 1-shot (99.1) > 2-shot (98.6)。
- Table 13 (VisA):
- Capsules: 2-shot (84.9) > 4-shot (80.6),下降了近 4.3%。
- Cashew: 1-shot (95.6) > 2-shot (94.7) > 4-shot (93.6),呈持续下降趋势。
- Table 11 (MVTec):
- 分析:虽然基于 CLIP 的小样本学习存在不稳定性,但在多个关键类目上出现“样本越多效果越差”的现象,且论文正文并未对此进行讨论或提供失败案例解释。这可能暗示模型对特定的 Few-shot 采样结果极其敏感,或者作者在挑选随机种子 时存在“过拟合”嫌疑(即只展示了平均结果最好的 5 个种子,而掩盖了某些 Shot 下模型崩溃的情况)。
- 严重程度:🟠
发现 2:极端的方差波动(数据造假/稳定性检测)
- 位置:Table 17 (VisA Image-level AUPR)
- 描述:表格中出现了极其夸张的标准差 (SD),这在统计学上通常意味着实验结果极不稳定,甚至可能存在离群点被强行平均的情况。
- 证据:
- Table 17, PCB1 (1-shot): PromptAD 得分为 88.0,但标准差高达 ± 11.3。对比同表其他类目(如 Chewinggum 4-shot SD 为 0.3),这个方差大得惊人。
- Table 17, PCB4 (1-shot): WinCLIP+ 得分为 78.5,标准差更是达到了 ± 15.5。
- 这意味着在不同的随机种子下,模型的性能可能在 70 到 100 之间剧烈跳动。如此巨大的方差使得“平均分”的参考价值大打折扣,所谓的 "First place" 可能只是运气好。
- 严重程度:🟡 (不一定是造假,但说明方法鲁棒性存疑)
发现 3:文本格式与 OCR 错误(产出异常检测)
- 位置:Abstract & Introduction
- 描述:文本中存在多处明显的乱码和格式错误,这通常是不经过仔细校对的 PDF 提取文本或匆忙手稿的特征。
- 证据:
- 摘要第一段:
rst use conventional prompt learning(first 误写为 rst)。 - 摘要:
rst place(first)。 - Introduction:
a rite of prompt-guided anomaly detection.(此处 "rite" 应为 "right"? 或者是拼写错误)。 - Introduction:
Fig.159(应为 Fig. 1 或 Ref [59]?)。 - 最明显错误:Code is available at
0/PromptAD.git。这显然是 GitHub 链接缺失了前缀(如https://github.com/xxx)。
- 摘要第一段:
- 分析:如果是提交给顶会的正式版本,这些低级排版错误显得不够专业;如果是草稿,则可以理解。
- 严重程度:🟡
发现 4:图片描述与逻辑一致性(图片复用/逻辑检测)
- 位置:Figure 5 & Figure 6
- 描述:图表标题与描述存在轻微的脱节。
- 证据:
- Figure 5 的描述写道:
image-level/pixel-level results on MVTec [4] in the 1-shot setting using different hyper-parameter。这里的显然是希腊字母 (如 \(\lambda\) 或 \(\mu\)) 的乱码。 - Figure 6 的描述:
The feature used is “cable” from the MVTec [4].。虽然只可视化了 "cable",但论文声称该方法在 11/12 设置下均为第一,仅展示一个简单类别的 T-SNE 图缺乏足够的说服力,容易让人怀疑在其他复杂类别上的特征分布是否也如此理想。
- Figure 5 的描述写道:
- 严重程度:🟡
无法检测项目说明
- 图片复用/拼接检测:作为 AI,我无法直接查看图片像素、背景噪点或 PS 痕迹,只能基于文本描述的逻辑进行检查。
- 参考文献真实性:提供的文本中参考文献列表缺失了部分内容(仅列出了 [1]-[61] 的部分条目),无法核实所有引用的准确性。
耿同学辣评
这篇论文的核心思路——“既然没有异常样本,那我就用 Normal Prompt 加上‘瑕疵’后缀来伪造异常 Prompt”——非常巧妙,属于典型的“如果没有敌人,我就制造敌人”的思路。
但是!看看那感人的方差(SD=11.3)和诡异的负增长(2-shot 比 1-shot 差),这模型怕不是有点“薛定谔的 SOTA”?运气好(种子选得好)就是State-of-the-Art,运气不好就是 Trash。这就像买彩票,虽然你展示了中奖的那一张,但咱们看看抽屉里那一堆没中奖的废纸(高方差背后的失败案例)好吗?另外,连 Github 链接都能少一半,这是把代码藏在 HTTPS 协议的夹层里了吗?
建议后续行动
- 联系作者要求提供原始的随机种子和所有的实验日志,特别是那些导致 2-shot 性能下降的 Bad Case。
- 检查作者发布的 Code(如果链接修好的话),复现其方差,验证是否真的如此不稳定。
- 询问作者为何在 VisA 数据集的某些类别(如 Capsules)上会出现样本增加性能反而显著下降(4-shot < 2-shot)的现象。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。