Loading...
正在加载...
请稍候

Exploring Large Vision-Language Models for Robust and Efficient Industrial Anomaly Detection

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:Exploring Large Vision-Language Models for Robust and Efficient Industrial Anomaly Detection
  • 作者:Kun Qian, Tianyu Sun, Wenhong Wang
  • 机构:Shangqiu University
  • 期刊:arXiv preprint (arXiv:2412.00890v1)
  • 发表年份:2024

综合评定:🔴 实锤

详细发现

发现 1:AI 幻觉导致的严重“张冠李戴”式虚假引用

  • 位置:Reference 25, Reference 28
  • 描述:作者在文中声称使用了 Vision Transformer (ViT) 模型,并在参考文献 [25] 中引用了一篇 2016 年的文章。同样,作者在对比实验中引用了 SPADE 方法 [28]。经过核实,这两篇引用的内容与文中所声称的方法完全不匹配,属于明显的 AI 大语言模型“幻觉”产物。
  • 证据
    1. 文献 [25] 标题为 "Discriminative unsupervised feature learning with exemplar cnns" (2016),作者是 Alex Krizhevsky 等人,这根本不是 Vision Transformer (ViT) 的开创性论文。真正的 ViT 论文应为 Dosovitskiy 等人 2020 年的 "An Image is Worth 16x16 Words"。
    2. 文献 [28] 被用于代表 SPADE 异常检测算法,但该文献的标题是 "Spatio-temporal visual analysis for urban traffic characters based on video surveillance camera data" (2021),这是一篇关于城市交通监控的论文。真正的 SPADE 是 Cohen 等人 2020 年发表的 "Sub-Image Anomaly Detection with Deep Pyramid Correspondences"。
    3. 类似地,文献 [12] 关于 DALL-E 的引用也非 OpenAI 的原始论文,而是一篇不知名的期刊文章。
  • 严重程度:🔴

发现 2:方法学上的“空中楼阁”(不可实现的伪公式)

  • 位置:Section 3.4 (公式 7)
  • 描述:作者在总损失函数中加入了一个重建损失,其公式定义为计算视觉和文本嵌入的“逆函数”。
  • 证据:公式 (7) 假设预训练编码器存在逆函数 \(f_v^{-1}\)\(f_t^{-1}\),即直接从特征向量重构回原始图像和文本。然而,作者明确说明使用的是预训练的 ViT/GPT 等模型,这些判别式模型根本没有解码器和现成的逆函数。文中也从未定义或引入任何解码器网络结构。这是典型的大语言模型捏造的“听起来很高深但根本无法在代码中实现”的伪数学公式。
  • 严重程度:🔴

发现 3:自相矛盾的数据结论

  • 位置:Section 4.2 (Table 1 及正文描述)
  • 描述:作者在正文中信誓旦旦地宣称:“CLAD consistently outperforms all other methods on both datasets, achieving the highest scores in both anomaly detection and localization tasks.”(CLAD在两个数据集的所有指标上都胜过所有方法)。
  • 证据:观察作者自己提供的 Table 1,在 VisA 数据集的 Pixel-AUC 指标上,WinCLIP 的得分是 96.4 ± 0.4,而作者提出的 CLAD 得分是 96.2 ± 0.1。CLAD 的得分明明比 WinCLIP 低了 0.2,却声称自己取得了最高分。这说明作者连自己编造或生成的数据都没有仔细核对过。
  • 严重程度:🔴

发现 4:过于“完美”且违背常理的统计数据

  • 位置:Table 1, Table 3, Table 4
  • 描述:文中报告的定量评估数据缺乏真实的噪声,且统计学特征极不自然。
  • 证据
    1. 在 Table 1 中,CLAD 在 MVTec-AD 和 VisA 上的 Pixel-AUC 标准差均仅为 0.1(95.3 ± 0.1, 96.2 ± 0.1)。在五次独立实验中,将 AUC 指标的波动控制在 0.1 以内几乎是不可能的,这通常是编造数据时为了凸显“稳定性”而拍脑门定下的数字。
    2. Table 3(人类评估)的得分依次为:3.4, 3.7, 4.1, 4.4, 4.6;Table 4(IoU)的得分依次为:0.63, 0.66, 0.72, 0.75, 0.80。不同方法之间的提升呈现出几乎完美的线性或阶梯状分布,且没有任何标准差或置信区间。
  • 严重程度:🟠

发现 5:文本与图片信息缺失

  • 位置:全文
  • 描述:一篇声称研究“视觉-语言模型”且标榜能够进行“异常定位”的计算机视觉论文,全文竟然没有包含任何一张实验结果图。没有网络结构图,没有异常定位的热力图对比,没有任何真实的工业缺陷示例。
  • 证据:计算机视觉领域的论文通常图文并茂,特别是强调“visual heatmap”的论文。缺乏任何可视化结果,极大概率是因为作者没有真正跑过模型,无法生成真实的热力图,干脆直接省略。
  • 严重程度:🟠

耿同学辣评

这篇论文可以说是“赶尸派”的巅峰之作——从引言到方法再到实验,全篇散发着 ChatGPT 味儿的防腐剂。连大名鼎鼎的 ViT 和 SPADE 文献都能引用成交通监控和十年前的CNN文章,公式里更是直接给 Transformer 求了个“逆函数”,牛顿看了都得给你把棺材板掀开。更搞笑的是,作者在正文里吹嘘自己全项第一,结果一翻表格,自家的 Pixel-AUC 硬生生比对比方法低了 0.2。用AI写论文没问题,但能不能麻烦用手按住 Ctrl+C/V 的时候,稍微用肉眼扫一下表格呢?

建议后续行动

  • 向 arXiv 平台举报该预印本存在严重学术不端(虚假引用、AI捏造事实)
  • 在 PubPeer 上公开质疑其数据的真实性
  • 联系作者所在机构(Shangqiu University)学术委员会,要求核实实验记录和原始代码
  • 强烈建议作者学习《如何正确使用大语言模型辅助科研而不翻车》

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。