Calibrating Uncertainty for Zero-Shot Adversarial CLIP
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Calibrating Uncertainty for Zero-Shot Adversarial CLIP
- 作者:Wenjing Lu, Zerui Tao, Yuning Qiu, Dongping Zhang, Yang Yang, Qibin Zhao
- 期刊/会议:Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
- DOI/ArXiv:arXiv:2512.12997v3 [cs.CV]
- 发表时间线:ArXiv v3 提交日期为 2026年6月5日(非常符合 ICML 2026 的 Camera-Ready 节点)
- 论文来源:UCAT(Calibrating Uncertainty for Zero-Shot Adversarial CLIP).pdf
综合评定:🟠 高度可疑
(注:本论文在数学逻辑和实验数据上具有一定的迷惑性,但在方法论的核心推导与实验验证之间发现了难以调和的“为了出结果而强行设定参数”的严重嫌疑。)
详细发现
发现 1:核心数学参数的“薛定谔状态”(方法学异常)
- 位置:Appendix C.1 (Implementation Details for Uncertainty Quantification)
- 描述:作者在正文推导(Section 4)中,明确建立了 CLIP 的 learnable temperature(\(\tau\))与狄利克雷分布浓度参数的映射关系。然而,在附录 C.1 中,作者发现当模型训练后的 \(\tau\) 太小(如 \(\tau \approx 0.01\))时,Epistemic Uncertainty (EU) 会发生退化。为了解决这个问题,作者居然在计算 EU 时强行使用 \(\tau \approx 0.07\),而在计算 Aleatoric Uncertainty (AU) 时保留 \(\tau \approx 0.01\)。
- 证据:原文表述:“To avoid this issue, we adopt \(\tau \approx 0.07\) for computing EU, while keeping \(\tau \approx 0.01\) for AU.”。在同一模型的同一前向传播中,对两个相关的不确定性指标使用两个不同尺度的温度系数进行缩放,这在数学上直接打破了 Section 4 中 Lemma 4.3 的理论自洽性。这说明模型实际输出的特征并不符合作者的理论预期,作者只能通过“手动调参”来让图表(Figure 5-7)看起来合理。
- 严重程度:🔴 (核心理论与实验实现脱节,涉嫌结果导向的“数据美容”)
发现 2:表格数据的“避重就轻”与排版缺失(数据造假/呈现异常)
- 位置:Table 2 & Table 6 (Zero-Shot Adversarial Robustness)
- 描述:在 Table 2 中,基线模型 TeCoA 和 FARE 等在 PGD、CW 等攻击下的数据呈现大面积的缺失(空白),甚至连核心的 Average 和 H 值都残缺不全。对比之下,本文提出的 UCAT 数据却十分完整。
- 证据:例如 Table 2 中 PGD 攻击下,TeCoA 的数据仅为“50.96 39.33 21.64 69.78 20.07 13.50 37.80 19.17 18.30”,后续的数据集以及 Average 完全消失。虽然这可能部分归咎于 PDF 文本提取的丢失,但在严谨的顶会论文中,如果是因为基线模型在某些数据集上崩溃(精度为0)而省略,必须明确标注为“0.00”或“N/A”,而不是留白。这种呈现方式容易让人怀疑是否在选择性报告有利数据。
- 严重程度:🟡 (需确认是排版灾难还是选择性报告)
发现 3:诡异的不确定性变化数值(数据真实性存疑)
- 位置:Figure 5, Figure 6, Figure 7 的标注文本
- 描述:在展示 PU、AU、EU 变化的柱状图中,作者在图中直接标注了变化量。对比 CLIP 和 Ours (UCAT) 的数据,呈现出一种极度“规整”的规律。
- 证据:在 Figure 5 (PU) 中,所有 CLIP 模型的数值均为负数(如 -0.140, -0.077),而所有 UCAT (Ours) 模型的数值均为正数(如 +0.030, +0.043)。不仅在 PU 中如此,在 Figure 6 (AU) 中,UCAT 的变化全为正,在 Figure 7 (EU) 中也几乎全为正。真实的多数据集实验由于领域差异,通常会出现参差不齐的正负波动(有的数据集涨,有的跌)。UCAT 能够在 16 个完全不同的数据集上实现“全军覆没”般的单向改善(只有 EuroSAT 一个例外),这种完美控制反映了极高的“调参”痕迹。
- 严重程度:🟠 (真实实验极难出现如此完美的单向结果,疑似为了证明结论而筛选了超参数)
发现 4:时间线检查(第五式)
- 位置:全文
- 描述:本文 arXiv v3 版本日期为 2026 年 6 月 5 日,目标会议为 ICML 2026。
- 证据:结合当前日期(2026-06-15),时间线完全合理。引用文献中包含大量 2024、2025 乃至 2026 年的文献(如 Dong et al., 2025; Yu et al., 2026),符合当前学术前沿的节奏。
- 严重程度:✅ (时间线清白)
无法检测的维度说明(耿同学六式之第一式与第三式)
- 图片复用与拼接检测:由于当前输入仅为文本提取结果,未能提供足够的像素级图片信息。因此无法对 Figure 1-7 的折线图、柱状图以及架构图是否存在 PS 痕迹、元素复用进行法医级别的图像鉴定。单从文本描述来看,逻辑链条尚属完整。
耿同学辣评
这篇论文的数学推导看似严丝合缝,从 Dirichlet 分布到 KL 散度写得头头是道。结果一翻附录,好家伙,左边脸蛋涂 \(\tau=0.01\) 的粉底,右边脸蛋抹 \(\tau=0.07\) 的腮红。合着前面推导了半天的理论模型它不好用,最后全靠“手动美颜”来硬撑不确定性下降的完美数据呢?这就像是你买了一台号称自动控温的高档烤箱,结果烤鸡的时候你还得拿个备用温度计自己往里塞。理论千万条,自洽第一条,且发且珍惜吧!
建议后续行动
- 要求作者公开完整的评测代码,特别是计算 PU、AU、EU 时的具体 \(\tau\) 取值与数学映射脚本。
- 质疑作者为何在不同不确定性度量中使用不同温度系数,要求其给出理论证明或撤回过度完美的实验图表。
- 审查 Table 2 和 Table 6 中基线模型数据缺失的原因,确认是否存在隐瞒不利数据的学术不端行为。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。