Loading...
正在加载...
请稍候

Clear Nights Ahead: Towards Multi-Weather Nighttime Image Restoration

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:Clear Nights Ahead: Towards Multi-Weather Nighttime Image Restoration
  • 作者:Yuetong Liu, Yunqiu Xu, Yang Wei, Xiuli Bi, Bin Xiao
  • 期刊/会议:AAAI-26 (The Fortieth AAAI Conference on Artificial Intelligence)
  • DOI:暂未提供
  • 发表年份:2026

综合评定:🟡 存疑

详细发现

发现 1:文本与数据自相矛盾(过度谦虚的“一般”)

  • 位置:Experiments 部分(Page 7400)与 Table 2
  • 描述:论文在解释 Table 2 的定量结果时声称:“As the training data lack dedicated flare samples, its performance in flare removal remains moderate.”(由于训练数据缺乏专门的光晕样本,其在去除光晕方面的性能仍然一般)。然而,分析 Table 2 中的“Flare”列数据发现,ClearNight 的得分为 38.7707。
  • 证据:在 Table 2 的 10 个对比方法/Baseline 中,ClearNight 的 Flare PSNR 得分(38.7707)实际上击败了包括 Baseline(36.0821)、TKL(36.7239)、FSDGN(38.7223)、WGWS(32.1085)、RLP(34.7658)、DiffUIR(31.2789)、DEA-Net(38.6533)在内的 7 个模型,排名第四(仅次于 RAMiT、WeatherDiff、AWRaCLe)。这在学术表现上绝非“一般”,这种明显的“过度贬低”与实际漂亮的数据存在强烈的逻辑冲突。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 2:主观评测样本量极小且缺乏统计支撑(经典 CV 算法通病)

  • 位置:Dataset Analysis 部分(Figure 6 描述)
  • 描述:为了证明其合成的光照感知数据集(Illumination-aware degradation)更逼真,作者招募了 10 名志愿者对图像的真实度、光照复杂度和任务相关性进行排序。
  • 证据:原文明确写道:“Ten volunteers are recruited to rank image quality on authenticity, lighting complexity and task relevance.”。仅在 10 人的小样本上得出的人类偏好(Human Ranking)缺乏置信区间和统计学检验(如 t 检验)。虽然这在计算机视觉领域是常见套路,但从严谨的学术诚信角度来看,小样本主观评分极易被挑选特定图片所操纵。
  • 严重程度:🟡
  • 复核状态:✅ 成立

⚠️ 发现 3:无法进行像素级图片复用与拼接检测

  • 位置:论文全局图片
  • 描述:由于输入文本存在极其明显的 PDF 提取编码错误(如 ×rst 代替 firstSpec ×c ty 代替 SpecificityClearN }ht 代替 ClearNight),且当前只有纯文本流,无法提取 Figure 1~11 的原图进行视觉相似度比对。
  • 证据:低级视觉(图像复原)领域的造假重灾区通常在于“过度锐化对比图”或“把别家的图当做自己的真实世界测试图”。本报告受限于模态,无法对 Figure 8 中的可视化对比图进行 PS 痕迹排查。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足

发现 4:数据一致性与时间线检查正常

  • 位置:Tables 2, 4 与 References
  • 描述:虽然不能查图,但查了数!数据内部一致且时间线合理。
  • 证据:Table 4 消融实验中 Baseline 的分数(28.7976 / 0.8825)与 Table 2 主实验中的 Baseline 数值分毫不差,符合逻辑。此外,参考文献中出现了 2026 年的文献(如 Wu, Z. et al. 2026, AAAI),基于当前检测时间点(2026年6月),AAAI 2026 的论文早已公开并被引用,时间线完全合理,无“穿越时空”造假痕迹。
  • 严重程度:✅
  • 复核状态:✅ 成立

耿同学辣评

这篇 AAAI 2026 的 CV 论文在数学数据上算是守住了底线(消融实验和主实验对得上),但非得在文字上玩“凡尔赛”——明明光晕去除性能把一大半对手按在地上摩擦(38.77 排第四),非要红口白牙地说自己表现“一般”。怎么的,是怕 RAMiT(43.00)觉得你太嚣张吗?另外,只找了 10 个志愿者打分就来证明数据集牛,这样本量连发个朋友圈问卷都不够,建议下次多请几位审稿人喝奶茶再做个大样本统计吧!当然,受限于目前纯文本打假的局限性,咱们也无法拿着放大镜去扒拉对比图里的像素猫腻,只能暂且给它记上一笔。

建议后续行动

  • 联系作者要求提供 AllWeatherNight 数据集中真实图像(Real-world subset)的原始来源链接,排查是否未经授权使用了他人版权图片。
  • 要求作者提供完整的 10 名志愿者主观打分原始数据,而非仅仅报告均值。
  • 在 PubPeer 上提出关于“文本描述(moderate performance)与实际数据(Top 4 performance)严重背离”的疑问。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。