Loading...
正在加载...
请稍候

YOLOCrane: An Enhanced YOLOv8-Based Algorithm for Robust Crane Detection in Transmission Line Scenarios

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:YOLOCrane: An Enhanced YOLOv8-Based Algorithm for Robust Crane Detection in Transmission Line Scenarios
  • 作者:Xiaolong Wang, Bo Jiang, Yanwei Zhang, Genyi Wang, Guocheng An
  • 期刊/会议:2025 International Conference on Intelligent Computing (ICICC 2025)
  • 发表年份:2025 (会议时间:2025年7月26-29日)
  • 论文来源:145.pdf

综合评定:🟠 高度可疑

(注:由于仅提供文本而无法获取原始高清图片,本报告暂不触发第一式和第三式的图片检测,主要针对数据逻辑、数学公式和实验合理性进行硬核排查。)

详细发现

发现 1:数据造假检测 —— “薛定谔的训练时间”

  • 位置:Section 3.1, Table 1
  • 描述:在对比 VGG16、VGG16+LBP 和 VGG16+Ours 的实验中,作者声称其提出的 Channel-wise LBP 方法在 CIFAR-10 和 CIFAR-100 上不仅精度大幅提升,而且训练时间几乎没有增加
  • 证据
    • 在 CIFAR-10 上,Baseline VGG16 耗时 3.1h,加入传统 LBP 耗时 10.4h,而加入作者复杂的 "Channel-wise LBP + 可学习掩码 + 归一化" 竟然只耗时 3.2h
    • 在 CIFAR-100 上,同理,从 9.5h 仅增加到 9.7h
    • 违背常理:在深度学习中,加入额外的 unfold 操作、跨通道二值化、可学习掩码相乘以及额外的梯度反传,算力消耗不可能仅增加 3%(0.1h - 0.2h)。除非作者关闭了该模块的梯度,或者这组训练时间是用随机数生成器敲出来的。
  • 严重程度:🔴

发现 2:数据造假检测 —— “惊人一致的推理速度”

  • 位置:Section 3.2, Table 2
  • 描述:在消融实验中,不同模块组合下的模型参数量有明显变化(85.5MB 到 88MB),但其报告的 FPS(每秒帧数)却呈现出极其不自然的紧凑分布。
  • 证据
    • 加入 DAF(B) 后,FPS 为 47.61
    • 加入 DAF(N) 后,FPS 为 47.64
    • 同时加入 DAF(B) 和 DAF(N) 后,FPS 为 47.53
    • 在目标检测中,网络结构的改变(特别是引入复杂的注意力机制和分支)通常会导致显存分配和算子调用效率的波动。FPS 精确到小数点后两位,且在结构大幅改变的情况下仅在小数点后微动(47.53 ~ 47.65),这更像是人为编造或刻意“修饰”的数据,而非真实测量的工程数据。
  • 严重程度:🟠

发现 3:实验设计异常 —— “测试集比验证集简单得多?”

  • 位置:Abstract & Section 3.2, Table 2 & Section 3.3, Table 3
  • 描述:作者声称使用了 CraneLine 数据集,其中包含训练集、验证集和 100 张真实场景测试集。但验证集与测试集的指标存在巨大的逻辑断裂。
  • 证据
    • 在 Table 2 中,YOLOCrane 的验证集 mAP50 为 85.8%,但真实场景测试集的 AP50(test) 竟高达 98.1%
    • 在 Table 3 中,对比模型的验证集 mAP50 在 83.1 - 84.1 之间,但 AP50(test) 也在 95.1 - 96.7 之间。
    • 违背常理:一个在合成数据(通常有完美的标注)上训练的模型,去测试 100 张“真实世界复杂场景”的图片,通常会因为 Sim-to-Real Gap(域偏移)导致性能下降。但这篇论文中,真实测试集的精度(98.1%)竟然比包含合成图像的验证集精度(85.8%)高了整整 12.3%!这说明所谓的“100张真实测试图”要么是极其简单的“白送”样本,要么存在数据泄露,要么就是结果被严重挑选过。
  • 严重程度:🔴

发现 4:方法学异常 —— “乱码级的数学公式”

  • 位置:Section 2, Channel-wise LBP, 公式 (5)
  • 描述:论文中试图解释可学习掩码 \(M\) 的梯度回传机制,但给出的公式 (5) 在文本层面上呈现出极其混乱的排版和逻辑。
  • 证据
    • 文本显示:LjiCenterN M L ji ji o jiji o ji δ ∇ ⋅ > I = ∂ ∂ ∑ , ,, ) (
    • 这种不仅是排版错误,甚至将微积分符号、损失函数梯度 \(\nabla_L\)、指示函数 \(\mathbb{1}\) 胡乱堆砌在一起的现象,通常发生在直接复制粘贴其他论文的公式而不理解其含义,或者使用低劣的 PDF 转 Word 工具试图修改他人文章时。
    • 在严谨的学术论文中,核心贡献模块的损失推导写成这样,极度不正常。
  • 严重程度:🟠

发现 5:数据集描述异常 —— “强迫症的合成数据”

  • 位置:Section 3, Experiments (首段)
  • 描述:对于 CraneLine 数据集的描述存在极度不符合常理的定语。
  • 证据:原文写道:“The dataset comprises 4,739 training images and 300 validation images, each containing 11 cranes of varying sizes and positions...”。
    • 翻译过来是:4739张训练图和300张验证图,每一张都正好包含 11 台起重机
    • 真实的起重机检测数据集不可能每张图片都“不多不少正好有11个目标”。如果是合成数据,这种死板的设定说明数据生成脚本缺乏随机性(比如固定生成11个目标)。用这种极度死板的数据训练出的模型,其泛化能力根本无法代表真实水平。
  • 严重程度:🟡

耿同学辣评

这篇论文的数据简直比我衣柜里的格子衫还要整齐!加了一堆复杂的通道注意力机制和LBP算子,训练时间居然连 0.1 个小时都不舍得涨;更离谱的是,模型去测“复杂真实世界图片”,准确率反而比验证集暴涨了 12%。兄弟,你这不是做目标检测,你这是在做“定向狙击”吧?还有那个写成一锅粥的公式 (5),是用脚趾头在键盘上滚出来的吗?

建议后续行动

  • 要求作者公开 Table 1 中 CIFAR 数据集的训练日志和 Table 2 的原始 FPS 测试脚本
  • 要求作者公开那 100 张“神级”真实测试图,看看是不是每张图里起重机的特征都大得像灯笼
  • 在 PubPeer 上提出对公式 (5) 排版及数学逻辑的质疑
  • 核查该论文是否涉嫌洗稿或拼接开源代码而不注明出处

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。