Loading...
正在加载...
请稍候

YOLOCrane: An Enhanced YOLOv8-Based Algorithm for Robust Crane Detection in Transmission Line Scenarios

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:YOLOCrane: An Enhanced YOLOv8-Based Algorithm for Robust Crane Detection in Transmission Line Scenarios
  • 作者:Xiaolong Wang, Bo Jiang, Yanwei Zhang, Genyi Wang, Guocheng An
  • 期刊/会议:2025 International Conference on Intelligent Computing (ICC 2025)
  • DOI:文本中未提供
  • 发表年份:2025 (会议时间:2025年7月26-29日)
  • 论文来源:145.pdf

综合评定:🟠 高度可疑

虽然本文的实验数据表面上看较为完整,但在公式推导的逻辑性、引用文献的严谨性以及数据集设置的合理性上存在多处无法用“粗心”轻易解释的硬伤。特别是将反向传播梯度公式写入前向传播特征提取模块,属于典型的“堆砌公式装点门面”的学术不端嫌疑。

详细发现

发现 1:伪科学公式堆砌(前向传播中强行插入梯度公式)

  • 位置:Page 4, Section 2 (Channel-wise LBP), 公式 (5)
  • 描述:在描述 Channel-wise LBP 模块的前向传播特征提取过程时,作者给出了公式 (5)。该公式中赫然出现了 \(\nabla_\theta L\)(损失函数对参数的梯度)和 \(\frac{\partial L}{\partial M_{j,i}}\) 等项。
  • 证据:在深度学习中,前向传播的作用是计算输出特征,而涉及梯度的计算属于反向传播的范畴。除非作者自己手写了一个极其复杂的自定义求导算子(文中并未声明),否则正常的前向特征提取模块不可能包含 Loss 对权重的梯度项。这明显是作者为了让方法部分显得“高深”、“数学味浓厚”,而从其他论文里生搬硬套、复制粘贴了随机梯度下降(SGD)或反向传播的公式,属于学术写作中的严重伪科学造假行为
  • 严重程度:🔴 (实锤错误)

发现 2:张冠李戴的参考文献引用

  • 位置:Page 7, Section 3.3 (文字描述与 References 列表对比)
  • 描述:作者在对比实验中写道:“compared YOLOCrane with YOLOv11x [22], RT-DETRx [23], and TPH-YOLOv5x [24]”。然而,查阅文末参考文献列表:
    • 参考文献 [22] 的标题是 "DETRs beat YOLOs on real-time object detection"(这是 RT-DETR 的论文)。
    • 参考文献 [23] 的标题是 "YOLOv11: An overview of the key architectural enhancements"(这是 YOLOv11 的论文)。
  • 证据:正文在引用 YOLOv11 时给了 RT-DETR 的文献编号,在引用 RT-DETR 时给了 YOLOv11 的文献编号。这种张冠李戴说明作者在写作时极有可能根本没看原始文献,只是从其他论文的对比实验表里直接复制了结果,甚至连引用标号都抄串行了。
  • 严重程度:🟠 (高度可疑,涉嫌未阅读原文的直接数据搬运)

发现 3:违背常理的“合成到真实”泛化性能

  • 位置:Page 6, Table 2 及相关文字
  • 描述:文中声明使用的数据集包含合成图像和真实图像。表 2 显示,基线模型 YOLOv8x 在验证集上的 mAP50 仅为 83.4%,但在 100 张真实世界测试集上的 AP50 高达 95.5%。改进后的 YOLOCrane 验证集 mAP50 为 85.8%,真实测试集 AP50 更是达到了惊人的 98.1%。
  • 证据:在计算机视觉领域,使用纯合成数据训练的模型,在真实场景测试时通常会因为 Sim-to-Real Gap(域迁移鸿沟)导致性能显著下降。而本文中,真实世界测试集的精度(98.1%)竟然比模型验证集精度(85.8%)高出 12.3 个百分点!除非这 100 张真实图片简单到极其离谱,或者验证集被刻意设置得极其困难,否则这种“闭卷考试比开卷考试分数高得多”的现象极度违背常理。存在“挑简单图做测试集”或“人工调参迎合测试集”的嫌疑。
  • 严重程度:🟠 (严重违背领域常理)

发现 4:图表描述与文字内容的矛盾

  • 位置:Page 6, Section 3.3 及 Fig. 6 描述
  • 描述:作者在文中写道:“To further validate... we selected 4 representative images... As shown in Fig. 6, the selected three test images feature cranes with small proportions...”。
  • 证据:前一句刚说是挑选了 4 张代表性图片(4 representative images),紧接着下一句就变成了“如图6所示,挑选的三张测试图片(the selected three test images)”。前言不搭后语,说明作者在拼凑论文时缺乏基本的校对,连图表对应的实验样本数量都没有统一口径。
  • 严重程度:🟡 (粗心大意,写作极不严谨)

发现 5:推理速度的“精确停滞”

  • 位置:Page 6, Table 2
  • 描述:在消融实验中,引入了不同的模块(SB, DAF(B), DAF(N)),虽然参数量在变化,但 FPS(每秒帧数)呈现极其诡异的微小波动:47.65, 47.61, 47.64, 47.53。
  • 证据:在 NVIDIA A800 这种高端显卡上,TensorRT 或 PyTorch 推理的耗时受到内存分配和 CUDA 核心调度的微小影响,通常会有一定的浮动。但在多组不同结构(包含不同分支的 Attention 模块)下,FPS 全部死死地卡在 47.5 ~ 47.6 之间,精确到小数点后两位都几乎不变。这不符合常理,通常意味着浮点运算量并没有实质性的增加,或者测试方法存在标准性缺陷(例如没有预热设备、或者 I/O 读写成为了绝对瓶颈,掩盖了模型真实的计算开销)。
  • 严重程度:🟡 (指标有效性存疑)

耿同学辣评

这篇论文把“缝合怪”和“叠词汇”发挥到了新高度。前向传播的公式里硬生生塞进去 Loss 的梯度项,生怕别人看不出来这是从反向传播教材里复制粘贴过来的吗?还有那个惊天地泣鬼神的 Sim-to-Real 泛化能力,合成数据训出来的模型,在真实图片上反而精度暴涨 12 个点,你当真实世界的物理定律不存在是吧?最逗的是参考文献,引用 RT-DETR 给贴个 YOLOv11 的链接,连标号都抄串行了,你们写 Related Work 的时候真的点开过哪怕一篇文献吗?

建议后续行动

  • 要求作者详细解释公式 (5) 中出现 \(\nabla_\theta L\) 的物理意义与代码实现。
  • 要求作者公开那 100 张测试原图以及验证集的部分样本,审查 Sim-to-Real 性能暴增的原因。
  • 在 PubPeer 上提出质疑,提醒同行谨慎引用其提出的 Channel-wise LBP 机制。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。