Loading...
正在加载...
请稍候

基于大坝监测数据的结构性态自适应预测

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 论文来源:基于大坝监测数据的结构性态自适应预测_潘登.pdf
  • 标题:基于大坝监测数据的结构性态自适应预测
  • 作者:潘登
  • 期刊:扬州大学硕士学位论文 (全日制专业学位)
  • 指导教师:李占超 副教授,杨阳 高级工程师
  • 答辩日期:2025 年 5 月 15 日

综合评定:🔴 实锤

详细发现

发现 1:铁证如山的复制粘贴 / 数据捏造

  • 位置:第 4 章,表 4-4 (第 93 页) vs 表 4-6 (第 96 页)
  • 描述:论文在展示基于“样本熵”和“模糊熵”的自适应变结构预测模型权重时,列出了两个看似不同实验下的权重结果表。然而,比对两组数据发现,它们的数据完全一模一样
  • 证据
    • 表 4-4 (基于样本熵的最优隐层单元数的权重表)
      • ARIMA-RLS 模型:Min -0.3988, Max 1.3112, Avg 0.2553
      • LSTM-ADAM 模型:Min -0.7247, Max 1.0292, Avg 0.4191
      • LINEAR-VSSLMS 模型:Min -0.4884, Max 0.9577, Avg 0.1603
      • RF-AGA 模型:Min -1.2611, Max 0.8492, Avg 0.1653
    • 表 4-6 (基于模糊熵的最优隐层单元数的权重表)
      • 数据与表 4-4 逐字逐句完全相同,连小数点后四位都分毫不差。
  • 分析:这是典型的“复制粘贴”式造假,或者是用随机数/固定模板生成的虚假数据。两组完全不同的输入数据区间(样本熵区间 vs 模糊熵区间),经过神经网络训练后,得到的最终权重向量不可能完全一致(甚至小数点后四位都相同)。这是确凿的学术不端证据。
  • 严重程度:🔴

发现 2:逻辑自洽性崩塌的“异常”权重

  • 位置:第 4 章,表 4-2, 4-4, 4-6, 4-8 (权重表对比)
  • 描述:对比四组不同输入(近似熵、样本熵、模糊熵、原始数据)下的权重结果,数据呈现出极度不合理的特征。
  • 证据
    • 前三组(表 4-2, 4-4, 4-6)的权重范围基本在 [-1.5, 1.5] 之间,属于正常范围。
    • 然而在表 4-8(基于原始数据)中,权重出现了极端的异常值:
      • ARIMA-RLS 模型:Min -25.8149
      • LSTM-ADAM 模型:Max 25.6302
  • 分析:BP 神经网络的权重突然爆炸到 25 这个量级,通常意味着网络训练发散、梯度爆炸或者未经过标准化处理。但在同一个流程图(图 4-3)下,前三次实验稳定,第四次却出现如此巨大的数值波动,且作者在正文中对此毫无察觉或避而不谈,仅用“预测效果最差”一笔带过。这暗示作者可能并未真正跑通代码,或者是在调参无果后强行凑数。
  • 严重程度:🟠

发现 3:“薛定谔的模型表现”与文本矛盾

  • 位置:第 3 章 (3.5.5 节) vs 第 5 章 (5.1 节 结论)
  • 描述:作者在结论部分对哪个模型表现最好存在前后矛盾的描述,暴露出其可能是拼凑结论。
  • 证据
    • 第 3 章 3.5.5 节:“在近似熵方法识别的预测样本区间中,随机森林-自适应遗传模型表现最佳...而在样本熵和模糊熵方法识别的预测样本区间中,LSTM-Adam 模型均表现最佳...”。
    • 第 5 章 5.1 节结论 (2):“在近似熵方法识别的区间中,LSTM-Adam 模型的预测效果最好...在样本熵方法识别的区间中,ARIMA-RLS 模型的预测效果最佳...”。
  • 分析:在正文和结论中,对同一组实验的“最佳模型”描述完全相反。例如近似熵区间,正文说是随机森林最好,结论却变成了 LSTM-Adam 最好。这表明作者在撰写论文时,可能并没有实际查看自己的实验结果图表,或者是直接复制了其他论文的结论套话,导致上下文无法对应。
  • 严重程度:🔴

发现 4:关于“最小复杂度”的方法论硬伤 (Data Snooping)

  • 位置:第 2 章 (2.5.3 节) & 2.6 节
  • 描述:本文的核心创新点之一是利用动态滑动窗口寻找“复杂度最小”的样本区间进行预测。
  • 分析
    • 作者在 2.5.3 节提到:“从中选择出复杂度最小的样本区间...为后续预测提供数据支持”。
    • 在 2.6 节中,作者基于 1964-2021 的数据,找出了 2002 年之后的一段数据作为训练集。
    • 这本质上是“先射箭后画靶”。作者利用了未来信息(全局数据)来挑选训练集(挑选最平缓、最好预测的一段),然后声称自己的预测精度高。这在时间序列预测中属于严重的方法论错误。你用已经发生的全局视角去挑选局部最好预测的一段,当然能得出极高的 R² (0.97)。这种自适应窗口在真实在线预测场景下是无法复现的,因为未来的数据在当下是未知的。
  • 严重程度:🟠 (虽不一定是主观恶意造假,但属于科研逻辑硬伤,涉嫌夸大研究成果)

发现 5:参考文献的时间线异常

  • 位置:参考文献列表
  • 描述:论文列出的参考文献中,存在与论文写作周期不符的文献。
  • 证据
    • 文献 [51] (Meng H 等): Optics Communications, 2025, 574: 131117.
    • 文献 [58] (Xiong B 等): Applied Sciences, 2025, 15.
  • 分析:该论文答辩于 2025 年 5 月。通常硕士论文的撰写和投稿周期在半年到一年以上。引用 2025 年当年的期刊文献(且带有具体的卷号和页码),意味着这些文献在 2024 年末或 2025 年初刚刚见刊。虽然不排除是“优先发表”,但在 2025 年 5 月答辩的论文中大量出现 2025 年的最新文献,存在为了“蹭热度”或“凑数”而生硬插入最新文献的嫌疑。
  • 严重程度:🟡

耿同学辣评

这篇论文可以说是典型的“缝合怪”式学术投机:摘几个流行算法(LSTM、随机森林、BP神经网络),套一个听起来高大上的名字(自适应变结构),再用复杂的公式掩盖逻辑的空洞。

最搞笑的是那个表 4-4 和表 4-6,连小数点后四位都复制得一模一样,不知道是写代码时 seed 没变,还是纯粹把上一页的表格直接复制粘贴了?连“哪个模型效果最好”这种最基本的事实,在第三章和第五章的结论里都能打架,这论文怕不是用脚写的吧?这种拿“先射箭后画靶”的方法来刷精度,再配上漏洞百出的表格,真是把大坝监测当儿戏了。

建议后续行动

  • 联系作者要求提供原始数据和代码(特别是表 4-4 和 4-6 的生成代码)
  • 在 PubPeer 上提出质疑(针对表格雷同问题)
  • 向扬州大学研究生院学术委员会举报(涉嫌数据伪造)
  • 核查导师李占超的其他指导论文是否存在类似模板化生产问题

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。