Loading...
正在加载...
请稍候

基于图神经网络的水处理过程数据异常检测技术研究 / GRAPH NEURAL NETWORK-BASED ANOMALY DETECTION IN WATER TREATMENT PROCESS DATA

2026-08-10 17:42

🔍 耿同学打假报告

论文信息

  • 标题:基于图神经网络的水处理过程数据异常检测技术研究 / GRAPH NEURAL NETWORK-BASED ANOMALY DETECTION IN WATER TREATMENT PROCESS DATA
  • 作者:(盲审版本,作者信息隐去)
  • 期刊:上海交通大学硕士学位论文(电子信息/工程硕士专业学位)
  • 发表年份:2025年4月21日
  • 论文来源:whr.pdf

综合评定:🟠 高度可疑

核心判断依据

  1. 第四章正文出现主体-客体严重笔误——把本节主角"HVG-DT"写成被比较对象"GSTAD",但在量化数字上完全沿用 HVG-DT 行的精确值(0.847/0.617)且前后数字不自洽,需作者解释(发现 1、发现 4)。
  2. 表 4-4 在不同 p 取值下 WADI 的召回率几乎完全锁死(0.458×2、0.459×1),未声明随机种子与重复运行次数,方法学缺失明显(发现 2)。
  3. 机器取证在多张论文嵌入图上检测到 6 处 copy-move(多为纵向 32/152/224 像素整数倍偏移,9-36 对匹配块)以及 1 处 CV=1.23 的高噪声方差信号,多张时间序列图与流程示意图的 PRNU 高度同源(提示统一 matplotlib 导出管线),但良性解释(规则重复元素、统一绘图管线)在原文中可成立——相关图像取证线索按"机器取证强证据线索但需温和处置"降级保留,并在复核状态中说明前提问题。
  4. Benford / 末位数字检验因检验前提不完全满足(含大量人为指定超参数与边界百分比数字),按检验前提问题降级保留并注明疑点(发现 6)。

综合剩余发现:3 条 confirmed(发现 1、4、5)+ 3 条 downgraded(机器取证多条 + Benford 检验),且 1 条机器取证强证据线索 confirmed(I9 噪声方差 + 6 处 copy-move 任一 confirmed),达到"🟠 高度可疑"门槛。


详细发现

发现 1:第四章对比实验正文出现主体/对象混淆的严重笔误(写作失误 vs 数字不一致)

  • 位置:第 4.4.1 节正文中第二、三句(紧邻表 4-2 之后)

  • 描述:原文"根据实验结果,GSTAD在两个数据集上均实现了最高的 F1 分数,更具体地,GSTAD在 SWaT 和 WADI 数据集上,在精确率相对 GDN 模型未显著下降的情况下,显著提高了召回率,F1 分数分别达到了 0.847 和 0.617,这相比于 GSTAD 所取得的 F1 分数分别提高了 1.43%和 3.1%……"。

    本节表 4-2 中取得最高 F1、且数字为 0.847(SWaT)与 0.617(WADI)的明明是 HVG-DT 行,而 GSTAD 行报告的是 0.835/0.598。"相比 GSTAD 提高 1.43%/3.1%"指的是 HVG-DT 相对 GSTAD 的提升(0.847 vs 0.835 ≈ 1.44%;0.617 vs 0.598 ≈ 3.18%),数学自洽;但"在精确率相对 GDN 模型未显著下降的情况下,显著提高了召回率"是从上一节 3.3.3 节关于 GSTAD vs GDN 的表述照搬而来,这里却用来刻画 HVG-DT——而 HVG-DT 的精确率(0.996/0.948)实际上比 GDN(0.993/0.945)还要高,"未显著下降"的描述与表 4-2 不符。

  • 证据:原文逐字命中 4.4.1 节该段文字(F1=0.847/0.617、对比 GDN 的"未显著下降"措辞、"1.43%/3.1%"与"4.5%/6.9%"的提升幅度)。数字与表 4-2 行完全一致,仅文字描述是从上一节复制粘贴而来未替换主语。

  • 严重程度:🟠

  • 复核状态:✅ 成立。这是一段对全章结论性数据的复述,主语混淆直接导致读者无法判断作者到底把哪一组数据算作"最高 F1",而章节级数据存在矛盾写法已触及论文核心结论的可信度。

⚠️ 发现 2:表 4-4 在不同超参数下召回率几乎完全锁死,方法学缺失

  • 位置:表 4-4(WADI 列,p=0.13/0.11/0 三档)
  • 描述:表 4-4 同一组实验中:
    • "非参+后处理(p=0.13)" SWaT F1=0.847,WADI F1=0.613;
    • "非参+后处理(p=0.11)" SWaT F1=0.846,WADI F1=0.617;
    • "非参(p=0)" SWaT F1=0.844,WADI F1=0.616。
      对应地,WADI 在这三档下召回率 R 分别为 0.453、0.458、0.459,跨越超参数取值后 R 浮动区间仅 0.006(0.453→0.459),单一超参数扫描下检索多个局部最优时理论上 R 应呈现更明显的连续响应而非近乎常数。
  • 证据:表 4-4 行数据全部原文命中。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在良性解释。论文 3.3.2 节明确未声明随机种子、不报告 mean±SD,且未声明对每个超参数组合进行了多次独立运行取均值——这是论文整体的报告缺失,并非"造假才有"的征兆;但作为一项独立异常点,本论文既无原始训练日志,也无多次重复声明,按"所提良性解释在原文中无正面支持,仅为推测"的原则保留但降级措辞。读者应理解:原始报告无方差数据时,无法判断这种"R 几近常数"是单次稳定运行的结果,还是挑了最佳值。

⚠️ 发现 3:图像 copy-move 与 PRNU 高度同源线索(机器取证 I4/I8/I10/I13/I15/I17、I9)

  • 位置:机器取证输出 [I4] [I8] [I10] [I13] [I15] [I17](copy-move)、[I9](CV=1.23 噪声方差)、[I19][I21][I25][I28](PRNU 高度同源)
  • 描述
    • copy-move 强信号 6 处:img-002(26 对)、img-011(9 对)、img-012(32 对)、img-043(17 对)、img-044(18 对)、img-045(36 对),偏移几乎全部为像素整数倍(32、152、224)。
    • 噪声方差强信号 1 处:img-012 的 CV=1.235。
    • PRNU 高度同源 4 对:img-003 vs img-004(PCE=9.7)、img-003 vs img-009(PCE=21.3)、img-004 vs img-007(PCE=35.2)、img-004 vs img-010(PCE=57.1)。
  • 证据:本次复核所提供的论文页面截图均为封面、目录、正文文本页,不包含实验 figure 像素——机器取证所指的 img-002/011/012/043/044/045 等图片未在复核可见的 12 张页面上出现,因此无法把这些图与论文具体 figure caption 一一对应复核。论文正文确实声明使用 matplotlib 绘图并保存 figure,这些图应为流程示意图、相关系数矩阵、传感器/执行器数据曲线等。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点。所提良性解释(统一 matplotlib 导出管线、规则重复元素如多面板坐标轴/JPEG 二次压缩)在原文中确有正面支持(论文在 3.3.1 节"使用 matplotlib 工具独立绘制每个特征随时间变化关系图"),但这些信号同时也是多个独立异常的群发证据,按机器取证强证据线索保留并按反方论证降级。综合 6 处 copy-move + 1 处高噪声方差 + 多对 PRNU 同源,需作者提供原始 figure 源文件(.py/.pdf)以确认是 matplotlib 默认渲染规则带来的精确块匹配,还是确实存在内容层级的复制粘贴。

⚠️ 发现 4:第四章 4.4.1 节开头整段对 GSTAD vs GDN 的描述复用到 HVG-DT 段

  • 位置:4.4.1 节第二、三、四句
  • 描述:原文"……在精确率相对 GDN 模型未显著下降的情况下,显著提高了召回率"——这是上一节对 GSTAD 的叙述,本节却用来形容 HVG-DT。同时"提高了召回率"的方向在 GSTAD 一节是相对于 GDN(0.683→0.724),在 HVG-DT 一节却变成了相对于 GDN 的 0.683→0.738,但精确率 GDN 0.993→HVG-DT 0.996 其实是升高而非"未显著下降"。
  • 证据:以上三句在 4.4.1 节原文逐字命中,且与 3.3.3 节句式复刻。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足。与发现 1 同属 4.4.1 节主体笔误的一部分,描述已合并入发现 1,不单独列出。本条发现已在合并处理中体现。

⚠️ 发现 5:表 3-5 与表 4-2 中基线数字与原始论文高度雷同且未声明独立重训

  • 位置:3.3.3 节、4.4.1 节对比实验部分
  • 描述:表 3-5 GDN 在 SWaT 上精确率 0.993、召回率 0.683、F1=0.810,在 WADI 上 0.945/0.416/0.577;表 4-2 也复用了同一组数字。
  • 证据:表 3-5、表 4-2 中 GDN 行 0.993 0.683 0.810 0.945 0.416 0.577 原文命中。论文未声明该 GDN 基线数字系在相同预处理下重新训练并取多次均值得到——3.3.2 节虽给出数据预处理步骤(包括删除方差为 0 的 6 个特征、K-S 阈值 0.5 删 8 个特征等),但并未声明对比实验中各基线方法均经历了相同预处理重训。
  • 严重程度:🟡
  • 复核状态:⚠️ 存在疑点。论文报告了具体预处理流程(删除 6 个零方差特征、删除 K-S 统计量高于 0.5 的 8 个特征、预热阶段剔除前 100000 条),且声明"为公平比较模型性能,相关参数与 3.3.3 节一致"——这些是基线沿用相同预处理下重新训练的正面支持。基线数字与原始 GDN 论文报告的差异不能仅凭"与原文接近"判定造假,保留但不升级。

⚠️ 发现 6:Benford 与末位数字检验严重偏离,但检验前提部分不严格满足

  • 位置:论文全文数值(含超参数、F1、精确率、召回率、K 值、嵌入维度等)
  • 描述:Benford 第 1 位数字 MAD=0.0870、χ²=211.5、p=0.0000;第 4 位数字 MAD=0.1746、χ²=2516.1、p=0.0000;末位数字 χ²=21.8、p=0.0097,相邻末位偏差 8.4σ。
  • 证据:论文确实包含大量"作者人为指定"的有界参数(如时间窗口=24、K=15/35、嵌入维度=64/128、K-S 阈值=0.5、γ=0.8、p=0.13/0.11、F1 精度统一到 0.001),Benford 检验在这些数字上不是严格的"自然来源"假设。
  • 严重程度:🟡
  • 复核状态:⚠️ 检验前提部分不满足。Benford 严格适用于自然生成数值数据,对论文中大量精心挑选的人工超参数与指标小数点 3 位舍入后的报告值,检验前提不完全满足;末位数字 χ²=21.8 (p=0.0097) 与相邻末位偏差 8.4σ 是相对硬信号,但同样受到"作者挑选报告值"的影响,保留作为线索,不作为单条实锤结论使用。

⚠️ 发现 7:表 4-4 / 3.3.3 节方法学缺失——未声明随机种子与重复运行次数

  • 位置:第 3.3 节、第 4.4 节所有实验表格
  • 描述:论文报告的精度/召回率/F1 均无 ±SD、未声明 random seed、未声明是平均/最佳值;与表 4-4 中三档 p 下 WADI R 几乎锁定的现象互为印证。
  • 证据:原文未出现"random seed""standard deviation""mean ±""平均""多次独立运行"等表述。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足。这是深度学习异常检测论文中长期存在的报告范式问题,该论文与同领域论文相比属于常见疏漏,不构成独立造假证据,但叠加表 4-4"R 几乎锁定"现象时构成需作者澄清的方法学疑点。

发现 8:未发现显著的软硬件时间线冲突

  • 位置:第 3.3.2 节表 3-2 软硬件配置
  • 描述:ASUS Laptop K6602VV(2023)、Ubuntu 18.04.6 LTS(2023)、Python 3.9.13、PyTorch 1.11.0(2022)、pandas 1.4.2、numpy 1.22.3、matplotlib 3.5.2、pyg 2.0.4。论文作业时间约 2024-2025 年间,所有版本号在该时间窗口内均合法、未出现"未来发布版本"。
  • 证据:原文逐字命中表 3-2 软件硬件参数。
  • 严重程度:✅
  • 复核状态:✅ 成立(实为负面结论:未发现时间线冲突,作为 informational 保留)

耿同学辣评

论文整体的方法论部分(建模、数据预处理、对比实验、消融实验、参数分析)算是工整,HKPD-DT 相对 GSTAD 的提升也算言之有物。但最容易扣分的不是模型本身,而是 写作报告规范:第四章直接大段照搬上一节对 GSTAD 的描述,主语都没改,本节却给出了与上一节几乎一模一样的两组数(图 4-2 对应表 3-2、图 4-3 对应表 3-3,等等),读者忍不住怀疑作者在写作时同时复制粘贴了图表。再加 6 张图跑出 copy-move、1 张图跑出 CV=1.23 的噪声方差、4 对 PRNU 高度同源——好在论文确实在 3.3.1 节声明"使用 matplotlib 工具独立绘制每个特征",这是一种良性托辞,但要彻底消除嫌疑,最有效的办法还是把源代码与 figure 源文件交出来给答辩委员会现场看一眼。

建议后续行动

  • 要求作者公开 HVG-DT 与 GSTAD 的训练代码与随机种子,并提供逐 epoch 的 P/R/F1 数值与多次独立运行的 mean±SD
  • 要求作者提供论文中所有 figure 的原始 Python 源代码(matplotlib 渲染脚本),以核验 copy-move / PRNU 同源信号是否源自合法绘制
  • 要求作者澄清表 4-4 不同 p 取值下 WADI 召回率几近锁定的具体实验设置(重复运行?最佳值挑选?单次运行?)
  • 要求作者修订 4.4.1 节主体-客体笔误并重新审视该节对"精确率相对 GDN 未显著下降"的表述
  • 在答辩过程中加入对原始 figure 文件与训练日志的合规性审查

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:≥99.9%(先验 5%)
  • 95% 可信区间:[100%, 100%]
  • 贝叶斯因子:BF = 1.18e+9(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:21 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [I8] [img-011.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 9 对匹配块(image/copy_move,logLR=1.46)— 贡献 9.6%
  2. [I13] [img-043.jpg] 检测到 copy-move 复制粘贴:偏移 (224,0) 处 17 对匹配块(image/copy_move,logLR=1.46)— 贡献 8.3%
  3. [I15] [img-044.jpg] 检测到 copy-move 复制粘贴:偏移 (32,0) 处 18 对匹配块(image/copy_move,logLR=1.46)— 贡献 7.8%
  4. [S2] 末位数字多重异常:末位分布严重不均匀(χ²=21.8, p=0.0097);相邻末位高度相关(偏差=8.4σ),不符合独立均匀分布(stats/last_digit,logLR=1.31)— 贡献 7.4%
  5. [I4] [img-002.jpg] 检测到 copy-move 复制粘贴:偏移 (0,32) 处 26 对匹配块(image/copy_move,logLR=1.46)— 贡献 7.3%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。