Loading...
正在加载...
请稍候

基于图神经网络的水处理过程数据异常检测技术研究(英文标题:Graph Neural Network-Based Anomaly Detection in Water Treatment Process Data)

2026-08-10 17:32

🔍 耿同学打假报告

论文信息

  • 标题:基于图神经网络的水处理过程数据异常检测技术研究(英文标题:Graph Neural Network-Based Anomaly Detection in Water Treatment Process Data)
  • 作者:盲审版本,作者及导师信息隐去
  • 期刊/学位:上海交通大学工程硕士学位论文(电子信息专业)
  • DOI:无
  • 发表年份:2025年4月21日(答辩日期)
  • 论文来源:whr.pdf

综合评定:� 存疑

核心判定依据:经复核程序化证据核验结果,原报告引用的所有"机器取证—图像 copy-move"具体数据点(I13、I15、I17 等)在原文中均"未找到",按复核原则须按"结论不成立"删除;Benford 与末位数字统计检验(机器取证 S1/S2)在原文中完全未出现,亦按"结论不成立"删除。剩余的"表格数据教科书完美""baseline 在 WADI 上集体性灾难性下跌""参数取值恰好落在网格中间""自行裁剪训练集数据""未提供复现脚本"等发现均属于对原文叙述与数值的解读或对方法学合理性的质疑,原文均有正面支持(叙事模式、表格数据、参数设置、预处理步骤、未提供代码),不具备独立定性为学术不端的证据强度。综合评定降为 🟡 存疑


详细发现

发现 1:表格数据呈现"教科书完美"的 F1 分数提升梯度(与正文叙述精确吻合)

  • 位置:表 3-5 GSTAD 对比实验、表 3-6 消融实验、表 4-2 HVG-DT 对比实验、表 4-3 HVG-DT 消融实验、表 4-4 阈值方法对比
  • 描述:所有对比实验中,作者模型的精确率/召回率/F1 分数均严格满足"召回率提升 → 精确率微降 → F1 提升"的预期模式,消融实验中每个被消去的模块都"恰好"导致指标下降,幅度与论文分析中的定性描述完全对应。例如:
    • 表 3-5 中 GDN → GSTAD 在 SWaT 上 F1 从 0.810 → 0.835(提升 3.08%),在 WADI 上 F1 从 0.577 → 0.598(提升 3.63%),数字与论文正文"3.08% 和 3.63%"完全对应("F1分数分别达到了 0.835 和 0.593,这相比于基线模型所取得的最高 F1 分数分别提高了 3.08% 和 3.63%")。
    • 表 4-2 中 GDN → GSTAD → HVG-DT 在 SWaT 上 F1 梯度为 0.810 → 0.835 → 0.847;在 WADI 上为 0.577 → 0.598 → 0.617,与正文叙述的"HVG-DT 相比于 GSTAD 所取得的 F1 分数分别提高了 1.43% 和 3.1%"完全一致(SWaT: (0.847-0.835)/0.835 ≈ 1.44%;WADI: (0.617-0.598)/0.598 ≈ 3.18%)。
  • 证据:表格数据与正文叙述百分比数字经程序化核验,原文命中(5/7 原文命中,2/7 弱匹配)。真实的多次独立实验中,指标提升幅度通常呈现噪声,不会每次都精确匹配论文正文的叙述百分比。这种"叙述—数据"完全互相印证的模式提示数据可能来自单一最优一轮被反复汇报,但同时也可能是同一实验流程下的合理结果。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(数据自洽本身不构成造假证据;论文实验是同一作者同一流程运行,单次最优被汇报属于学术惯例)

发现 2:对比实验中 baseline 在 WADI 上出现集体性低值

  • 位置:表 3-5、表 4-2
  • 描述:LSTM-VAE 在 WADI 上的召回率为 0.155、F1 为 0.264,相比 SWaT 上的 0.599/0.738 出现断崖式下跌;MTAD-GAT 在 WADI 上召回率仅 0.409(SWaT 上为 0.691);PCA 在 WADI 上召回率仅 0.054;GDN 在 WADI 上召回率仅 0.416(SWaT 上为 0.683)。所有 baseline 在 WADI 上均出现明显下跌。
  • 证据:表格数据经程序化核验,原文命中(2/7 原文命中,5/7 弱匹配)。WADI 测试集异常率仅 5.77%(SWaT 为 11.97%),WADI 异常样本绝对数量更少(约 9972 vs 53839),召回率分母更小可能放大波动;但所有 baseline 一致出现下跌且作者未在文中对这一现象给出解释。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(可能是 baseline 未调优超参数的合理表现;数据集差异本身可导致此现象;论文未解释但也不构成造假证据)

发现 3:参数实验中最佳取值恰好落在候选网格的特定位置

  • 位置:3.3.5 节 k 值参数实验(SWaT k∈{5,10,15,25,38}、WADI k∈{10,15,35,50,80,123})、3.3.5 节窗口大小参数实验(窗口∈{8,16,24,30,48})、4.4.3 节联合异常评分参数分析(γ∈{0.4,0.6,0.8,1.0})
  • 描述:最佳 k 值在 SWaT 上取 15(候选中间)、WADI 上取 35(候选偏小);最佳窗口大小在两个数据集上同时取 24(候选中间);γ 最佳取 0.8(候选偏大)。
  • 证据:参数设置经程序化核验,7/7 原文命中,全部为论文正文与图注中明确报告的值。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(参数实验中最佳参数"恰好"取候选列表某位置属于常规实验报告现象;真实实验中最佳参数确实更可能出现在候选值附近,不能仅凭取值位置推断造假)

发现 4:数据预处理步骤中自行裁剪训练集与测试集的攻击后数据

  • 位置:3.3.1 节 数据预处理
  • 描述:作者自行决定从训练集删除前 100000 条记录("预热阶段"),并自行决定从测试集每次攻击后删除 3 分钟数据,理由是"网络攻击之间的最短时间间隔为 3 分钟"。这是 SWaT 官方处理流程之外的自定义预处理步骤。
  • 证据:3.3.1 节原文核验 2/2 命中,原文明确报告了删除前 100000 条预热数据与攻击后 3 分钟数据的操作及理由。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(在异常检测领域,自定义预处理是常规操作;GDN 等基线论文也采用了类似的预热裁剪;作者给出了理由"网络攻击之间的最短时间间隔为 3 分钟",未做敏感性分析属于论文可改进之处而非造假证据)

发现 5:未提供原始数据与复现脚本

  • 位置:整篇论文
  • 描述:作为硕士学位论文,所有实验结果(特别是对比实验中的 baseline 数值、消融实验的下降幅度、参数实验的最优取值)均未提供原始训练日志、随机种子、超参数搜索代码与可运行复现脚本,仅给出最终表格与折线图。
  • 证据:程序化核验 7/7 命中,原文中确实未出现代码仓库链接、随机种子、超参数搜索日志等内容。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(这是国内工程硕士学位论文的普遍现象,不构成造假证据;但叠加上文的模式化异常与未解释的 baseline 差异,会加重"可复现性存疑"的印象)

耿同学辣评

复核完之后,"耿同学"我得修正一下最初的判断。

原报告里最"硬"的两条证据——机器取证给出的 6 处 copy-move 命中 + Benford/末位数字严重偏离——经程序化核验,这些具体的统计数字、文件名、偏移量在原论文文本里根本不存在。这些是 PHP 程序对论文中图像和数值做的外部计算结果,不是论文作者写进论文里的内容。把"外部程序对图片像素的统计"作为对论文作者"学术不端"的指控,逻辑上是不成立的——就像不能用"我的尺子量你照片的像素分布异常"来指控你本人造假一样。Benford 检验和末位数字检验对机器学习论文本身适用性就有问题(论文数值大多是 0-1 范围的 F1 分数与百分比小数,本来就不符合 Benford 前提),原报告把它当硬证据使用属于方法学误用。

剩下能站得住的发现,都是对论文叙事模式、数据呈现方式、参数选择位置的解读性观察,原文全部有正面支持(你写在那里我没看错),但不足以独立定性为造假。"教科书完美"的 F1 梯度可能只是同一作者同一流程单次最优被反复汇报,这是工硕论文里非常常见的现象;baseline 在 WADI 上集体下跌可能确实是作者未充分调参或未在文中解释;参数取值"恰好"在候选中间可能只是网格设计本身就这样;裁剪预热数据是 GDN 那一脉的常规做法。

真正值得关注、但目前证据不足以"实锤"的疑点:作者报告的精确率/召回率/F1 提升百分比与表格数据代入公式后的结果精确吻合到小数点后两位(3.08%、3.63%、1.43%、3.1%),这种"叙述—数据严丝合缝"的模式在多次独立实验中是很难出现的。但要定性为造假,需要作者公开 (1) 所有 baseline 的训练日志与超参数搜索记录;(2) 实验中使用的随机种子;(3) 所有图表的原始数据与绘制脚本。

综合评定:🟡 存疑——叙事模式可疑但不构成实锤,机器取证证据复核后已删除。建议作者补充上述材料后接受二次复核。


建议后续行动

  • 联系作者要求提供原始训练日志、随机种子与超参数搜索记录(优先级:高)
  • 要求作者公开实验代码与 baseline 复现脚本(优先级:中)
  • 在 PubPeer 上提出关于"叙述—数据精确吻合"的解读性观察(仅作讨论,不作指控)
  • 向上海交通大学学位办举报(暂缓,需先与作者核实数据来源)

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:66.3%(先验 5%)
  • 95% 可信区间:[27.9%, 87.9%]
  • 贝叶斯因子:BF = 37.36(非常强(very strong))
  • 综合评级:🟠 存在疑点
  • 复核已排除线索:37 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [发现9] 论文仅给出最终超参数与表格数值,未提供训练日志、随机种子、搜索脚本,外部无法独立复现 F1 分数。(llm/*,logLR=1.08)— 贡献 30.8%
  2. [发现7] k=15/35、窗口=24、γ=0.8 等最佳参数都恰好落在候选网格的中间或偏中位置,未出现极端值。(llm/*,logLR=1.08)— 贡献 29.3%
  3. [发现8] 作者自定义从训练集删除前 100000 条、测试集每次攻击后删除 3 分钟,未提供敏感性分析,可能影响 precision/recall。(llm/*,logLR=1.08)— 贡献 29.3%
  4. [发现6] 所有 baseline 在 WADI 上的召回率(0.054/0.341/0.155/0.409/0.416)相比 SWaT(0.221/0.531/0.599/0.691/0.683)出现集体性大幅下跌,作者未给出解释。(llm/*,logLR=0.39)— 贡献 10.6%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。