基于异构图神经网络的欺诈检测研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:基于异构图神经网络的欺诈检测研究_段福先.pdf
- 标题:基于异构图神经网络的欺诈检测研究
- 作者:段福先(学位申请人)
- 导师:姜楠 教授
- 机构:华东交通大学
- 学位类型:全日制专业硕士学位论文
- 答辩日期:2022 年 05 月 28 日
综合评定:🔴 实锤(系统性数据复用与捏造)
详细发现
发现 1:图表数据大面积复制粘贴(一稿多投/自我抄袭)
- 位置:表 3-1(第 29 页) vs 表 4-1(第 40 页)
- 描述:作者在第三章和第四章分别介绍了两个模型(MAFD 和 TNS),两章均独立介绍了所用的数据集统计信息。然而,表 3-1 和表 4-1 从标题、数据集节点数、关系到具体的边数(甚至连边数的个位数都一模一样),做到了 100% 像素级复制粘贴。
- 证据:
- 第三章 3.3.1 和第四章 4.3.1 的数据集描述文字几乎完全一致。
- 表格数据完全相同(如 AMAZON 数据集节点数 11,944,U-S-U 边数 3,566,479 等等)。
- 严重程度:🟡(单独看属于排版冗余或偷懒,但结合下述发现,这是系统性造假的一环)
发现 2:基线模型实验数据原封不动复用(凭空造表)
- 位置:表 3-4(第 32 页) vs 表 4-4(第 43 页);表 3-5(第 33 页) vs 表 4-5(第 44 页)
- 描述:这是本篇论文最严重的学术不端行为。作者在第四章声称提出了一个全新的模型 TNS,并加入了可训练的邻居采样器和全新的损失函数。但在与第三章(MAFD模型)相同的基线进行对比时,所有 10 个基线模型在 4 个训练比例下的 AUC 和 Recall 数据,居然和第三章一模一样!
- 证据:
- 看表 3-4 和表 4-4 的 GCN 行:
74.29, 75.60, 75.68...两张表连小数点后两位都完全雷同。 - 看表 3-5 和表 4-5 的 CARE-GNN 行:
72.12, 74.22, 74.93...同样是照搬。 - 逻辑悖论:既然第四章加入了全新的采样器机制,图结构在传播时的计算图已经发生改变,怎么能保证随机种子、CUDA 卷积运算的结果连小数点后两位都跟第三章不差分毫?唯一的解释是:作者根本没有重新跑基线实验,而是直接把第三章的表格复制过来,改了改自己模型的名字。
- 看表 3-4 和表 4-4 的 GCN 行:
- 严重程度:🔴(确凿的伪造数据/省略实验证据)
发现 3:自身模型数据“随机扰动”伪造提升(PS式造假)
- 位置:表 3-4 vs 表 4-4(自身模型行)
- 描述:为了让第四章的 TNS 模型显得比第三章的 MAFD 模型“有进步”,作者对自身模型的数据进行了极其低级的 Excel 填表式修改。
- 证据:
- 以 AMAZON 数据集 5% 训练集为例:
- MAFD-MEAN AUC 为 93.99,TNS-MEAN 变成了 93.92(-0.07)
- MAFD-MAX AUC 为 93.29,TNS-MAX 变成了 93.30(+0.01)
- MAFD-MIN AUC 为 93.03,TNS-MIN 变成了 93.15(+0.12)
- MAFD-STD AUC 为 94.27,TNS-STD 变成了 94.19(-0.08)
- 所有的数值变动都在
[-0.15, +0.15]之间疯狂试探,完全是人为添加的随机噪声。稍微懂一点深度学习的人都知道,更换了采样策略,AUC 不可能只产生 0.01 的微小且规律性的波动。
- 以 AMAZON 数据集 5% 训练集为例:
- 严重程度:🔴(数据严重失真,用随机数生成器糊弄答辩委员会)
发现 4:文本大面积逐字复制(量产型学术)
- 位置:第 3.3.2 节(第 32-34 页) vs 第 4.3.2 节(第 43-45 页)
- 描述:除了表格造假,作者连实验分析的正文都懒得写,直接进行了文本替换。
- 证据:
- 第三章:“基线中的 GCN、GraphSAGE、GAT、GAIN 和 GeniePath 在同构图(即单关系图)上执行欺诈检测任务...”
- 第四章:“基线中的 GCN、GraphSAGE、GAT、GAIN 和 GeniePath 在同构图(即单关系图)上执行欺诈检测任务...”
- 整整三大段分析(包括同构图 VS 异构图、模型变体、训练百分比)几乎一字不差,甚至连“对于大多数的评价指标和训练百分比,可以观察到 MAFD/TNS 总体上所显示出的性能最好”这种句式都是套模板生成的。
- 严重程度:🟠(丧失基本学术写作底线)
耿同学辣评
这位同学,把第三章的表格复制到第四章,然后把自家模型的数据加上个 ±0.1 的随机抖动,就敢叫“提出了一个新模型(TNS)”?你这图神经网络不是跑在 RTX 2080Ti 上的,是跑在 Excel 的 =RAND() 函数上的吧?连基线模型的数据都懒得重新跑,一模一样复制过来糊弄人,这哪是写论文,这分明是深度学习填空题!将这种粗制滥造的“套路文”提交答辩,是对学术规范的公然挑衅。
建议后续行动
- 联系导师与所在机构(华东交通大学学术委员会):要求作者提供 TNS 模型的完整训练日志、终端输出记录和原始代码,证明表 4-4 和 4-5 确实是独立实验跑出来的。
- 进行查重处理:这篇论文内部自我抄袭度极高(表、图、正文严重重复),不符合硕士学位论文的查重规范。
- 在 PubPeer 或相关学术监督平台上披露此问题,防止类似“一文拆两章”、“数据复制粘贴”的科研陋习继续蔓延。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。