基于图表示学习的金融反欺诈实证研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于图表示学习的金融反欺诈实证研究
- 作者:刘陈
- 机构/来源:上海财经大学硕士学位论文(论文来源:基于图表示学习的金融反欺诈实证研究_刘陈 (1).pdf)
- 期刊:硕士学位论文
- DOI:无(学位论文)
- 发表年份:推测为2023-2024年(基于文中引用的2023年参考文献及2022年数据)
综合评定:✅ 清白 (存在微小瑕疵)
详细发现
发现 1:数据计算高度自洽(未触发红旗)
- 位置:第三章 表3-4,第四章 表4-12 及 摘要
- 描述:通常打假时,我们会重点检查论文里的均值、方差、提升比例是否有数学矛盾。这篇论文在数学逻辑上惊人地严谨。
- 证据:
- 以表3-4为例,SMOTE+RandomForest 的 Precision 为 0.146,Recall 为 0.799。代入 F1 公式:
2*0.146*0.799 / (0.146+0.799) = 0.2468,四舍五入恰好等于表中的 0.247。表内所有 F1 值均完美自洽。 - 摘要中声称 Node2Vec+随机森林相较于最优传统方法在 F1 和 AUC 上分别提升了 33.07% 和 6.86%。核对数据:最优传统方法 F1=0.251, AUC=0.671;Node2Vec F1=0.334, AUC=0.717。计算得出:
(0.334-0.251)/0.251 = 33.07%,(0.717-0.671)/0.671 = 6.85%(存在极其微小的四舍五入差异,但在合理范围内)。真实跑过代码的同学都知道,这种小数点后两位的完全吻合绝不是手编数据能写出来的。
- 以表3-4为例,SMOTE+RandomForest 的 Precision 为 0.146,Recall 为 0.799。代入 F1 公式:
- 严重程度:🟢 (绿色,可信度高)
发现 2:数据分布呈现真实的“不完美”特征
- 位置:第四章 表4-5、表4-6
- 描述:造假论文的数据往往过于完美(比如参数调优时指标呈完美的抛物线)。但这篇论文在 Node2Vec 的调参表格中,数据呈现出真实算法运行时的随机性与噪声。
- 证据:在表4-5中,随着参数 q 的变化(0.25 -> 4),F1-score 的均值变化为 0.305 -> 0.306 -> 0.317 -> 0.312 -> 0.303。AUC 值则毫无规律(0.680 -> 0.669 -> 0.692 -> 0.667 -> 0.688)。这种“F1有趋势但AUC乱跳”的现象,非常符合机器学习超参数寻优的真实情况,而不是随机生成器伪造出来的。
- 严重程度:🟢 (绿色,可信度高)
发现 3:混淆矩阵基础概念定义错误(学术瑕疵)
- 位置:第二章 2.1.3 节 (1) 混淆矩阵,Page 13
- 描述:作者在解释混淆矩阵的四个基础指标时,出现了明显的概念性错误,疑似写论文时大脑短路或复制粘贴了错误的文本。
- 证据:原文写道:“假设 TP... FN 为真正类被错误分类的数量, FP(False Positive)真负类被正确分类的数量,TN(True Negative)为真负类被错误分类的数量。”
- 正确的定义应该是:FP 是真实为负类但被预测为正类(错误分类的数量),TN 是真实为负类且被预测为负类(正确分类的数量)。
- 虽然这是一个低级错误,但这属于学术写作中的定义笔误,因为论文后续的 Precision、Recall 等公式套用和代码计算完全正确。这种“概念解释写错但代码算对”的情况,反而印证了这是一个真实的可能不太注重理论的工程型学生写的,而不是系统性的恶意造假。
- 严重程度:🟡 (存在学术瑕疵,但不影响核心结论)
发现 4:时间线合理,无超前引用
- 位置:参考文献及全文背景
- 描述:以当前日期(2026-06-14)为基准,检查其时间线。
- 证据:文中引用的最新外文文献为 [6] Aleksandar 等人 (2023),引用的国内数据为“2022年中国司法数据研究所”发布的数据。若该论文为2023年底或2024年的毕业论文,引用上述文献完全符合时间逻辑,未出现“使用了未来才发布的设备或数据”的时空穿梭迹象。
- 严重程度:🟢 (绿色,可信度高)
(注:由于只能获取文本内容,无法提取图片/Western Blot/实验图表进行像素级分析(第一式/第三式)。但本文为计算机算法实证论文,核心证据全在表格数据中,文本数据已足够支撑评估。)
耿同学辣评
这篇论文的数据真实得让我都想给它点个赞!别的造假学者拿随机数生成器编数据,这篇论文的作者那是真的一行行跑代码调参的。F1-score 和 AUC 的算式严丝合缝,调参的数据全是真实的“噪点”。虽然把混淆矩阵的 FP 和 TN 解释写反了(真是典型的理科生写字不动脑子),但这恰恰证明了这是一个真做实验的理工科学生的手笔,而不是造假工厂批量生产的完美童话。结论:真实可靠,准予放行!
建议后续行动
- 无需联系作者索要原始数据(数据自洽度极高)。
- 可在答辩时顺便“温馨提醒”一下作者修改一下第二章关于 FP 和 TN 的定义笔误,以免丢人。
- 无需在 PubPeer 上提出质疑。
- 无需向机构举报。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。