Loading...
正在加载...
请稍候

基于集成学习的不平衡财务数据风险预测研究

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:基于集成学习的不平衡财务数据风险预测研究
  • 作者:陈宛焮
  • 期刊:中原工学院硕士学位论文
  • DOI:无(学位论文)
  • 发表年份:2025年12月
  • 论文来源:基于集成学习的不平衡财务数据风险预测研究_陈宛焮 (1).pdf

综合评定:🟠 高度可疑

详细发现

发现 1:基础常识与数学公式严重背离

  • 位置:表 2.1 混淆矩阵(第16页)
  • 描述:作者在展示混淆矩阵时,将“实际负例”与“预测负例”交叉的单元格标记为 FN(假反例,False Negative)。但在任何机器学习基础教材中,该位置毫无疑问应为 TN(真反例,True Negative)。
  • 证据:原文表 2.1 中,实际类别为“负例”、预测类别为“负例”的交叉单元格明确写着 FN。这种初中级机器学习绝不该犯的致命概念错误,直接暴露了作者极度薄弱的专业基础,甚至让人怀疑作者是否亲手敲过真实的分类代码。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:正文与表格数据“左右互搏”

  • 位置:3.3.2 节文本 vs 表 3.5(第28-29页);4.2.1 节文本 vs 表 4.2(第45-46页)
  • 描述:论文中多处正文描述的实验数据与图表中展示的数据完全对不上,且呈现出极其诡异的“部分指标吻合、部分指标瞎编”的规律。
  • 证据
    1. 表 3.5 中,Recall(召回率)在不平衡时为 0.4686,平衡后为 0.6762。而正文写道:“召回率从 43.25% 大幅提升至 61.98%”;Acc 在表内为 0.9790->0.9831,正文却写“从 97.96%98.30%”;F1 分数表内为 0.5536->0.7005,正文写“从 0.5310 提升至 0.6664”。(注:正文的百分比提升幅度倒是和表格对上了,说明作者是在两套不同的基础数据上硬算提升率)。
    2. 表 4.2 中,Precision 明明是 0.9046 提升至 0.9124,正文却大言不惭地写道:“精确率由 92.25% 增至 92.64%”;Recall 表内为 0.8972 提升至 0.9112,正文写“由 91.81% 上升至 92.35%”。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:样本总量“薛定谔式”失踪

  • 位置:4.1 节 个人财务数据分类情况(第41页)
  • 描述:作者声明使用的德国信用卡数据集共有 1000 条样本,并在 2.2.3 节声称按 8:2 划分训练集与测试集。然而,在进行 KMeans 聚类分析时,作者给出的三个簇的样本数量分别为 327、224 和 429。
  • 证据:原文明确指出“经 KMeans 聚类后形成三个分布清晰的簇,分别标记为 0、1、2,其样本数量依次为 327、224 和 429。”计算可知:327 + 224 + 429 = 980。如果是针对全量数据聚类,总和应为 1000;如果是针对训练集聚类,总和应为 800。凭空消失或凭空多出的样本量,说明作者对数据的实际操作极其混乱,存在伪造实验流程的嫌疑。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 4:F1-Score 数值计算自相矛盾

  • 位置:表 3.3(第26页)
  • 描述:在模型性能对比中,多个模型的 F1-Score(精确率与召回率的调和平均数)与报告的 Precision 和 Recall 在数学上无法自洽。
  • 证据:原文表 3.3 中,以 Baseline(基准)模型为例,表内 Precision = 0.4388,Recall = 0.5273。根据 F1 公式:\(2 \times \frac{0.4388 \times 0.5273}{0.4388 + 0.5273}\),正确结果应为 0.4790,但表中赫然写着 0.4332。Bagging、RF 等多个模型均存在此类数学不自洽的问题。
  • 严重程度:🟠
  • 复核状态:✅ 成立

耿同学辣评

这篇论文的实验数据,主打一个“精神分裂”。正文和表格像是在玩“找不同”游戏,数学公式连计算器都算不出那个结果,连最基础的混淆矩阵 TN 都能写成 FN!这哪是“基于集成学习”,这明明是“基于集成编造”。建议作者在写论文之前,先买个好点的计算器,并重温一下机器学习小学一年级课本!

建议后续行动

  • 联系作者要求提供原始数据及模型运行日志(强烈建议)
  • 在学校论文库或相关平台提出公开质疑
  • 向作者所在机构(中原工学院)学术委员会举报审查其数据真实性
  • 检查其指导教师名下其他论文是否存在类似的“文本与数据割裂”造假模板

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。