Loading...
正在加载...
请稍候

基于 Stacking 模型的网络车贷违约客户识别研究

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:基于 Stacking 模型的网络车贷违约客户识别研究
  • 作者:张颖
  • 指导教师:李勇
  • 机构/期刊:重庆工商大学(硕士专业学位论文)
  • 发表年份:2022年5月
  • 论文来源:基于Stacking模型的网络车贷违约客户识别研究_张颖.pdf

综合评定:🟠 高度可疑

详细发现

发现 1:数据来源“洗白”与内部矛盾(前后表述不一)

  • 位置:第3章 第3.1节 vs 第5章 第5.2节
  • 描述:作者在正文主体部分信誓旦旦地声称使用的是某借贷机构的“真实业务数据”,试图增强研究的实际应用价值;但在最后的展望与不足部分,却不慎说漏嘴,承认使用的是“讯飞开放平台提供的脱敏数据”。
  • 证据
    • 第15页(3.1 数据获取与概览):“本文使用的数据来自某借贷机构的真实车贷业务数据……”
    • 第49页(5.2 展望与不足):“本文所使用的数据是讯飞开放平台提供的脱敏数据……”
  • 严重程度:🔴(严重的学术诚信瑕疵。故意将公开的算法竞赛数据集包装成企业内部真实脱敏数据,属于典型的“贴金”行为,且隐瞒了数据集的真实来源)

发现 2:数据造假检测(数学计算低级错误,疑似编造提升幅度)

  • 位置:第4章 第4.4.1节
  • 描述:作者为了突出 Stacking 融合模型的效果,在正文描述中故意夸大(或算错)了 KS 值的提升幅度,正文文字描述的数值与表格呈现的真实数值发生了严重的数学悖论。
  • 证据
    • 正文表述:“Stacking 融合模型的 AUC 值和 KS 值分别为 0.7517、0.3577,相对其他单一模型中表现最好的 BorderlineSMOTE-XGBoost 分别提升了 0.0033、0.096”。
    • 查阅表 4.13:BorderlineSMOTE-XGBoost 的 KS 值为 0.3481
    • 实际计算:0.3577 - 0.3481 = 0.0096。
    • 结论:作者将 0.0096 写成了 0.096(扩大了将近 10 倍!)。为了让论文显得“提升显著”,这种弄虚作假的计算很有可能是随机敲键盘或者笔误造成的。
  • 严重程度:🟠(核心结论的数学无法自洽,高度怀疑实验结果是根据预期结论反向编写的)

发现 3:方法学异常检测(跨次元复制粘贴——算法参数抄错行了)

  • 位置:第4章 表 4.8 与 表 4.10
  • 描述:作者在进行网格搜索调参时,直接将随机森林(RF)的参数表复制粘贴给了 XGBoost 模型,甚至连参数解释和构造集合都懒得改,导致出现了极其荒谬的“方法论事故”。
  • 证据
    • 表 4.10(XGBoost 模型重要调节参数)中,赫然出现了 criterion(不纯度衡量指标,取值为 'entropy', 'gini')、min_samples_leafmin_samples_splitmax_features 等参数。
    • 事实核查:XGBoost 无论是原生 API 还是 Sklearn 接口,根本没有 min_samples_leafgini/entropy 这种 criterion 设定(这些是决策树和随机森林专属参数)。XGBoost 的核心参数应为 learning_rate (eta), gamma, subsample, colsample_bytree 等。作者显然根本没有跑过 XGBoost 的代码,而是把表 4.8 复制过来改了个标题。
  • 严重程度:🔴(确凿的伪造实验过程证据。连用的什么算法参数都是抄的,实验数据基本可以断定是捏造的)

发现 4:图片拼接与像素级分析缺失声明

  • 位置:全文图表
  • 描述:文本中未提供足够的原始图片信息(论文均为文字提取),无法对 ROC 曲线图(图 4.6-4.10)、KS 曲线图等图进行像素级同源性比对。
  • 证据:根据现有表格数据的“平滑度”判断,所有模型跑出来的指标极其规整,例如不同采样方法下的 AUC、F1 等指标差异极其均匀,不太像真实含噪跑出来的结果,更像是人工编排的递增数列。但由于缺乏原图,无法进行一锤定音的视觉打假。
  • 严重程度:🟡(存疑,留待读者注意)

耿同学辣评

这篇论文可以说是典型的“缝合怪”加“粗心大意”。为了给自己的毕业论文贴金,硬生生把公开的讯飞算法竞赛数据集包装成“某借贷机构真实数据”,结果在结尾致谢和展望时原形毕露。更搞笑的是,作者连“复制粘贴”的基本功都没做好,把随机森林的参数表直接套在 XGBoost 头上,不知道的还以为这两兄弟是一个妈生的;正文中数据提升幅度直接凭空多写个 0(0.0096 变成 0.096),这已经不是学术不端了,这是对九年义务教育数学的挑衅!用虚构的参数跑出完美的数据,这大概就是传说中的“意念跑码”吧。

建议后续行动

  • 联系作者所在机构(重庆工商大学)学术委员会:要求作者提供讯飞数据集的真实来源链接、跑通 XGBoost 模型的完整源代码(特别是参数定义部分),以及输出各项指标的原始日志。
  • 要求查看原始数据集:核实其所谓“真实车贷业务数据”的原始文件。
  • 仔细审查其指导教师名下的其他学生论文:这种流水线式的造假手法(套用模板、编造参数)通常不是个例,建议查查是不是整个课题组都有这种“Ctrl+C/V”的不良风气。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。