Loading...
正在加载...
请稍候

基于集成学习的信用评分卡模型研究 (Research on Redit Scoring Model Based on Ensemble Learning)

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:基于集成学习的信用评分卡模型研究 (Research on Redit Scoring Model Based on Ensemble Learning)
  • 作者:叶轩志
  • 指导教师:刘田
  • 机构/期刊:西南财经大学 (Southwestern University of Finance and Economics) / 硕士学位论文
  • 专业:统计学
  • 定稿时间:2022年5月
  • 论文来源:基于集成学习的信用评分卡模型研究_叶轩志 (1).pdf

综合评定:✅ 清白 (基于目前提供的文本内容)

(注:由于输入文本仅包含论文的封面、摘要、目录及第一章导论部分,缺乏核心的实验图表、数据表格和参考文献列表,本报告主要针对现有文本逻辑、时间线和方法学描述进行扫描。)

详细发现

发现 1:核心数据与图表缺失(无法应用“耿同学六式”中的图片与数据检测)

  • 位置:全文本
  • 描述:提供的文本主要是引言与摘要,未包含第三章(数据探索)、第四章(模型建立与分析)的任何具体数值表格(如 AUC、KS 值等)、特征重要性图或混淆矩阵。
  • 证据:文本中仅见目录结构提及“第四章 模型的建立和分析”,但未提供实际图表内容。
  • 严重程度:ℹ️ 信息不足(非造假嫌疑)
  • 耿同学视点:“巧妇难为无米之炊,连 WB 条带(ROC 曲线)和数值表都没看到,我的‘火眼金睛’暂时找不到PS的痕迹。”

发现 2:时间线与产出逻辑检测(第五式:产出异常检测)

  • 位置:封面、摘要、第一章
  • 描述:论文定稿于 2022 年 5 月,使用了美国 Lending Club 平台 2018 年上半年的开源数据。结合当前基准日期(2026-06-14),时间线完全符合逻辑。
  • 证据
    1. Lending Club 数据集是业内常用的开源真实数据集,并非凭空捏造的“某某医院内部数据”。
    2. 2018 年的数据在 2022 年用于硕士毕业论文,具有充足的脱敏和公开时间,符合学术界的数据使用滞后性常理。
    3. 涉及的算法(XGBoost, LightGBM, SMOTE, Stacking)在 2022 年时已是极其成熟的机器学习常规操作,不存在“穿越”使用尚未发布的算法库的情况。
  • 严重程度:✅ 正常

发现 3:方法学与逻辑自洽性检测(第六式:引用与方法学异常)

  • 位置:摘要与 1.2.1 研究目的
  • 描述:作者声称做了两件事:一是使用 Stacking 融合(初级学习器为各种模型,次级为逻辑回归),二是提出了一种“基于特征子集划分的融合模型”。
  • 证据:这种建模逻辑在计算机科学和数据挖掘领域是完全自洽的。文本中未出现前后矛盾(如前面声称用神经网络,后面公式全是线性回归的低级错误)。摘要中提到“试图提出一种基于特征子集划分的融合模型”,用词谨慎(“试图”),符合硕士论文的严谨态度,没有吹嘘“首创”或“颠覆性突破”。
  • 严重程度:✅ 正常

发现 4:文本提取乱码与排版异常

  • 位置:全文各处
  • 描述:文本中出现了大量如 fl 必 南 樹 經 犬 嗲 以及 S O U T H W E S T E R NU N I V E R S I T Y 等字间距过大和莫名字符。
  • 证据:这是 PDF 转文本(OCR)过程中常见的乱码现象,特别是包含英文封面和水印时。
  • 严重程度:ℹ️ 与学术诚信无关。

耿同学辣评

这篇论文目前看起来“人畜无害”,属于非常典型的“水……哦不,扎实的量化金融/统计硕士毕业论文”套路——“Lending Club 数据集 + 经典不平衡处理 (SMOTE) + XGBoost调参 + Stacking模型融合”。这套组合拳在各大高校的量化实验室里已经被打得滚瓜烂熟。作者老老实实承认是“参考已有文献的做法”,没有吹自己搞出了什么宇宙级突破,态度是相当诚恳的。

不过,打假打的就是“看不顺眼”。由于没看到具体的数据表和实验对比图,现在下结论还为时过早。如果后续章节里,那个“基于特征子集划分”的新模型在测试集上的 AUC 突然比 XGBoost 高出 10 个百分点,且数据分布平滑得像尺子画出来的一样,那耿同学可就要戴上显微镜好好瞅瞅了!

建议后续行动

  • 暂无举报必要:基于目前提供的引言和摘要部分,未发现任何学术不端线索。
  • 如需深度检测:请提供论文的第三章(数据处理)、第四章(模型结果与图表)以及完整的参考文献列表,以便进行像素级图片查重和末位数字分布的统计学异常检测。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。