基于集成学习的信用评分卡模型研究 (Research on Redit Scoring Model Based on Ensemble Learning)
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于集成学习的信用评分卡模型研究 (Research on Redit Scoring Model Based on Ensemble Learning)
- 作者:叶轩志
- 指导教师:刘田
- 机构/期刊:西南财经大学 (Southwestern University of Finance and Economics) / 硕士学位论文
- 专业:统计学
- 定稿时间:2022年5月
- 论文来源:基于集成学习的信用评分卡模型研究_叶轩志 (1).pdf
综合评定:✅ 清白 (基于目前提供的文本内容)
(注:由于输入文本仅包含论文的封面、摘要、目录及第一章导论部分,缺乏核心的实验图表、数据表格和参考文献列表,本报告主要针对现有文本逻辑、时间线和方法学描述进行扫描。)
详细发现
发现 1:核心数据与图表缺失(无法应用“耿同学六式”中的图片与数据检测)
- 位置:全文本
- 描述:提供的文本主要是引言与摘要,未包含第三章(数据探索)、第四章(模型建立与分析)的任何具体数值表格(如 AUC、KS 值等)、特征重要性图或混淆矩阵。
- 证据:文本中仅见目录结构提及“第四章 模型的建立和分析”,但未提供实际图表内容。
- 严重程度:ℹ️ 信息不足(非造假嫌疑)
- 耿同学视点:“巧妇难为无米之炊,连 WB 条带(ROC 曲线)和数值表都没看到,我的‘火眼金睛’暂时找不到PS的痕迹。”
发现 2:时间线与产出逻辑检测(第五式:产出异常检测)
- 位置:封面、摘要、第一章
- 描述:论文定稿于 2022 年 5 月,使用了美国 Lending Club 平台 2018 年上半年的开源数据。结合当前基准日期(2026-06-14),时间线完全符合逻辑。
- 证据:
- Lending Club 数据集是业内常用的开源真实数据集,并非凭空捏造的“某某医院内部数据”。
- 2018 年的数据在 2022 年用于硕士毕业论文,具有充足的脱敏和公开时间,符合学术界的数据使用滞后性常理。
- 涉及的算法(XGBoost, LightGBM, SMOTE, Stacking)在 2022 年时已是极其成熟的机器学习常规操作,不存在“穿越”使用尚未发布的算法库的情况。
- 严重程度:✅ 正常
发现 3:方法学与逻辑自洽性检测(第六式:引用与方法学异常)
- 位置:摘要与 1.2.1 研究目的
- 描述:作者声称做了两件事:一是使用 Stacking 融合(初级学习器为各种模型,次级为逻辑回归),二是提出了一种“基于特征子集划分的融合模型”。
- 证据:这种建模逻辑在计算机科学和数据挖掘领域是完全自洽的。文本中未出现前后矛盾(如前面声称用神经网络,后面公式全是线性回归的低级错误)。摘要中提到“试图提出一种基于特征子集划分的融合模型”,用词谨慎(“试图”),符合硕士论文的严谨态度,没有吹嘘“首创”或“颠覆性突破”。
- 严重程度:✅ 正常
发现 4:文本提取乱码与排版异常
- 位置:全文各处
- 描述:文本中出现了大量如
fl 必 南 樹 經 犬 嗲以及S O U T H W E S T E R NU N I V E R S I T Y等字间距过大和莫名字符。 - 证据:这是 PDF 转文本(OCR)过程中常见的乱码现象,特别是包含英文封面和水印时。
- 严重程度:ℹ️ 与学术诚信无关。
耿同学辣评
这篇论文目前看起来“人畜无害”,属于非常典型的“水……哦不,扎实的量化金融/统计硕士毕业论文”套路——“Lending Club 数据集 + 经典不平衡处理 (SMOTE) + XGBoost调参 + Stacking模型融合”。这套组合拳在各大高校的量化实验室里已经被打得滚瓜烂熟。作者老老实实承认是“参考已有文献的做法”,没有吹自己搞出了什么宇宙级突破,态度是相当诚恳的。
不过,打假打的就是“看不顺眼”。由于没看到具体的数据表和实验对比图,现在下结论还为时过早。如果后续章节里,那个“基于特征子集划分”的新模型在测试集上的 AUC 突然比 XGBoost 高出 10 个百分点,且数据分布平滑得像尺子画出来的一样,那耿同学可就要戴上显微镜好好瞅瞅了!
建议后续行动
- 暂无举报必要:基于目前提供的引言和摘要部分,未发现任何学术不端线索。
- 如需深度检测:请提供论文的第三章(数据处理)、第四章(模型结果与图表)以及完整的参考文献列表,以便进行像素级图片查重和末位数字分布的统计学异常检测。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。