基于Blending融合算法的贷后信用风险预测
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于Blending融合算法的贷后信用风险预测
- 作者:刘晓川
- 指导教师:彭作祥 教授
- 期刊/来源:西南大学应用统计专业硕士学位论文(文件名:基于Blending融合算法的贷后信用风险预测_刘晓川.pdf)
- 发表/答辩年份:2023年
综合评定:🟠 高度可疑
详细发现
发现 1:实验设计存在“薛定谔的测试集”(对照组与实验组评估基准不一致)
- 位置:第4章(4.1节、4.2节、4.4节)及表4.3
- 描述:作者在对比四个模型(随机森林、LightGBM、CatBoost 和 Blending)的性能时,使用了不同的数据集划分比例。
- 三个基线模型(对照组)的划分比例为:
8:2(即20%的数据作为测试集)。 - Blending模型(实验组)的划分比例为:先按
9:1划分,然后把90%的训练集再按8:2划分。
- 三个基线模型(对照组)的划分比例为:
- 证据:原文中明确写道:“首先利用...构建随机森林模型,训练集和测试集的比例为8:2。”而在Blending部分则写道:“将原始数据集按9:1的比例划分为训练集和测试集...”。这意味着Blending的测试集(10%)比其他三个模型的测试集(20%)小了一半!在机器学习中,测试集大小不同,得到的准确率和AUC完全没有可比性。
- 严重程度:🔴 (致命的方法学漏洞,直接影响核心结论的有效性)
发现 2:Blending 算法实现逻辑崩塌(疑似生造的伪算法步骤)
- 位置:4.4节 基于 Blending的贷后信用风险 预测(Page 37)
- 描述:作者描述了一个极其离谱的模型融合步骤:“根据过程性可观测变量
fico_change将新的训练集分为两部分,记为train0和train1... 然后分别在train0、train1和新的训练集上训练LightGBM、CatBoost和随机森林模型”。 - 证据:标准 Blending 算法中,第一层的基学习器必须在整个训练集上进行训练,以学习数据的全局模式。作者仅仅因为一个二分类特征(
fico_change取值为0或1),就把数据集切碎,分给三个不同的模型去训练,然后强行把它们拼起来。如果LightGBM只学习了fico_change=0的数据,它如何去预测包含fico_change=1的测试集?这是对集成学习常识的严重违背,疑似为了凑出“创新点”而生造的伪逻辑。 - 严重程度:🔴
发现 3:疑似存在严重的数据泄露,导致“太完美”的模型性能
- 位置:3.4节(Page 32)与 第4章
- 描述:在3.4节中,作者提到使用
Borderline-SMOTE过采样来平衡正负样本(违约与未违约比例约 22% vs 78%)。但在第4章建立模型时,作者并没有说明是在划分训练集和测试集之前还是之后进行的过采样。 - 证据:在信用风险预测中,如果先对整个数据集进行SMOTE过采样,然后再划分训练集和测试集,SMOTE插值生成的人造样本会同时出现在训练集和测试集中(即信息泄露)。这会导致模型(尤其是擅长死记硬背的树模型和融合模型)在测试集上表现出虚高、极其完美的性能。本文的 Blending 模型 AUC 高达 0.9352,在真实的信贷预测(尤其是贷前/贷中)中极为罕见,高度符合过拟合或数据泄露的特征。
- 严重程度:🟠
发现 4:论文流程时间线出现物理级别倒挂
- 位置:封面及前言部分(Page B)
- 描述:论文封面上标注的日期为:“提交论文日期:2023 年 6 月 11 日”,而紧挨着的下一行写着“论文答辩日期:2023 年 5 月 27 日”。
- 证据:当前日期为 2026年,不论如何,国内高校的硕士论文流程必须是:盲审/评议 -> 答辩 -> 提交最终定稿。作者在答辩(5月27日)半个月后(6月11日)才“提交论文”,这在时间逻辑上是矛盾的(通常提交初稿后才允许答辩,答辩后提交的是带有签字版的最终稿或存档稿,而非“提交论文日期”)。
- 严重程度:🟡 (可能是排版套用模板时的低级疏忽,但也暴露了治学不严谨)
耿同学辣评
这篇论文的算法逻辑简直是“离谱他妈给离谱开门——离谱到家了”。为了证明自己的 Blending 模型牛,不仅在测试集大小上玩“双标”(对照组用20%测试集,实验组用10%测试集),还硬生生把 Blending 的基模型大卸八块(按特征取值拆分数据集分给不同模型),随机数生成器都不敢这么写。真实世界里如果信贷机构用这种“薛定谔的融合模型”去放贷,估计风控部门底裤都得赔掉!
建议后续行动
- 建议知网或相关盲审专家重新复核本文的机器学习算法代码(如果有的话),确认第4章对照组与实验组的测试集划分是否真如文中所述不一致。
- 要求作者提供 SMOTE 重采样的代码执行顺序,确认是否存在信息泄露。
- 在 PubPeer 或相关学术平台上对此方法学漏洞提出公开质疑。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。