基于随机森林模型的绿色金融对京津冀碳排放的影响研究
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:基于随机森林模型的绿色金融对京津冀碳排放的影响研究
- 作者:陈俊楷
- 期刊:河北金融学院硕士学位论文(答辩日期:2026年5月23日)
- DOI:无(学位论文)
- 发表年份:2026年
- 论文来源:基于随机森林模型的绿色金融对京津冀碳排放的影响研究_陈俊楷.pdf
综合评定:🔴 实锤
详细发现
发现 1:基础数学概念崩坏(第二式:数据造假与逻辑检测)
- 位置:第三章 3.1.3 绿色金融指数构建(第17页)
- 描述:论文在解释主成分分析(PCA)的碎石图结果时,出现了令人匪夷所思的数学表述。
- 证据:原文声称“特征值大于 1 的主成分占全部原始四变量的 93.41%,第二个主成分的特征值为 0.197 略高于 1,其后方差解释率大幅度下降”。在基础数学中,0.197 显著小于 1,作者却称其“略高于 1”,这不仅是低级笔误,更暴露出作者极有可能根本不理解 PCA 的原理(Kaiser 准则通常是保留特征值 > 1 的主成分),甚至是盲目编造了这组数据。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:相关系数矩阵严重不对称(第二式:数据造假检测)
- 位置:第四章 4.2 相关性分析,表 5(第24页)
- 描述:表格中呈现的 Pearson 相关系数矩阵在主对角线两侧出现了不一致的数值。相关系数矩阵在数学上必须是严格对称的(即变量 A 与 B 的相关系数,必定等于 B 与 A 的相关系数)。
- 证据:
- 矩阵中“绿色金融指数”与“人口密度”的相关系数为 0.52,而下三角中“人口密度”与“绿色金融指数”的相关系数却变成了 0.51。
- “绿色金融指数”与“能源结构”的相关系数为 -0.68,而下三角对应位置却是 -0.67。
这意味着该矩阵并非由真实数据通过统计软件(如 RStudio)一键导出,而是人工手动输入或随意编造时出现了肉眼可见的破绽。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:小样本机器学习的“完美”过拟合(第四式:统计学异常检测)
- 位置:第四章 4.4 异质性分析,表 7(第35页)
- 描述:作者将数据分为北京、天津两个子样本进行随机森林建模。北京和天津各自仅有 20 个样本点(即 20 年的数据)。按照作者前文 7:3 的划分比例,测试集只有 6 个样本。
- 证据:在仅用 14 个样本作为训练集、6 个样本作为测试集(且包含多个自变量)的情况下,作者报告北京的 \(R^2\) 为 0.95,天津的 \(R^2\) 为 0.94。在极端小样本下投入高自由度的树模型(500棵树),结果还能得到 0.95 的极高拟合度,这在机器学习实践中是严重违背常理的。这高度提示模型发生了荒谬的过拟合,或者测试集的 6 个数据完全是人为捏造/复制训练集数据。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 4:研究设计文本“套模板”遗留的时空错乱(第六式:引用与方法学异常)
- 位置:第一章 1.1.1 研究背景(第1页) & 1.3.1 研究内容(第5页)
- 描述:论文存在明显的“复制粘贴”与套模板痕迹,导致核心研究区间在摘要和正文中出现了自相矛盾。
- 证据:
- 摘要与第三章 3.1.1 明确写道:“文章通过整理 2005-2024 年京津冀 13 个城市的面板数据”。但在 1.3.1 研究内容中,却赫然写着:“确定以京津冀 13 个城市 2016-2022 年 的面板数据为研究样本”。年份跨度存在巨大矛盾。
- 在 1.1.1 中,作者写道:“2026 年,中共中央、国务院联合发布《关于完整准确全面贯彻新发展理念做好碳达峰碳中和工作的意见》”。事实上,该《意见》是 2021年 发布的。作者连国家重大战略文件的发生年份都能写错,且精准地写成了自己写论文的年份(2026年),暴露出为了赶进度而强行编造背景的嫌疑。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 5:描述性统计与表格数据的内外冲突(第二式:数据造假检测)
- 位置:第四章 4.1 描述性统计,表 2 与表 3(第22-23页)
- 描述:正文叙述、表 2 和表 3 之间的数据互相打架,作者对自己编造(或机械拼接)的数据缺乏基本校对。
- 证据:
- 表 2 描述性统计显示,“绿色金融综合指数”的最大值为 1。而在正文描述中写道:“北京(均值为 1.00)”。如果一个地区历年的均值已经达到了全样本的最大值(1.00),这意味着北京每年的数值都必须完美无缺地等于 1.00,这在连续型综合指数中是极不自然的。但在表 3 中,北京的均值又变成了 0.43。
- 表 8(中介效应检验)中,模型 A 的得分 18.14 减去模型 B 的得分 12.76,结果应为 5.38(正文也写了 5.38),但表格的“重要性变化值”列中赫然填着 5.39。这种“我说 5.38 就是 5.38,表格算出来多少我不管”的态度,实锤了数据的不可靠性。
- 严重程度:🔴
- 复核状态:✅ 成立
耿同学辣评
这篇论文可以说是“AI 味道拉满,基本逻辑拉垮”。作者在使用机器学习算法包装自己的论文时,显然忘记给自己“充点电”。说 0.197 略大于 1,这已经不是数学不好了,这是视基础科学为无物;相关系数矩阵连对称都做不到,难道你的 Rstudio 是用盗版算出平行宇宙了?最搞笑的是前脚说用 2005-2024 年数据,后脚变成 2016-2022 年,连中央文件都能穿越到 2026 年发布。机器学习不是“学术遮羞布”,用 20 个样本跑出 0.95 的 \(R^2\),你这不是随机森林,你这是在测试集上建了座“人工海市蜃楼”!
建议后续行动
- 联系作者要求提供原始数据及 R 代码(重点查证非对称矩阵与样本划分)
- 在答辩委员会或学校学术委员会层面提出质询
- 在 PubPeer 上提出质疑
- 向期刊编辑部举报(注:本篇为硕士学位论文,应向所在机构举报)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。