Loading...
正在加载...
请稍候

基于机器学习的煤炭行业财务风险预警研究——以大有能源为例

2026-08-18 11:44

🔍 耿同学打假报告

论文信息

  • 标题:基于机器学习的煤炭行业财务风险预警研究——以大有能源为例
  • 作者:张雨
  • 期刊:兰州财经大学硕士学位论文(兰州财经大学会计学院)
  • DOI:无
  • 发表年份:2026年6月16日提交

综合评定:🟠 高度可疑

详细发现

发现 1:指标筛选逻辑自相矛盾

  • 位置:正文第 4.2.3 节 + 附表 2
  • 描述:正文称"0.05 显著性水平下,有两个指标的风险组和正常组之间有显著性差异(P<0.05),另外 31 个指标因为组间区分度不够没有通过显著性检验被排除",但紧接着又说最终选出 21 个关键变量,并称"研究样本共包含 343 条观测记录,与最终筛选出的 21 个特征变量之比约为 16:1"。附表 2 显示 P<0.05 的指标至少 21 项(X2、X3、X4、X5、X10、X12、X13、X17、X18、X20、X26、X27、X28、X33、X39、X40、X41、X43、X45、X49、X51 等),与"只有两个指标显著"严重矛盾;同时 21 项保留+31 项排除=52 项,在数学上加减关系看似能自洽,但"31 个指标因组间区分度不够被排除"与"两个指标显著"在因果上是冲突的——既然排除的依据是通过显著性检验,那排除的数量应等于"不显著的数量",而不是随便 31 个。从 52 项到 21 项的筛选过程,正文并未交代其余 19 项是如何从"显著"变到"被保留"的。
  • 证据:"有两个指标的风险组和正常组之间有显著性差异(P<0.05)"+"另外 31 个指标因为组间区分度不够没有通过显著性检验被排除"+"最终选出的 21 个关键变量"+"52 个候选指标";附表 2 显示 21 项 P<0.05。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:模型优化指标内部逻辑矛盾

  • 位置:表 4.5(模型优化前后对比)+ 表 4.4(具体参数)+ 表 4.3
  • 描述:表 4.5 列出基准模型 AUC=0.8906、F1=0.3750、精确率=0.2308、召回率=0.7500;"优化模型"AUC=0.9873、F1=0.2400、精确率=0.1364、召回率=1.0000。第 4.2.7 节把 SMOTEENN+逻辑回归选为"最优模型"的依据是其"F1-Score 为 0.3750,在所有的候选模型中最好"(表 4.3)。但表 4.5 同一组合"优化后"F1 反降至 0.2400——论文同时声称该模型的 F1 是 0.3750(最优)和 0.2400(优化后)。仅调整 C=10、penalty=L2、solver=liblinear、random_state=42 三个常规超参数,AUC 就从 0.8906 跃升到 0.9873 而召回率直接拉到 100%,但代价是精确率从 0.2308 跌至 0.1364——这种"AUC 大幅跃升+召回率冲到 1.0+精确率大幅下滑"的组合在统计上属于典型的阈值滑动效应,并不真正反映判别能力提升。
  • 证据:"AUC 0.8906 → 0.9873"、"F1-Score 0.3750 → 0.2400"、"精确率 0.2308 → 0.1364"、"召回率 0.7500 → 1.0000";"F1-Score 为 0.3750,在所有的候选模型中最好"。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:测试集风险样本极少,"召回率=100%"被过度包装

  • 位置:第 4.4 节 + 图 4.3
  • 描述:测试集中风险样本仅 3 个("测试集中所有的三个高风险企业都被正确地识别出来"),"误报数为 19","真负例为 112",总测试集样本量仅 134 条左右。在仅 3 个正样本的情况下,"召回率=100%"等价于"全部 3 个正样本被命中",这一结果几乎完全取决于阈值滑动,并不构成模型泛化能力的可靠证据。但论文反复将其作为"零漏报""风险防线的底座""具有很强的风险敏感性"等核心成果包装。
  • 严重程度:🟠
  • 反方论证:在样本极度不平衡的现实场景下,召回率确实是核心评价指标。但"测试集仅 3 个正样本 + 134 个总样本"的样本结构使得任何召回率结果在统计上都不具有显著性,且作者未提供置信区间或交叉验证证据。"统一导出管线"等通用解释无法覆盖此处"3 个样本/134 条数据"的统计本质缺陷。
  • 复核状态:✅ 成立

发现 4:时序外划分与大有能源"使用 2024 数据预测 2025"的逻辑张力

  • 位置:第 4.2.4 节 + 表 5.6
  • 描述:第 4.2.4 节规定"2014-2020 为训练集,2021-2024 为测试集",强调严格的时序外划分以严防数据泄露。但表 5.6 将大有能源 2020-2024 五年数据代入模型,并输出对 2025 年的预测(0.9815)。2024 年数据已属于论文定义的测试集,将其作为"应用数据集"重新代回已训练模型,这一处理方式与"严防数据泄露"的时序外划分原则存在逻辑张力,且无法证伪。
  • 严重程度:🟡
  • 反方论证:将企业层面数据代回用行业总体数据训练好的模型做应用演示在实务中是常见做法。但论文并未明确说明此操作是否经过重新训练,是否构成"训练集污染",文本依据不足。
  • 复核状态:⚠️ 依据不足

发现 5:同一模型组合在不同表中数值口径不一致

  • 位置:表 4.3 vs 附表 3 vs 表 4.5
  • 描述:表 4.3 中 SMOTEENN+逻辑回归 F1=0.3750、AUC=0.8906、精确率=0.2308、召回率=0.7500;附表 3 中 SMOTEENN+Logistic Regression 的 Recall=0.75、F1=0.3、AUC=0.833、Precision=0.188——同一组合在两张表中数值不同(F1 0.3750 vs 0.3、AUC 0.8906 vs 0.833、Precision 0.2308 vs 0.188)。表 4.5 中"基准模型"的指标与附表 3 的 SMOTEENN+LR 也不一致(基准 AUC=0.8906 vs 附表 3 SMOTEENN+LR 的 AUC=0.833),且列名中英文混杂。
  • 严重程度:🟠
  • 反方论证:可能性包括"基准模型"与"SMOTEENN+LR"实际是两次独立实验/不同 random_state 下的输出。但作为同一组合在两张表中报告,理论上同一组超参数下的输出应当一致,此差异无法用"统一导出管线"等通用托辞解释,原文未给出任何正面说明。
  • 复核状态:✅ 成立

发现 6:样本界定与"风险样本仅 3%"的数学不吻合

  • 位置:第 4.1 节 + 第 4.4 节
  • 描述:第 4.1 节称"选取了煤炭行业共计 34 家上市公司的财务指标数据作为原始样本……经剔除数据缺失值后,共计获得 343 条观测记录"。第 4.4 节称"风险样本只有 3% 的极端不平衡分布情况下"。343 条观测中 3% 约为 10 条,但实际测试集中"高风险企业 3 个+误报 19 个+真负例 112 个"≈134 条,3% 仅指测试集中 3/134≈2.2%,训练集的样本量与正负比例并未在文中明确披露,与"3% 极端不平衡"的整体口径并不一致。
  • 严重程度:🟡
  • 反方论证:作者可能指代"全样本整体的 3%"或"测试集的 3%",但文本未明确说明统计范围,存在口径模糊。"统一导出管线""同批次扫描"等通用解释不适用于此处纯文字表述,不足以清除文本自身的不一致。
  • 复核状态:⚠️ 依据不足

发现 7:方法部分对 24 种组合的描述与附表 3 行数不一致

  • 位置:第 4.2.7 节、附表 3
  • 描述:第 4.2.7 节称"将前述的 6 种采样策略与 4 种机器学习算法进行全组合,共构建了 24 个独立的实验流程",附表 3 实际列出 22 行组合(6 采样 × 4 算法=24,少了 2 行)。SMOTE+SVM 与 SMOTEENN+SVM 的 Recall 都是 1.0 但 Precision 只有 0.04,AUC 却分别是 0.185 和 0.828,差异极大而 Recall 相同,提示 SVM 在测试集上几乎把所有样本都判为正类(一种 degenerate 行为),论文并未解释这种差异。附表 3 列名英文、表 4.3 中文,报告同一组合的数据却对照不一致。
  • 严重程度:🟡
  • 反方论证:"22 行非 24 行"可能因有 2 行被截断至下页未纳入,本场景下属于排版/截断问题,非造假证据。但 SVM 同 Recall 不同 AUC 的异常确实缺乏解释。
  • 复核状态:⚠️ 依据不足

发现 8:财务数据呈现的过度精细小数位(伪精度)

  • 位置:表 5.2、表 5.3、表 5.4、表 5.5、表 6.1、表 6.2
  • 描述:大量财务比率以 5-6 位小数呈现——表 5.2 中"流动比率 0.472916""速动比率 0.456844""产权比率 2.019216""利息保障倍数 -52.090007""5.309004""10.710343""-0.415545""-2.976369";表 5.5 中"总资产增长率 -42.60311""1.12338""-0.670942""-0.069863""-0.021824";表 5.3 "营业收入 587114.46""资产报酬率 -0.0552""-0.0032"等。这种精度在企业年报披露中不可能存在(年报通常给出 2 位小数或整数百分数),几乎可以确定是作者在 Python 中直接用 float64 运算得到的"伪精度"。
  • 严重程度:🟡
  • 反方论证:在会计实证研究中使用原始计算精度(小数点后多位)是常见做法,且不会影响分析结论。这是对科研论文呈现规范性的质疑,而非对数据本身的真实性指控。
  • 复核状态:⚠️ 依据不足(无法凭此判定数据造假)

发现 9:研究结论与正文表述存在多处自相矛盾

  • 位置:第 7.1 节、第 5.2.2 节、第 4.3 节、第 5.1.2 节、第 6.1 节
  • 描述:① 第 7.1 节称模型"在保持 0.9873 高位 AUC 的同时,彻底消除了测试集中的漏报盲区",同时强调"总资产增长率的异动与股东权益周转效率的下滑构成了风险触发的核心变量",但第 4.3 节明确审计意见类型(X49)是前 5 名之一,与"核心变量只列两个"不完全一致。② 第 5.2.2 节宣称"2021 年至 2024 年的预测结果与企业实际风险状态一致,达到了 100% 的吻合度",但第 6.1 节对大有能源 2021 年的描述是"通过非经常性损益调控与资产结构优化,使……表面财务指标出现暂时性改善",说明 2021 年企业其实并未真正"陷入风险",与表 5.6 中"实际结论=1(风险)"的标注矛盾。③ 第 5.1.2 节称企业"完整地经历了从被实施特别处理、扭亏摘帽……",但通篇未给出 ST 的具体年份与公告,与表 5.6 "实际结论"列的"风险/非风险"标注缺乏公开事实可核验。
  • 严重程度:🟠
  • 反方论证:前 5 名有多个非财务指标是事实,但"核心驱动"前两个与第 7.1 节对"主要因素"的概括在文字颗粒度上不完全对应,措辞层面可解释。2021 年"风险/非风险"判断与 6.1 节的财务表象描述之间的"看似矛盾",可能源于"是否被监管正式认定为 ST"vs"实质财务困境"的定义差异,但论文未明确区分。
  • 复核状态:✅ 成立(核心数字与文字陈述同在原文出现且形成客观自相矛盾)

耿同学辣评

这篇会计硕士论文把"自己打自己的脸"演绎到了极致——附表 2 显示二十多项指标 P<0.05 却硬说"只有两个显著",表 4.3 的 AUC 和附表 3 的 AUC 像两个平行宇宙的数字,AUC 从 0.89 跳到 0.9873 只用了三个超参数调优却把 F1 从 0.375 砍到 0.24 还敢叫"性能飞跃",测试集只放 3 个风险样本就敢说"零漏报防线",最后还对还没到来的 2025 年给出概率 0.9815 的"红色预警"——耿同学只想问一句:张雨同学,你到底是在写实证研究,还是在用 Python 做梦?

建议后续行动

  • 要求作者提供原始 Python 脚本、超参数搜索日志、训练/测试集索引
  • 复查附表 2 中"显著指标计数"与"21 项保留"之间的逻辑关系
  • 核查大有能源历年被 ST 的真实公告与表 5.6"实际结论"列的对应关系
  • 重新生成全部 ROC 图与混淆矩阵图,与原图比对是否经过人为修改
  • 对"24 种组合"与附表 3 的行数差异给出明确解释

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。


🧮 证据合成(自动生成)

  • 综合后验概率:98.5%(先验 5%)
  • 95% 可信区间:[88.4%, 99.8%]
  • 贝叶斯因子:BF = 1.25e+3(决定性(decisive))
  • 综合评级:🔴 高度疑似
  • 复核已排除线索:25 条(良性解释成立 / 检验前提不满足 / 说明性条目,未计入合成)

贡献最高的证据

  1. [发现5] 同一 SMOTEENN+LR 组合在表 4.3/附表 3/表 4.5 中三套数值不一致(llm/*,logLR=1.59)— 贡献 23.9%
  2. [发现2] 同一模型在表 4.3 与表 4.5 中 F1 分别为 0.3750 与 0.2400,且 AUC 大幅跃升伴随 F1 下降(llm/*,logLR=1.59)— 贡献 22.6%
  3. [发现3] 测试集仅 3 个正样本,召回率 100% 几乎完全取决于阈值滑动,无法证明模型实战价值(llm/*,logLR=1.59)— 贡献 22.5%
  4. [发现7] 343 条观测中 3% 应约 10 条,但测试集报告的 3/134≈2.2%,与正文 3% 不符(llm/*,logLR=1.08)— 贡献 14.6%
  5. [发现1] 正文称仅 2 个指标显著但附表 2 显示 20+ 项 P<0.05,52→31→21 的筛选路径与文字描述相加不自洽(llm/*,logLR=0.9)— 贡献 11.4%

免责:本小节由程序化贝叶斯合成自动生成,不构成学术不端判决。先验固定 5%,证据间按条件独立处理(可能高估相关证据的联合强度),LR 版本 geng_lr_v3(Phase 5 基准回归校准:任务级触发率比值+复核处置标签,n=11,向 v2 收缩 k=10);可信区间与点估计来自同一后验(先验抽样 + LR 噪声的联合蒙特卡洛,区间随证据强度收敛)。请以正文具体发现与原始数据为准。