Loading...
正在加载...
请稍候

以大数据之史鉴 人工智能之未来 ——案例研究和实证分析

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 论文来源:20190926201006530832.pdf
  • 标题:以大数据之史鉴 人工智能之未来 ——案例研究和实证分析
  • 作者:魏成
  • 期刊:北京大学硕士学位论文(学位论文)
  • DOI:无(学位论文)
  • 发表年份:2017年5月

综合评定:✅ 清白

详细发现

发现 1:正文与表格数据微小不一致(疑似笔误)

  • 位置:第四章,4.5节,第32页
  • 描述:在对比模型性能时,正文描述为:“LR模型的TypeI错误为 29.97%,Type II错误为 22.41%。”然而,查看同页的表 4.4 及前文 4.3 节的表 4.1,LR模型对应的 Type I Error(即真实为幸福但判断为不幸福的比例)数值为 27.97%。
  • 证据:表 4.4 明确列出 LR 模型 Type I Error 为 27.97%,而紧邻的段落文字写成了 29.97%。这在数学上无法对齐,属于典型的撰写排版疏忽。
  • 严重程度:🟡(轻微异常,不影响核心结论,属于无心之失)
  • 复核状态:✅ 成立

发现 2:实验数据真实合理(未发现异常)

  • 位置:全文图表及第四章模型数据
  • 描述:结合论文图片视觉分析摘要,前部章节的图表(如图2.1、图2.2、图2.3等)均为外部第三方机构(BCG、Gartner、Google)的公开资料引用,非作者原创实验数据。第四章的实证部分(图4.1-4.6)的机器学习模型指标(AUC值、准确率、误差率等)在逻辑上高度自洽,无异常的“完美数值”。
  • 证据:第四章 Logistic 回归的 AUC 为 0.791,神经网络 MLPNN 的 AUC 为 0.808。计算时间分别为 3.8 分钟和 352.9 分钟。这种“耗费近百倍算力仅换来 1.7% 的 AUC 微弱提升”的真实痛点,非常符合 2017 年机器学习在传统社会科学调查数据上的实际表现,造假者通常倾向于编造更具“革命性”的提升幅度。
  • 严重程度:无(未触发红旗)
  • 复核状态:✅ 成立

发现 3:统计学与机器学习方法逻辑自洽

  • 位置:第四章,4.3 - 4.5节
  • 描述:Logistic 回归和多层神经网络的结构定义、符号说明、正则化方法以及梯度下降求解过程均符合标准机器学习教科书规范。未发现样本量在不同实验中不一致的情况(有效数据 61018 条贯穿始终)。模型对比结论(数据量不大时,深度学习方法优势不明显且成本高昂)与当前经济学界的普遍认知一致。
  • 证据:公式与算法(如 L2 正则化、随机梯度下降)推导未发现明显数学矛盾。
  • 严重程度:无(未触发红旗)
  • 复核状态:✅ 成立

耿同学辣评

这篇 2017 年的经济学硕士论文主打一个“清澈的诚实”。花了几百分钟跑出来的神经网络,AUC 才比逻辑回归高了 0.017,这种“费了半天劲结果没啥大用”的心酸打工数据,编是编不出来的,因为真正想造假的人早就直接把性能指标吹上天了!唯一的瑕疵就是把 27.97% 的 Type I Error 在正文里错打成了 29.97%,纯属查重时没戴老花镜导致的翻车,瑕不掩瑜,可以放心食用。

建议后续行动

  • 无需联系作者要求提供原始数据(仅存在轻微笔误)
  • 无需在 PubPeer 上提出质疑
  • 无需向期刊编辑部举报
  • 无需向作者所在机构学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。