用于表格数据的自动特征交互框架
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:用于表格数据的自动特征交互框架
- 作者:卞蓓蕾,翁东雷,王露民,莫建国,杨东东
- 期刊:微型电脑应用 (Microcomputer Applications),2023年第39卷第9期
- 收稿日期:2022-11-01
- 论文来源:用于表格数据的自动特征交互框架_卞蓓蕾.pdf
综合评定:🔴 实锤
详细发现
发现 1:文本拼接错误 / 套用代写模板(第三式:图片/文本拼接检测的延伸)
- 位置:正文第2节结尾(第81页)与第86页的参考文献列表
- 描述:在论文正文第2节结束,正要进入第3节总结时,文章内容突然变成了**《输变电工程建设周期》**的结论(“此输变电工程采用本文方法、文献[2]方法和文献[3]方法分别对其进行建模...”),并且紧接着列出了一堆关于“变电站”、“BIM技术”、“三维可视化”的参考文献[1]-[10]。直到页面底部才用“(上接第81页)”接回本文的真正结论。
- 证据:这是一篇探讨机器学习(AutoML)的论文,却在核心位置大段穿插了电力工程建设周期的内容。这是典型的论文代写工厂(Paper Mill)流水线作业、复制粘贴拼凑留下的低级马脚。
- 严重程度:🔴
发现 2:表格标号与正文严重冲突(第六式:方法学异常)
- 位置:表1、表4及其对应正文(第80-81页)
- 描述:
- 正文写道:“实验采用6个公开的数据集...如表1所示”,但表1的标题赫然写着“表1 5个公开数据集的属性”(实际上表内确实列了6个数据集)。
- 正文在描述时间序列预测结果时写道:“使用不同模型的MSE的大小可以观察到...记录结果如表1所示。” 但实际上紧接在下面的表格是“表4 不同方法在时间序列数据集上的MSE”。
- 证据:连表格序号和数量都能指鹿为马,说明作者在拷贝粘贴其他论文素材或拼凑修改时,根本没有通读全文,毫无学术严谨性可言。
- 严重程度:🔴
发现 3:违背机器学习常理的“魔幻”实验数据(第二式:数据造假检测 / 第四式:统计学异常)
- 位置:表2与表3(Adult数据集上的AUC表现)
- 描述:
- 在表2中,基础LR模型的AUC仅为0.619,加入半显式特征后AUC达到0.925。
- 在表3中,面对同样的Adult数据集,AutoFi+LR 的AUC竟然达到了惊人的 0.930!而作为强非线性模型的 XGBoost 和 TabNet,在使用AutoFi特征后,AUC分别只有 0.928 和 0.925,居然被简单的逻辑回归(LR)超越了。
- 证据:逻辑回归(LR)是线性模型,在没有复杂特征交叉的情况下,其性能通常远低于树模型和深度学习模型。本文仅仅通过加法、GBDT和Embedding生成特征,就让LR在Adult这种常规数据集上跑出0.93的AUC并“反杀”XGBoost。这种“为了凸显自己的框架牛,硬编出小数点后两位来吊打SOTA模型”的数据,连随机数生成器都不敢这么写。
- 严重程度:🟠
发现 4:时间序列预测的方法学断裂(第六式:方法学异常)
- 位置:1.1 显式低阶特征生成 & 2.2 实验结果分析
- 描述:论文在第1.1节明确写道:“本文仅考虑类别和数值这两种类型的特征”,框架的核心是特征交叉。但在表4中,作者却用该框架去处理 ETThm1 时间序列数据集,并声称用 AutoFi+RNN、AutoFi+LSTM、AutoFi+Transformer 降低了MSE。
- 证据:RNN/LSTM/Transformer 处理时间序列的核心在于时间步的序列依赖。本文的 AutoFi 框架全篇没有提及如何处理时序依赖(如滑动窗口提取特征),直接把基于表格数据的特征工程套用到时序模型上,并得出了“显著降低误差”的结论。这种张冠李戴说明作者根本不懂算法原理,纯属凑结果。
- 严重程度:🟠
发现 5:作者专业背景与论文内容严重脱节(第五式:产出异常)
- 位置:作者简介
- 描述:第一作者卞蓓蕾研究方向为“电网调度”;翁东雷为“变电运检技术”;王露民为“继电保护”;莫建国为“设备监控”;杨东东为“高压电缆”。整个团队清一色的传统电气/电力工程师,却没有一个具有计算机、人工智能或数据科学背景。
- 证据:虽然没有规定电力工程师不能搞AI,但一群专注传统电网业务的高级工程师,在一本非顶级期刊(微型电脑应用)上突然发表了一篇深度学习底层特征交互框架(对标 AutoGluon、TabNet),并且连图表编号都能抄错,这极其符合“花钱买论文/挂名代写”的画像。
- 严重程度:🟡
耿同学辣评
这篇论文简直是学术界的“缝合怪”!前一秒还在用 LR 和 XGBoost 跑表格数据,下一秒突然切镜头教大家怎么建“输变电工程三维模型”;正文信誓旦旦说用了6个数据集,表头非要写成5个;为了让自己的框架好看,硬生生把逻辑回归(LR)的 AUC 拔高到了 0.93,一脚踢翻了 XGBoost 和 TabNet 的饭碗。最可笑的是,代写机构在拼凑论文时,连别人的参考文献和章节都忘删干净了,直接“上接第81页”,把底裤全露出来了。这哪是自动特征交互框架,这是“自动文本拼接框架”吧!
建议后续行动
- 直接实锤:将文本拼接漏洞和表格对应错误作为铁证,在 PubPeer 上公开提出质疑。
- 联系《微型电脑应用》编辑部,指出其审稿流程存在严重渎职,连拼凑的文本和错误的图表序号都没发现。
- 向第一作者所在单位(国网浙江省电力有限公司宁波供电公司)学术委员会举报,核查该论文是否涉及代写代发、骗取科研绩效。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。