GNN&GBDT-Guided Fast Optimizing Framework for Large-scale Integer Programming
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:Ye 等 - 2023 - GNN&GBDT-Guided Fast Optimizing Framework for Large-scale Integer Programming.pdf
- 标题:GNN&GBDT-Guided Fast Optimizing Framework for Large-scale Integer Programming
- 作者:Huigen Ye, Hua Xu, Hongyan Wang, Chengming Wang, Yu Jiang
- 期刊/会议:Proceedings of the 40th International Conference on Machine Learning (ICML 2023), Honolulu, Hawaii, USA. PMLR 202.
- 发表年份:2023
综合评定:🟠 高度可疑
(综合判定理由:虽然本文为纯计算机科学/算法类论文(无传统生物医学图像),免除了“PS痕迹拼图”等检测,但其实验数据的完整性与对照组设定的合理性存在极其严重的“选择性呈现”与“掩饰性对比”嫌疑,严重违背了机器学习实验的公平比较原则。)
详细发现
发现 1:严重的数据隐瞒与“稻草人”对比(Baseline 数据大面积缺失)
- 位置:Appendix D (Additional Experiments) - Table 4 & Table 5 (小规模实验)
- 描述:作者在 Table 4 和 Table 5 中对比了小规模问题(10,000个变量)的求解。但是在 CA1、MVC1、SC1 的列中,Gurobi 的对比数据(无论是目标值还是运行时间)竟然是完全空白的。
- 证据:对于一个仅有 1 万个变量的 MILP 问题,目前的顶级的求解器(如 Gurobi 10.0)通常能在几毫秒到几百毫秒内直接求出最优解。如果填上 Gurobi 的数据,作者所谓的“节省 99% 运行时间”和“超越 Baseline”的神话将瞬间破灭。作者故意通过留白(或声称找不到解)来掩盖其框架在小规模问题上根本无法击败商业求解器的事实。
- 严重程度:🔴
发现 2:统计学异常与掩人耳目的标准差
- 位置:Section 4 (Experiments) 全文
- 描述:论文声称“All experiments are repeated five times and the metric average is recorded.(所有实验重复五次并记录平均值)”。但是纵观 Table 1 和 Table 2,所有的运行时间(如 49.7s, 1925.8s, 969.8s)和目标值,没有给出任何一个标准差或置信区间。
- 证据:在严谨的 ICML 神经网络训练实验中,由于随机种子(如 GNN 的随机初始化、GBDT 的随机抽样)的影响,5次重复实验绝对不可能得到完全一致的运行时间或结果。不报告标准差,极大概率是为了掩饰实验结果的不稳定,或者根本就没有跑满 5 次。
- 严重程度:🟠
发现 3:算法对比逻辑存在严重“双标”(Avoidance of Direct Competitors)
- 位置:Appendix D.2 (Baseline)
- 描述:作者在引言中大篇幅吹嘘了现有的“最新两阶段 GNN+LNS 框架”的流行度,并指出本文就是针对该框架的痛点进行改进的。然而在实验对比时,作者却写道:“its code is not fully open source. So we did not include it in the baseline in this paper.(代码未完全开源,所以不把它作为基线)”。
- 证据:学术界惯例中,如果是对 A 框架的改进,就算 A 不开源,作者也通常会根据原论文复现一个基础版本进行对比,而不是直接拿传统的精确求解器(SCIP/Gurobi)当软柿子捏,以此来凸显自己算法的优越性。这是典型的“打假靶子”行为。
- 严重程度:🟠
发现 4:Table 2 数据自相矛盾与逻辑错乱
- 位置:Section 4.2 - Table 2 (Comparsion of running time)
- 描述:表2的
Target(目标值)行出现了大面积的空白,并且数据对应逻辑存在严重问题。 - 证据:在 Table 1 中,作者给出了
Ours-30%S的目标结果。按照 Table 2 的目的(达到相同结果的时间),Table 2 中的Target理应与 Table 1 高度一致。但在 Table 2 中,CA3、MVC3、MVC2、SC2、SC3 的Target全部是空白的。如果连对比的Target都没给全,读者如何知道作者在 Table 2 中跑出的“短时间”对应的是哪个质量级别的解?这是一种操纵数据呈现来夸大效果的手段。 - 严重程度:🟠
发现 5:参考文献格式的“底层崩坏”(盲猜是复制粘贴的半成品)
- 位置:References 部分
- 描述:参考文献中存在大量格式残缺和人物名字“变异”的现象。
- 证据:
- 大量文献缺失年份,例如
routing(Shaw,),network designing(Du & Pardalos,),bin packing(man Jr et al., 1996)。 - 著名计算机科学家 Michael R. Garey 和 David S. Johnson 的名字被离奇写成了
man Jr, E. C., Garey, M., and Johnson, D.(前言里写的是man Jr et al., 1996)。这极大概率是从某个排版极差的 PDF 或网页直接复制粘贴,且作者根本没有校对。连参考文献都能敷衍至此,很难让人相信其实验数据是严谨收集的。
- 大量文献缺失年份,例如
- 严重程度:🟡
发现 6:代码仓库链接缺失(挂羊头卖狗肉)
- 位置:Section 4 (Experiments)
- 描述:作者写道:“Code for reproducing all of the experiments can be found at Fast-Optimizing-Framework.”
- 证据:作者仅仅写了一个文本名称,并没有提供有效的 GitHub URL 链接。这在要求 Open Source / Reproducibility 的 ICML 会议上是非常罕见且违规的,极大概率意味着代码并未真正开源,或者不想让同行复现其实验结果。
- 严重程度:🟡
耿同学辣评
“满篇的‘超越 Gurobi’和‘节省99%时间’,结果一到小规模数据对比,Gurobi 的数据列直接给你来个‘物理隐身’?拿 ML 启发式算法和最先进的商业精确求解器比拼‘规定时间内的启发式表现’,甚至为了怕露馅连最核心的对比算法都因为‘没开源’就不比了。最逗的是,连图灵奖得主 Garey 和 Johnson 的名字都能被你复制粘贴成
man Jr et al.,咱就是说,就算是造房子,你这地基也敷衍得太过分了吧?”
建议后续行动
- 在 PubPeer 或 OpenReview 上向作者质询:为何在 Table 4 和 Table 5 中隐瞒了 Gurobi 在小规模测试集(10000 变量)上的表现?
- 要求作者公开其 5 次重复实验的标准差,并解释 Table 2 中大面积缺失的 Target 目标值。
- 要求作者提供有效、可运行的 GitHub 代码仓库链接,而非一段纯文本。
- 联系 ICML 2023 的 Program Chairs,指出该论文在实验设置上存在严重的“避重就轻”和“破坏可复现性原则”的问题。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。