Towards General Algorithm Discovery for Combinatorial Optimization: Learning Symbolic Branching Policy from Bipartite Graph
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:Kuang 等 - 2024 - Towards General Algorithm Discovery for Combinatorial Optimization Learning Symbolic Branching Poli.pdf
- 标题:Towards General Algorithm Discovery for Combinatorial Optimization: Learning Symbolic Branching Policy from Bipartite Graph
- 作者:Yufei Kuang, Jie Wang, Yuyan Zhou, Xijun Li, Fangzhou Zhu, Jianye Hao, Feng Wu
- 期刊/会议:Proceedings of the 41st International Conference on Machine Learning (ICML 2024), PMLR 235
- 发表年份:2024
综合评定:🟠 高度可疑
详细发现
发现 1:核心数据高度雷同(复制粘贴实锤?)
- 位置:Table 2 (第 8 页) 及 Appendix Table D8 (第 18 页), Table D12 (第 19 页)
- 描述:在 Table 2 中,作者对比了不同模型的模仿学习准确率。令人震惊的是,在 Facilities 数据集上,GS4CO 主模型以及它的两个消融模型,竟然输出了完全一致的精确数值:
- No-Encodings (无编码消融版): 66.78%
- No-Constraints (无约束消融版): 66.78%
- GS4CO (完整版主模型): 66.78%
- 证据:这还不算完,在 Appendix 的 Table D8(不同聚合层数的消融实验)中,Facilities 在 2 层时的准确率也是 66.78%;在 Table D12(与 Symb4CO对比)中,GS4CO 的准确率依然是 66.78%。在强化学习和神经网络中,修改核心网络结构(如去掉编码、去掉约束、修改网络层数),最终在百分比精度上千分位都不发生哪怕一丝一毫的改变,在数学概率上接近于不可能。这高度疑似作者在填表时发生了“复制粘贴”的遗漏,或者模型根本就没有按描述那样去跑不同的消融实验。
- 严重程度:🔴
发现 2:正文与附录的核心实验参数发生严重打架(薛定谔的数据集)
- 位置:Section 5.1 Training (第 7 页) 与 Appendix B. Data Generation (第 14 页)
- 描述:关于 GS4CO 的训练数据量,正文和附录给出了完全矛盾的描述。
- 正文声称:“我们生成 100 个训练实例和 20 个验证实例,并获得了 10,000 和 2,000 个样本”;在 5.2 节甚至总结说“我们仅使用了 1% 的实例和 10% 的样本”。
- 附录打脸:“对于 GS4CO,我们生成 十个 (10) 训练实例和 四个 (4) 验证实例……我们得到 1,000 个训练样本,其中 400 个用于验证。”
- 证据:如果附录里的(10个实例,1000个样本)是真的,那么相对于基线的 10,000 个实例和 100,000 个样本,比例应该是 0.1% 和 1%,而不是正文大吹特吹的“1% 和 10%”。这是作者自己写完论文后忘了统一前后数据的典型“造假/敷衍”特征。连用了多少数据自己都搞不清楚,实验结果可信度大打折扣。
- 严重程度:🟠
发现 3:测试集样本量与正文声明冲突
- 位置:Section 5.1 Evaluation (第 8 页) 与 Appendix B. Data Generation (第 14 页)
- 描述:关于测试集规模,作者在不同地方给出了完全不同的数字。
- 证据:正文 Section 5.1 明确写着:“所有评估均在 50 个测试实例上进行 (All evaluations are conducted over 50 test instances)”。然而,在附录的 Data Generation 部分,作者明确写道:“我们在具有 3000s 时间限制的 240 个实例上评估所有方法(80 个 easy,80 个 medium 和 80 个 hard 实例)”。这种基础实验设置的前后矛盾,体现了极度粗糙的论文撰写态度。
- 严重程度:🟠
发现 4:缺乏统计学支撑的“显著优于” (Significantly Outperform)
- 位置:Table 1 & Table 2 (第 8 页), 以及 Section 5.2 文本描述
- 描述:作者在正文中多次声称 GS4CO 的表现“显著优于” 基线模型,尤其是 Table 2 声称准确率显著优于 Tree model。
- 证据:通览全篇及附录,所有的实验结果仅仅提供了一个孤零零的均值(没有标准差、没有置信区间)。在 NP-Hard 的组合优化问题中,求解时间的方差通常极大。在没有提供任何 p-value、t-test 或 Wilcoxon 检验的情况下,单凭几何均值就宣称“显著”,在严谨的机器学习论文中是不合格的。结合前面发现的 66.78% 精确重复问题,这里的“显著”大概率是作者的主观修辞。
- 严重程度:🟡
发现 5:排版混乱与文本提取乱码
- 位置:全文多处(如 Introduction 末尾的公式部分、Section 2 末尾等)
- 描述:PDF 文本中出现了大量毫无意义的符号乱码(如
�)以及由于排版错误导致的断句残缺。 - 证据:虽然这属于排版和 PDF 转换问题,但作为录用于顶级会议 ICML 的论文,文本中出现了诸如图表穿插进句子中间的残缺现象(如第 2 页 Introduction 部分突兀地插入了无关的数学符号组合),说明在提交 Camera-Ready(最终版)时校对极其不认真。
- 严重程度:🟡
耿同学辣评
这篇发在顶会 ICML 的论文,不仅给我大谈特谈“我的模型比所有基线都好”,结果一看详细数据,自己把自己的消融实验给“消融”成了同一个精确到小数点后两位的数字(66.78%)——怎么着,你这模型的收敛能力是定海神针吗?拔不掉也改不动?更逗的是,正文说用了 100 个样本去训练,到了附录里又交代只用了 10 个,样本数据量自己跟自己打架。这篇论文要是拿去给第一届“文献复现大会”审,高低得被挂在耻辱柱上。这不仅是连数据都不好好编,这是连 Copy-Paste 都懒得检查了呀!
建议后续行动
- 联系作者要求提供原始数据(特别是 Facilities 数据集上各个消融模型的 log 和随机种子)。
- 在 PubPeer 上提出质疑,要求作者解释 66.78% 的一致性以及正文与附录训练数据量的矛盾。
- 向期刊/会议编辑部(PMLR / ICML 2024 组委会)举报,要求其发布勘误甚至启动学术审查。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。