Large Language Model-driven Large Neighborhood Search for Large-Scale MILP Problems
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:Ye 等 - 2025 - Large Language Model-driven Large Neighborhood Search for Large-Scale MILP Problems.pdf
- 标题:Large Language Model-driven Large Neighborhood Search for Large-Scale MILP Problems
- 作者:Huigen Ye, Hua Xu, An Yan, Yaoyang Cheng
- 期刊/会议:Proceedings of the 42nd International Conference on Machine Learning (ICML), Vancouver, Canada. PMLR 267, 2025.
- 发表年份:2025
综合评定:🟠 高度可疑
(注:本论文属于计算机科学/人工智能领域的纯算法与实验型论文,传统生物医学的 Western Blot 图片造假在这里不适用。但“耿同学六式”的底层逻辑——对数据异常、文本矛盾、排版漏洞的审视,依然能精准打击AI与运筹学领域的典型灌水与造假套路。)
详细发现
发现 1:图片文本完全复制粘贴(一图多用/文本生成器失控)
- 位置:Figure 2 与 Figure 4(及其图注)
- 描述:通读文本可以发现,正文中的 Figure 2 和附录中的 Figure 4 的说明文字完全一致("Evolution of Dual-layer Self-evolutionary LLM Agent for online bin packing. We outline the key thoughts of the best heuristics produced in some generations during the evolution of. Additionally, we highlight the evolution of strategies...")。更离谱的是,OCR 提取出的图片内部文本(包括乱码
O?KNAO>>EJ...以及核心的公式、思想描述)在两幅图中一字不差,完全重复。 - 证据:在正常学术论文中,附录通常用于展示主文中实验的补充细节(如 TSP 或大规模 MILP 的进化过程)。直接把主文的图和图注原封不动地复制到附录中充当 Figure 4,这不仅暴露了作者极不严谨的排版态度,更高度怀疑作者在赶工拼凑论文时忘记了修改图源。
- 严重程度:🔴
发现 2:缺少统计支撑的“完美超越”(随机数生成器都不如)
- 位置:Table 2, Table 3, Table 4
- 描述:论文声称在极具挑战性的组合优化问题上(如 TSP, 大规模 MILP)“consistently outperforms”(始终全面超越)Gurobi, SCIP, GNN&GBDT 等一众 SOTA 基线。然而,在所有结果表格中,仅提供了一个孤立的均值(或单次运行结果),完全没有任何标准差、置信区间或显著性检验(如 p-value)。
- 证据:大语言模型(LLM)的生成具有高度的随机性(受 temperature 参数影响),基于 LLM 的启发式进化算法(尤其是进化 prompt)必然存在巨大的运行间方差。在没有多次独立运行实验(通常需要 5-10 次以上)和误差棒的情况下,宣称 0.42% 比 0.74% 更好,完全没有统计学意义。这在 AI 实验论文中是典型的“只挑最好结果写”的 Cherry-picking 行为。
- 严重程度:🟠
发现 3:LLM 生成的数学公式存在维度异常(统计学与逻辑异常)
- 位置:Appendix B.2.1, Equation (8)
- 描述:论文展示了 LLM 在第 12 代进化出的启发式打分公式。在公式 (8) 中,出现了这样的项:
+ (global best − scores) × 0.1。 - 证据:根据前文定义,
scores是一个 NumPy 数组(为多个 bin 打分),而global best从语义和常规编程逻辑来看应该是一个标量(全局最优值)。在一个矢量化计算公式中直接让标量减去数组,不仅有悖于常规数学表达,在代码层面也会引发严重的逻辑错误。这暴露了作者可能根本没有严格审查或运行 LLM 生成的代码,而是直接把 LLM 吐出来的文本塞进了论文里。 - 严重程度:🟠
发现 4:参数设定违背计算常识(方法学异常)
- 位置:Section 3.2 (ALNS) 与 Appendix C.2
- 描述:论文定义了邻域大小 \(k\) 的动态调整机制:\(k \leftarrow \min(k_{max}, k + \lceil u\% \cdot n \rceil)\),且设定每次迭代的时间限制为 200 秒。在 Appendix C.2 中,\(u\%\) 设定为 10,\(n\) 为决策变量总数。
- 证据:在大规模 MILP 问题中(如 SC2 或 MIKS2,变量规模 \(n=2,000,000\)),每次扩展邻域大小将直接增加 \(\lceil 0.1 \times 2,000,000 \rceil = 200,000\) 个变量。要求 Gurobi(作为子求解器)在 200 秒的时间限制内,随机重新优化包含 20 万甚至更多变量的子问题,这在算力上是极其荒谬的(通常会导致求解器连启发式预处理都跑不完就超时)。这说明作者所谓的“大规模实验”要么参数是胡编的,要么根本没有真实跑过如此规模的底层求解。
- 严重程度:🟠
耿同学辣评
“这篇论文生动演绎了什么叫‘套壳神的奇迹’。一边吹嘘自家双层 LLM 智能体能进化出多么牛的启发式算法,另一边连主图和附录图都懒得改直接 Ctrl+C 加 Ctrl+V,连图里的乱码都一模一样。让 AI 写代码、让 AI 写论文、让 AI 编公式,最后连人类该有的同行评审常识都没过,直接把标量减数组的离谱公式贴上来糊弄人。这哪是‘Large Neighborhood Search(大邻域搜索)’,这明明是‘Large Hallucination Search(大幻觉搜索)’!”
建议后续行动
- 在 PubPeer 或学术论坛上公开质询 Figure 2 和 Figure 4 重复的问题。
- 联系 ICML 2025 会议组委会,指出其在论文排版和图表引用上的严重失误,要求作者提供原始实验日志(含多次运行的方差和标准差)。
- 建议作者所在机构(清华大学)的学术委员会审查其实验数据的真实性,特别是针对百万级变量在 200 秒内求解的计算可行性。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。