Loading...
正在加载...
请稍候

Smart “Predict, then Optimize”

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 论文来源:1710.08005v5.pdf
  • 标题:Smart “Predict, then Optimize”
  • 作者:Adam N. Elmachtoub (Columbia University), Paul Grigas (University of California, Berkeley)
  • 期刊:预印本 (arXiv:1710.08005v5 [math.OC]),后正式发表于 Management Science 等顶级期刊(在此仅针对提供的文本进行评估)
  • DOI/编号:arXiv:1710.08005v5
  • 发表年份:2020 (v5 更新于 19 Nov 2020)

综合评定:✅ 清白

详细发现

由于本文是一篇纯理论算法与运筹学领域的论文,主要以数学公式推导、定理证明以及合成数据仿真实验为主。因此,“耿同学六式”中针对生物医学论文的图片造假(PS痕迹)、抗体造假、 Wetern Blot 条带复用等检测维度并不完全适用。但本报告依然秉持严谨的态度,基于六式核心逻辑(数据生成逻辑、时间线、方法学一致性等)进行了全面扫描。

发现 1:图片复用与拼接检测(第一式 & 第三式)

  • 位置:Figure 1, Figure 2, Figure 3, Figure 4, Figure 5
  • 描述:论文中出现的图片均为几何图解、散点拟合图以及合成数据的箱线图。
  • 证据:文本中未提供足够的原始像素信息供分析,但从图注的逻辑来看:Figure 1 展示了多边形和椭圆形可行域,Figure 2 展示了预测与决策残差的对比,Figure 4 和 Figure 5 则是不同算法在多种参数下的 box plot。由于是代码生成的数学图形,不存在“Western blot 泳道拼接”或“显微镜图片翻转”的动机与痕迹。
  • 严重程度:🟢 无异常

发现 2:数据造假与统计学异常检测(第二式 & 第四式)

  • 位置:Section 6 (Computational Experiments) 与 Appendix D
  • 描述:实验数据为明确的“合成数据”。作者设计了严格的数学模型来生成数据,这在算法评估中是标准做法。
  • 证据
    1. 实验设计严谨:作者明确给出了数据生成的多项式公式(包含 degree 参数 deg 和噪声参数),且每次实验运行 50 次独立模拟("we run 50 simulations, each of which has a different \(B^*\)"),这符合机器学习评估的严谨规范,排除了“单次实验中彩票”的嫌疑。
    2. 结果符合真实客观规律:在 Figure 4 的结果描述中,作者诚实地承认在样本量较小(n=100)或模型没有误设(deg=1)时,最传统的 Least Squares(最小二乘法)表现最好,SPO+ 可能会过拟合。真实的科研往往是不完美的,作者没有刻意掩饰自己提出的方法在特定情况下的劣势,这种“自爆其短”的写法具有极高的可信度。
    3. 统计学方面未呈现不可能的完美表格或 p-hacking 现象。
  • 严重程度:🟢 无异常

发现 3:时间线与引用方法学异常检测(第五式 & 第六式)

  • 位置:全文及参考文献
  • 描述:基于当前日期(2026-06-17)审查其(2020年 v5版本)的引用和方法学逻辑。
  • 证据
    1. 时间线合理性:论文第一版提交于 2017 年 10 月,v5 更新于 2020 年 11 月。文中提到了使用 JuMP package in Julia (Dunning et al. (2017))Gurobi solver。这些工具在 2017-2020 年期间已是运筹学领域的标准主流工具,不存在“使用未来版本工具”的穿越情况。
    2. 内部逻辑一致性:正文提出的 SPO+ 损失函数公式在 Proposition 1-8 与 Theorem 1 中进行了层层推导。在 Appendix B 中给出了详尽的数学证明。文本中方法学描述前后一致(如 \(n \in \{100, 1000, 5000\}\),测试集大小 10,000),未出现前后矛盾或变量缺失。
    3. 后续影响:根据学术常识,SPO (Smart Predict, then Optimize) 框架是“决策智能/运筹机器学习”交叉领域的标志性论文之一,被后续大量顶会/顶刊文章引用,其学术声誉良好。
  • 严重程度:🟢 无异常

耿同学辣评

各位同学,今天咱们看了一篇让“图片打假达人”无从下手的纯数学与算法硬核论文。咱们就是说,这篇论文全是骨头没有肉——没有蛋白印迹,没有细胞荧光,只有冷冰冰的公式和代码。作者连做实验用的数据都是自己老老实实写公式生成的,跑出了几十万行数据,还非常坦诚地承认“我的算法在某些情况下确实不如最基础的线性回归”。这种坦诚,简直让看惯了学术造假套路的耿同学感动得想落泪。做理论算法的这帮人,确实只能靠硬实力说话,Photoshop 在这里毫无用武之地!

建议后续行动

  • 无需联系作者提供原始数据(因为数据生成代码和数学推导已完全公开)
  • 无需在 PubPeer 提出质疑
  • 放心引用,这是一篇经得起推敲的高质量基线论文

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。