Loading...
正在加载...
请稍候

Proximal Policy Optimization Algorithms

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:Proximal Policy Optimization Algorithms
  • 作者:John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov
  • 期刊:arXiv preprint (未见正式期刊发表信息,通常被视为预印本/技术报告)
  • DOI:未提供
  • 发表年份:2017 (基于参考文献最新时间为2017年推断)
  • 论文来源:Proximal policy optimization algorithms.pdf

综合评定:✅ 清白

详细发现

发现 1:第六式 - 方法学与逻辑一致性(算法描述与伪代码一致性)

  • 位置:Section 3 & Section 5 (Algorithm 1)
  • 描述:检查核心算法(PPO)的数学公式推导与伪代码实现是否一致。
  • 证据
    1. 论文提出的核心截断目标函数公式为 \(L^{CLIP}(\theta) = \hat{E}_t[\min(r_t(\theta)\hat{A}_t, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t)]\)
    2. Algorithm 1 伪代码中明确写了 "Optimize surrogate \(L\) wrt \(\theta\)",并提到了使用 Minibatch SGD/Adam 进行 \(K\) 个 epoch 的优化。
    3. 公式中的 \(r_t(\theta)\) 定义为新旧策略概率比 \(\frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)}\),这在背景介绍中已明确定义。
      结论:公式推导与代码逻辑高度自洽,没有出现“公式里写截断,代码里用惩罚”的低级矛盾。
  • 严重程度:✅ (无异常)

发现 2:第二式 - 数据造假检测(RL算法得分的“丑陋”特征)

  • 位置:Table 6 (Appendix B: Performance on More Atari Games)
  • 描述:检查 Atari 游戏得分是否过于“完美”或呈现人为编造的规律性。
  • 证据
    1. 检查表格中的数值:Alien 得分 1850.3,Atlantis 得分 2311815.0,Bowling 40.1,Boxing 94.6。
    2. 末位数字分布:包含 0, 3, 8, 9, 5, 6 等,没有明显的“整数偏好”或全为 0/5 的造假痕迹。
    3. 数值量级差异:不同游戏的得分跨度极大(从 Venture 的 0.0 到 Atlantis 的几百万),这符合不同 Atari 游戏奖励机制差异巨大的真实情况。造假者往往会使用类似量级的数据来填表。
    4. 方差特征:虽然作者未提供标准差(SD),但仅看均值,数据并不“整齐”。例如 PPO 在 Kangaroo (9928.7) 远超 A2C (45.3) 和 ACER (50.0),而在 Gopher (2932.9) 远低于 ACER (37802.3)。这种“偏科”现象是真实 RL 算法调参后的常见结果,如果是编造的数据,通常会全面碾压基线。
  • 严重程度:✅ (无异常,数据特征真实)

发现 3:第四式 - 统计学异常检测(胜场计数的逻辑验证)

  • 位置:Table 2 (Number of games "won" by each algorithm)
  • 描述:验证 Table 2 中算法“获胜”场次的加和是否与声称的游戏总数匹配。
  • 证据
    1. 论文声称测试了 49 个 Atari 游戏(Appendix B 开头提到)。
    2. 检查 Table 2 行 (1) "avg. episode reward over all of training":A2C (1) + ACER (18) + PPO (30) + Tie (0) = 49。
    3. 检查 Table 2 行 (2) "avg. episode reward over last 100 episodes":A2C (1) + ACER (28) + PPO (19) + Tie (1) = 49。
    4. 对比分析:注意 PPO 在“整个训练过程的平均奖励”上赢了 30 场,但在“最后 100 个 episode”只赢了 19 场。这意味着 PPO 学习速度快(前期得分高),但最终性能可能被 ACER 超越。作者没有为了让 PPO 看起来完美而只报告最优指标,而是诚实报告了这一权衡,这符合学术诚信。
  • 严重程度:✅ (逻辑自洽)

发现 4:第一式 & 第三式 - 图片复用与拼接检测(图表分析)

  • 位置:Figure 3, Figure 4, Figure 6 (Learning Curves)
  • 描述:分析图表是否存在线条复用或 PS 痕迹。
  • 证据:由于当前输入仅为文本提取内容,无法进行像素级(噪点、背景纹理)分析。但从数据规律看:
    1. 图表描述中包含 49 个子图(Figure 6),每条曲线对应不同的随机种子(three random seeds)。
    2. 文本中未发现 Figure Caption 与描述不符的情况。
    3. 这类 RL 论文的图表通常由绘图库(如 matplotlib)直接生成,极少出现照片类的拼接造假。
  • 严重程度:🟡 (文本信息不足,暂无异常,留待后续图像检测确认)

发现 5:第六式 - 时间线冲突检测

  • 位置:References
  • 描述:检查引用文献的时间逻辑。
  • 证据
    1. 论文引用了 Heess et al. [Hee+17] (arXiv:1707.02286),这是 2017 年 7 月的论文。
    2. 本篇 PPO 论文作为 2017 年的预印本,引用同期的并行工作是合理的。
    3. 使用的基准环境如 OpenAI Gym [Bro+16] (2016), MuJoCo [TET12] (2012) 均在论文发表前发布,无“穿越”嫌疑。
  • 严重程度:✅ (无异常)

耿同学辣评

这是一篇计算机科学(强化学习)领域的奠基性论文。虽然咱们“耿同学六式”平时主要对付生物医学里的“PS大师”,但在这种硬核算法论文面前同样适用。

看这篇论文的数据,就像看一个素颜的实力派演员——没有精修图,没有滤镜,全是硬核的“丑陋”数据。Table 6 里那些乱七八糟、跨度极大的得分(有的游戏几千分,有的游戏几分,甚至还有 0 分),这正是真实强化学习跑出来的德行!要是谁给我列个表格,所有游戏 PPO 都以极其完美的微弱优势(比如 \(p=0.049\))胜出,或者得分全是整数,那我早就把键盘拍他脸上了。

另外,作者诚实地列出了 PPO 赢 30 场(全程平均)却只赢 19 场(末期平均)的数据,这叫什么?这就叫自信。只有造假者才需要每一列数据都完美无瑕,真正的强者敢于展示自己算法的短板。

总结:代码可以跑不通,但这篇论文的数据大概率没动过手脚。建议生物医学界的同行们学学这种“丑陋但真实”的数据呈现方式。


建议后续行动

  • 无需联系作者提供原始数据(数据逻辑自洽,无造假嫌疑)
  • 无需在 PubPeer 上提出质疑
  • 代码已开源,建议通过复现实验来验证算法有效性,而非质疑数据真实性

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。