Loading...
正在加载...
请稍候

Gymnasium: A Standardized Interface for Reinforcement Learning Environments

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:Gymnasium: A Standardized Interface for Reinforcement Learning Environments
  • 作者:Mark Towers, Ariel Kwiatkowski, Jordan Terry, John U. Balis 等
  • 期刊/会议:39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks
  • DOI:文本中未提供
  • 发表年份:2025
  • 论文来源:d7ff1795e8527f6443371c3933bdb52b-Paper-Datasets_and_Benchmarks.pdf

综合评定:✅ 清白

详细发现

发现 1:代码片段与排版异常(文本提取/复制粘贴痕迹)

  • 位置:Section 3 Library Structure (Page 4)
  • 描述:在“Environment”核心抽象部分提供的 Python 示例代码存在严重的语法缺失和排版混乱。例如:import 语句后缺失库名;env.make 前面缺失赋值对象(应为 env = gymnasium.make);for(1000): 不符合 Python 语法规范;observation, info.reset(seed=42) 以及 observation, reward, terminated, truncated, info.step(action) 将变量名与方法混为一谈。同时,正文多处出现单词粘连现象,如 ScalingEnvsFuncEnvwasTheEnvclass 等。
  • 证据:论文原文确实存在上述文本内容。这在严谨的计算机系统描述论文中是不合格的,但由于这是一篇开源系统介绍论文,且本报告基于纯文本提取分析,这极大概率是 PDF 文本提取时的排版丢失(或作者在 Word/LaTeX 排版时未正确闭合行内代码格式),而非恶意的学术造假。
  • 严重程度:🟡(属于排版/文本提取的技术瑕疵,非主观造假)
  • 复核状态:✅ 成立

发现 2:数据与时间线的自洽性验证

  • 位置:Abstract & Introduction (Page 1-2)
  • 描述:对文中的宏观数据与时间线进行了交叉验证。文中声称 Gymnasium 自 2023 年 11 月发布至 2025 年 5 月下载量超过 1800 万次,且仅在 2025 年 4 月就有超过 100 万次下载。作者还特别指出 M3 MacBook Pro(128GB RAM)被用于图 3 的性能测试。
  • 证据:原文明确记载“over 18 million downloads since its initial release in November 2023 to May 2025”、“over a million downloads in April 2025”以及“M3 MacBook Pro with 128 GB of RAM”。根据设定的当前日期(2026年6月),论文发表于 NeurIPS 2025。2023 年底发布至 2025 年中达到 1800 万次下载,在 Python 强化学习生态中是非常合理的(OpenAI Gym 具有极高的历史地位)。M3 MacBook Pro 于 2023 年底上市,在 2025 年的论文中使用该设备进行基准测试在时间逻辑上完全自洽,没有出现“时间穿越”(使用未上市设备)的造假情况。
  • 严重程度:✅(逻辑自洽,无异常)
  • 复核状态:✅ 成立

发现 3:统计学与实验设计异常检测

  • 位置:Figure 3 / Page 8 / NeurIPS Checklist (Page 15)
  • 描述:检测了实验数据的统计学维度。文中声明图 3 具有 error bars(误差条),并比较了 SyncVectorEnv 和 AsyncVectorEnv 在不同硬件下的性能表现。
  • 证据:原文确实在 NeurIPS Checklist 第 7 条指出“Yes, Figure 3 has error bars”,并在 Figure 3 caption 中描述了对比结果。本论文是一篇开源 API/工具库介绍型论文,通篇没有涉及生物医学或传统湿实验中的 Western blot、凝胶电泳图、p-value 矩阵或剂量反应曲线。文章的逻辑推导(如 Termination 和 Truncation 的理论区分)严密且符合强化学习的数学常识。
  • 严重程度:✅(未发现统计学造假红旗)
  • 复核状态:✅ 成立

耿同学辣评

咱们打假打了这么多年,什么离谱的 PS 拼接图、复制粘贴的 Western blot 都见过。但今天这篇文章一出来,我直接乐了——这是一篇纯正的计算机强化学习 API 介绍论文,通篇没有一只老鼠、没有一张电泳图,也没有像教科书一样完美的 p<0.05 造假数据表。作者们就是老老实实在讲他们怎么重写、维护了 OpenAI Gym 的接棒项目(Gymnasium)。虽然第 4 页的示例代码排版烂得像被哈士奇啃过一样(大概率是文本提取的锅),但在时间线、数据规模、硬件迭代(M3芯片)的逻辑上,可以说是严丝合缝。计算机方向的文章往往侧重系统设计和代码实现,造假成本极高且极易被开源社区戳穿。想在这类文章里找学术不端?咱们还是放人家一马,把精力留给那些“一图多用电竞选手”吧!

建议后续行动

  • 无需联系作者要求提供原始数据(不涉及数据造假)。
  • 无需在 PubPeer 上提出质疑。
  • (可选)如果你认识作者,可以好心提醒他们检查一下 PDF 第 4 页的代码块排版是否在官方正式版中存在同样的问题。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。