Loading...
正在加载...
请稍候

Transformer-Based Anomaly Detection in Deep Reinforcement Learning

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 论文来源:参考6.pdf (2025 International Conference on Intelligent Computing)
  • 标题:Transformer-Based Anomaly Detection in Deep Reinforcement Learning
  • 作者:Zhen Chen, Jian Zhao, Youpeng Zhao, Yong Liao, Hu Huang
  • 期刊/会议:2025 International Conference on Intelligent Computing (ICICC 2025)
  • 发表年份:2025 (会议时间:July 26-29, 2025)
  • 机构:中国科学技术大学,Polixir

综合评定:🟡 存疑 (建议作者进行勘误,部分数据存在明显的复制粘贴与计算错误)

详细发现

发现 1:数据逻辑自相矛盾 (表格间数据打架)

  • 位置:Table 1 vs Table 4 (Page 5 & Page 7)
  • 描述:对比论文中 Table 1 和 Table 4 的 Pong 环境在 PGD 攻击下的数据,存在无法自圆其说的数学矛盾。Table 4 中的数据计算是自洽的,但 Table 1 中的数据明显是复制了 Table 4 的成功率,却篡改或抄错了 Detection Failure 的数值。
  • 证据
    1. Table 1 声称:Attack Frequency = 298.5,Detection Failure = 0.1,Success Rate = 99.93。
      验算:1 - (0.1 / 298.5) = 1 - 0.000335 = 0.999665,即 99.97%。Table 1 中的 Success Rate 应该是 99.97%,而不是 99.93%。
    2. Table 4 (ε=0.004) 声称:Attack Frequency = 298.5,Detection Failure = 0.2,Success Rate = 99.93。
      验算:1 - (0.2 / 298.5) = 1 - 0.00067 = 0.99933,即 99.93%
      结论:两个表格中 Pong 的 Attack Frequency 完全一致(298.5),Table 4 的数学逻辑是完美的,但 Table 1 中作者把 Failure 错误地写成了 0.1(或者是从别处复制错了数据),却没有更新对应的 Success Rate。这种“表格抄自己还能抄错”的现象,是典型的数据人为挪用或粗制滥造的痕迹。
  • 严重程度:🟠 (核心数据不一致)

发现 2:统计学概念混淆 (把标准差当标准误报)

  • 位置:Table 1 & Table 2 (Page 5 & Page 6)
  • 描述:论文在表格标题中明确写道:“the standard errors in the bracket”(括号内为标准误,SE)。但在实际数据中,作者报告的极大概率是标准差(SD),甚至存在对统计学基本常识的误解。
  • 证据
    以 Table 1 中 Pong 环境为例,Mismatch 数值为 0.2 (0.6)。Mismatch 是次数,只能是非负整数。
    如果 0.6 是 10 次随机种子的标准误(SE),那么标准差 SD = SE * sqrt(10) = 0.6 * 3.16 = 1.89。对于均值为 0.2 的计数数据,方差不可能这么大(这意味着数据里有负数,这在物理上是不可能的)。
    如果 10 次实验中,有 2 次出现了 1 次失配,8 次是 0 次失配,那么均值是 0.2,标准差(SD)恰好是 0.6
    同理,Table 1 中的 0.1 (0.3),也完美符合“10次实验中只有1次出现1次失败”的**标准差(SD)**特征。作者把标准差算出来塞进了标注为“标准误(SE)”的括号里,属于统计描述翻车。
  • 严重程度:🟡 (统计学素养不足,但不影响核心结论)

发现 3:实验数据过于“整齐划一”的巧合

  • 位置:Table 1 & Table 4 (Page 5 & Page 7)
  • 描述:对比 Table 1 和 Table 4 中的 Freeway 和 Road Runner 环境。不仅 Attack Frequency 的均值在小数点后完全一致(如 Freeway 的 169.2,Road Runner 的 290.2),连 Detection Failure 的均值和方差也达到了惊人的一致。
  • 证据
    • Freeway PGD:Table 1 报告 169.2 (13.7) / 0.3 (0.6),Table 4 同样是 169.2 / 0.3
    • Road Runner PGD:Table 1 报告 290.2 (42.0) / 1.6 (1.0),Table 4 同样是 290.2 / 1.6
      如果 Table 1 和 Table 4 是分别独立运行的 10 个随机种子,均值连小数点后一位都完全相等的概率极低。这强烈暗示作者在写论文时,直接将同一次实验的结果复制粘贴到了不同的表格中。
  • 严重程度:🟡 (写论文敷衍,copy-paste 痕迹明显)

发现 4:文本复用与低级排版错误

  • 位置:Section 2.1 (Page 2)
  • 描述:在“Observation-based attacks”的描述中,出现了明显的复制粘贴后忘记删除原句的语病。
  • 证据:原文写道:“Observation-based attacks involve adding perturbations to the sensory input of agent, typically images, typically images, leading the victim agent...” 短短一句话中,“typically images”重复了两次。这虽然不是数据造假,但反映了论文在撰写和审稿过程中极其粗糙的态度。
  • 严重程度:🟡

耿同学辣评

数据算得比嘴还快,表格抄自己还能抄错小数点!Table 1 里写着 Failure 是 0.1,算出来的 Success Rate 却用了 0.2 的结果(99.93%),完美做到了“既要又要”,结果在 Table 4 里露了马脚。连统计学的标准差和标准误都分不清就敢往上写,还把“typically images”像复读机一样粘了两次。建议这位同学在搞 Transformer 之前,先回炉重造一下小学的四则混合运算和 Ctrl+C/V 的手速!

建议后续行动

  • 仔细核对原始实验日志,确认 Table 1 和 Table 4 到底跑了几次。
  • 联系作者要求提供原始数据,并询问为什么 0.1 的失败率能算出 99.93% 的成功率。
  • 在 PubPeer 上提出质疑(促使其进行勘误)。
  • 暂不向期刊编辑部举报(目前证据偏向于写论文时的粗心大意与复制粘贴,未见系统性捏造核心理论的实锤,建议先要求作者回应)。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。