Transformer-Based Anomaly Detection in Deep Reinforcement Learning
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:参考6.pdf (2025 International Conference on Intelligent Computing)
- 标题:Transformer-Based Anomaly Detection in Deep Reinforcement Learning
- 作者:Zhen Chen, Jian Zhao, Youpeng Zhao, Yong Liao, Hu Huang
- 期刊/会议:2025 International Conference on Intelligent Computing (ICICC 2025)
- 发表年份:2025 (会议时间:July 26-29, 2025)
- 机构:中国科学技术大学,Polixir
综合评定:🟡 存疑 (建议作者进行勘误,部分数据存在明显的复制粘贴与计算错误)
详细发现
发现 1:数据逻辑自相矛盾 (表格间数据打架)
- 位置:Table 1 vs Table 4 (Page 5 & Page 7)
- 描述:对比论文中 Table 1 和 Table 4 的 Pong 环境在 PGD 攻击下的数据,存在无法自圆其说的数学矛盾。Table 4 中的数据计算是自洽的,但 Table 1 中的数据明显是复制了 Table 4 的成功率,却篡改或抄错了 Detection Failure 的数值。
- 证据:
- Table 1 声称:Attack Frequency = 298.5,Detection Failure = 0.1,Success Rate = 99.93。
验算:1 - (0.1 / 298.5) = 1 - 0.000335 = 0.999665,即 99.97%。Table 1 中的 Success Rate 应该是 99.97%,而不是 99.93%。 - Table 4 (ε=0.004) 声称:Attack Frequency = 298.5,Detection Failure = 0.2,Success Rate = 99.93。
验算:1 - (0.2 / 298.5) = 1 - 0.00067 = 0.99933,即 99.93%。
结论:两个表格中 Pong 的 Attack Frequency 完全一致(298.5),Table 4 的数学逻辑是完美的,但 Table 1 中作者把 Failure 错误地写成了 0.1(或者是从别处复制错了数据),却没有更新对应的 Success Rate。这种“表格抄自己还能抄错”的现象,是典型的数据人为挪用或粗制滥造的痕迹。
- Table 1 声称:Attack Frequency = 298.5,Detection Failure = 0.1,Success Rate = 99.93。
- 严重程度:🟠 (核心数据不一致)
发现 2:统计学概念混淆 (把标准差当标准误报)
- 位置:Table 1 & Table 2 (Page 5 & Page 6)
- 描述:论文在表格标题中明确写道:“the standard errors in the bracket”(括号内为标准误,SE)。但在实际数据中,作者报告的极大概率是标准差(SD),甚至存在对统计学基本常识的误解。
- 证据:
以 Table 1 中 Pong 环境为例,Mismatch 数值为0.2 (0.6)。Mismatch 是次数,只能是非负整数。
如果 0.6 是 10 次随机种子的标准误(SE),那么标准差 SD = SE * sqrt(10) = 0.6 * 3.16 = 1.89。对于均值为 0.2 的计数数据,方差不可能这么大(这意味着数据里有负数,这在物理上是不可能的)。
如果 10 次实验中,有 2 次出现了 1 次失配,8 次是 0 次失配,那么均值是 0.2,标准差(SD)恰好是 0.6。
同理,Table 1 中的0.1 (0.3),也完美符合“10次实验中只有1次出现1次失败”的**标准差(SD)**特征。作者把标准差算出来塞进了标注为“标准误(SE)”的括号里,属于统计描述翻车。 - 严重程度:🟡 (统计学素养不足,但不影响核心结论)
发现 3:实验数据过于“整齐划一”的巧合
- 位置:Table 1 & Table 4 (Page 5 & Page 7)
- 描述:对比 Table 1 和 Table 4 中的 Freeway 和 Road Runner 环境。不仅 Attack Frequency 的均值在小数点后完全一致(如 Freeway 的 169.2,Road Runner 的 290.2),连 Detection Failure 的均值和方差也达到了惊人的一致。
- 证据:
- Freeway PGD:Table 1 报告
169.2 (13.7) / 0.3 (0.6),Table 4 同样是169.2 / 0.3。 - Road Runner PGD:Table 1 报告
290.2 (42.0) / 1.6 (1.0),Table 4 同样是290.2 / 1.6。
如果 Table 1 和 Table 4 是分别独立运行的 10 个随机种子,均值连小数点后一位都完全相等的概率极低。这强烈暗示作者在写论文时,直接将同一次实验的结果复制粘贴到了不同的表格中。
- Freeway PGD:Table 1 报告
- 严重程度:🟡 (写论文敷衍,copy-paste 痕迹明显)
发现 4:文本复用与低级排版错误
- 位置:Section 2.1 (Page 2)
- 描述:在“Observation-based attacks”的描述中,出现了明显的复制粘贴后忘记删除原句的语病。
- 证据:原文写道:“Observation-based attacks involve adding perturbations to the sensory input of agent, typically images, typically images, leading the victim agent...” 短短一句话中,“typically images”重复了两次。这虽然不是数据造假,但反映了论文在撰写和审稿过程中极其粗糙的态度。
- 严重程度:🟡
耿同学辣评
数据算得比嘴还快,表格抄自己还能抄错小数点!Table 1 里写着 Failure 是 0.1,算出来的 Success Rate 却用了 0.2 的结果(99.93%),完美做到了“既要又要”,结果在 Table 4 里露了马脚。连统计学的标准差和标准误都分不清就敢往上写,还把“typically images”像复读机一样粘了两次。建议这位同学在搞 Transformer 之前,先回炉重造一下小学的四则混合运算和 Ctrl+C/V 的手速!
建议后续行动
- 仔细核对原始实验日志,确认 Table 1 和 Table 4 到底跑了几次。
- 联系作者要求提供原始数据,并询问为什么 0.1 的失败率能算出 99.93% 的成功率。
- 在 PubPeer 上提出质疑(促使其进行勘误)。
- 暂不向期刊编辑部举报(目前证据偏向于写论文时的粗心大意与复制粘贴,未见系统性捏造核心理论的实锤,建议先要求作者回应)。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。