Loading...
正在加载...
请稍候

NaviTreat: A Reinforcement Learning Framework with Urate Crystal Pool Dynamics for Gout Treatment Pathway Optimization

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:NaviTreat: A Reinforcement Learning Framework with Urate Crystal Pool Dynamics for Gout Treatment Pathway Optimization
  • 作者:Ruilei Wang, Ruiming Shen, Fengyao He, Shuai Zhao, Nansheng Zheng
  • 期刊:ChinaXiv preprint (非同行评审预印本)
  • DOI:ChinaXiv:202607.00093v1
  • 发表年份:2026

综合评定:🔴 实锤

详细发现

发现 1:统计学奇迹——不同算法跑出了小数点后完全一致的结果

  • 位置:Table 6, Table 7 / Page 10-11
  • 描述:在 N=50 和 N=8/15 的小样本队列评估中,三种截然不同的策略(Guideline Doctor 规则集、BC 模仿学习、PPO 强化学习)竟然生成了均值和标准差精确到小数点后一位都完全相同的数据。
  • 证据
    • Table 7 中,Recurrent Flare 亚组(N=15):Doctor (93.3 ± 0.3), BC (93.3 ± 0.3), PPO (93.3 ± 0.3)。
    • Chronic Tophaceous 亚组(N=8):Doctor (50.0 ± 0.5), BC (50.0 ± 0.5), PPO (50.0 ± 0.5)。
    • 不同数学模型的独立输出在多次随机模拟中不仅均值完全一致,连方差也做到了一模一样。这违背了基本的概率统计原理,在真实的计算机模拟中几乎不可能发生,高度怀疑是直接复制粘贴了同一组数据。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:随机数生成器都不如——离谱的小样本方差

  • 位置:Table 7 / Page 11
  • 描述:作者声称进行了 10 次独立评估运行(seeds 42-51),并报告了标准差(SD)。但在极小的样本量下,数据呈现出不可能的精确度。
  • 证据
    • 以 Chronic Tophaceous 亚组为例(N=8),命中率的可能离散值只能是 12.5% 的整数倍(如 37.5%, 50.0%, 62.5%)。要在 10 次独立运行中得到精确为 50.0% 的均值和 0.5 的标准差,在数学上需要极其特定的序列,且如果是恒定输出,标准差应为 0。
    • 另外解释一下小数位问题,Guideline Doctor 是基于规则的确定性算法,为什么在 Acute Flare 组没有标准差,而在其他组却出现了 0.3、0.5 这种不可思议的波动?数据捏造痕迹明显。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:消融实验自相矛盾,核心创新成负优化

  • 位置:Table 8 / Page 12
  • 描述:作者声称提出了一个 "8-component weighted multi-objective reward function"(8组分加权多目标奖励函数),并且强调 Progress(进度奖励)是占 60% 权重的主导项。但消融实验的结果直接打脸。
  • 证据
    • Full model 的 Target Rate 是 86.0%,Mean Reward 是 148.3。
    • 去掉主导的 Progress reward 后,Target Rate 居然依然是 86.0%,Mean Reward 仅仅微降到 145.4(主导项去掉了,总奖励几乎没变?)。
    • 更可笑的是,去掉了 "All aux. rewards"(所有辅助奖励,只留主项),Target Rate 还是 86.0% 不变,而 Mean Reward 竟然升高到了 155.0!
    • 这说明作者煞费苦心设计的辅助奖励组件不仅毫无作用,反而是在"负优化"拖累模型,但论文却将其列为核心贡献(Contribution 2)。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 4:训练曲线完美得像个笑话

  • 位置:Figure 4(B) / Page 10
  • 描述:视觉分析摘要指出,PPO 微调的 Mean reward 曲线在 3000 episodes 的训练过程中呈现出一条极为平滑、单调上升的曲线。
  • 证据:真实强化学习(RL)的训练曲线由于探索-利用的权衡,不可避免地会伴随剧烈的震荡和毛刺。像这种"教科书级别"的完美平滑曲线,大概率是数据经过了人为的过度平滑处理,或者是直接用函数画出来的示意图,而非真实的日志数据。
  • 严重程度:🟠
  • 复核状态:✅ 成立

⚠️ 发现 5:引用与依赖的时间线冲突

  • 位置:Section 4 / Page 9
  • 描述:作者在文中声明使用的软件版本为 "Python 3.11, Gymnasium 1.0.0, PyTorch 2.6.0"。
  • 证据:截至 2026 年 7 月,PyTorch 的版本号确实有可能更新到 2.6.x。但 Gymnasium(Farama 基金会维护)目前的版本还在 0.x 阶段(如 0.29),如果要在 2026 年中旬直接跃升并使用 1.0.0 正式版,存在时间上的突兀感(由于是预印本,存在未来版本的可能,但结合其他实锤造假的数据,这一处版本号显得极有可能是随手瞎编的)。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足

耿同学辣评

这篇预印本堪称一场"算法魔术表演"。三种完全不同的算法(规则、模仿学习、强化学习)不仅学得一模一样,甚至连随机数生成器都长了同一个脑子,跑出来的均值和方差精确到了小数点后完全重合!最讽刺的是,作者大吹特吹的"8组分核心奖励函数",被自己的消融实验实锤为"全靠同行衬托",去掉一半奖励模型表现反而更好。把假数据做得这么敷衍,连 Excel 往下拉 filler 都比你这有诚意!

建议后续行动

  • 联系作者要求提供原始数据(鉴于已开源代码,建议直接审查其 statistical_tests.json 看看数据是怎么生成的)
  • 在 PubPeer 上提出质疑
  • 向 ChinaXiv 平台举报,要求撤稿或打上"数据异常"标签
  • 向作者所在机构学术委员会举报(考虑到这是未受同行评审的预印本,建议优先施压平台和作者自查)

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。