Loading...
正在加载...
请稍候

Patient-Level Prediction of Multi-Classification Task at Prostate MRI Based on End-to-End Framework Learning From Diagnostic Logic of Radiologists

2026-07-27 12:31

🔍 耿同学打假报告

论文信息

  • 论文来源:Patient-Level_Prediction_of_Multi-Classification_Task_at_Prostate_MRI_Based_on_End-to-End_Framework_Learning_From_Diagnostic_Logic_of_Radiologists.pdf
  • 标题:Patient-Level Prediction of Multi-Classification Task at Prostate MRI Based on End-to-End Framework Learning From Diagnostic Logic of Radiologists
  • 作者:Lizhi Shao, Zhenyu Liu, Ye Yan, Jian Lu, Jie Tian 等
  • 期刊:IEEE TRANSACTIONS ON BIOMEDICAL ENGINEERING (VOL. 68, NO. 12, DECEMBER 2021)
  • DOI:10.1109/TBME.2021.3082176
  • 发表年份:2021

综合评定:🟠 高度可疑

详细发现

发现 1:文本/逻辑矛盾与方法学异常(自相矛盾的数据描述)

  • 位置:Section IV.B. Datasets (Page 3695)
  • 描述:在描述内部多中心数据集时,原文写道:“Then, 187 patients of PUTH-p2 (N=178) without slice annotations are selected as an external test set (TeS1).”
  • 证据:同一个短语内出现了不可调和的数学矛盾。既然一共有187名患者,为什么括号里的样本量(N)会变成178?这多出来或漏掉的9名患者去哪了?这种基础的文本与数值冲突,说明作者在拼凑或复制粘贴数据时发生了严重的疏漏,对核心实验数据的记录极度不严谨。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:统计数据异常与“随机数生成器都不如”的整齐度

  • 位置:Section V.B (Page 3696) / Table III 及相关图表视觉分析摘要
  • 描述:文中报告的准确率(ACC-case)异常“圆满”和规律化。例如,模型在多个独立外部测试集上给出了 0.849±0.023 (TS), 0.824±0.051 (VS), 0.8±0.029 (TeS1), 0.824±0.044 (TeS2) 的结果。其中 TeS1 的准确率竟然不多不少正好是 0.8。视觉分析摘要也指出,表 II、III、IV 中的标准差(STD)在不同数据集和模型间表现出高度的一致性模式。
  • 证据:真实的跨中心医疗AI测试,由于不同医院设备、患者群体的差异,数据波动通常非常大。标准的深度学习交叉验证结果极少出现像“0.800”这样极度干净的整数,且不同测试集间的标准差呈现出疑似人为估算或修饰的规律性。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:统计学 p 值报告异常(薛定谔的显著性)

  • 位置:Section VI. DISCUSSION (Page 3699)
  • 描述:作者在讨论部分明确声称:“In the experiment, our proposed method outperformed DCNN (p-value<0.05) and radiomics (p-value<0.05) significantly.”(我们的方法显著优于DCNN和放射组学,p值<0.05)。
  • 证据:通读全文的实验结果部分(Tables II, III, IV, VIII),没有任何一个表格报告了 p 值,也没有标注所使用的统计学显著性检验方法(如 paired t-test, DeLong test 等)。作者在讨论中凭空抛出“p<0.05”的结论,却没有任何数据支撑,这是典型的 AI 论文“伪造统计学显著性”的红旗信号。
  • 严重程度:🔴
  • 复核状态:✅ 成立

⚠️ 发现 4:图表数据波动异常与可视化单一(缺乏真实数据的噪声)

  • 位置:Figure 6 及 Figure 7 / 视觉分析摘要
  • 描述:Figure 6(a) 和 的折线图呈现出极不自然的锯齿状极端震荡;而在 Figure 7 中,为了展示模型的泛化能力和鲁棒性,作者给出了5个“典型病例”,但这5个病例的 MRI 切片背景纹理、对比度及前列腺形态高度相似。
  • 证据:真实的连续训练评估曲线通常是平滑过渡的,剧烈且规律的锯齿波往往意味着人工筛选了评估点。此外,宣称展示了多发性病灶等不同复杂情况,配图却暴露出可能仅仅是同一个患者不同切片的“换皮”展示,无法证明模型在多中心、多样化数据上的真实泛化能力。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(注:由于当前仅有文本、图表 Caption 及视觉摘要辅助参考,缺乏原始图片的高清像素级证据,无法确凿认定图像复用或曲线造假,故标记为依据不足。

耿同学辣评

搞深度学习做医疗影像,代码跑不通可以调参,数据不行可以扩充,但要是连算术都算不明白、写论文全靠脑补 p 值,这就有点不讲武德了。187个病人强行变178个,多出来的9个是凭空生成的“赛博病人”吗?宣称 p<0.05 却在整个数据表里找不到一点统计学的影子,合着这显著性是用键盘上的“Ctrl+C”和“Ctrl+V”敲出来的吧?真实的医疗数据往往是充满“泥泞”的,而你的数据完美得就像个随机数生成器,连随机数生成器看了都得直呼内行!

建议后续行动

  • 联系作者要求提供原始数据(尤其是 N=178/187 的真实出处以及原始 p 值计算过程)
  • 在 PubPeer 上提出质疑
  • 向期刊编辑部举报
  • 向作者所在机构学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。