Loading...
正在加载...
请稍候

Deep Learning with Quantitative Features of Magnetic Resonance Images to Predict Biochemical Recurrence of Radical Prostatectomy: A Multi-Center Study

2026-07-27 12:41
# 🔍 耿同学打假报告

## 论文信息
- 标题:Deep Learning with Quantitative Features of Magnetic Resonance Images to Predict Biochemical Recurrence of Radical Prostatectomy: A Multi-Center Study
- 作者:Ye Yan, Lizhi Shao, Zhenyu Liu, et al.
- 期刊:Cancers
- DOI:10.3390/cancers13123098
- 发表年份:2021
- 论文来源:Deep Learning with Quantitative Features of Magnetic.pdf

## 综合评定:🟠 高度可疑

## 详细发现

### 发现 1:方法学异常与内部数据矛盾(样本量薛定谔)
- **位置**:Table 2 / 正文 3.1 节 / Table 1
- **描述**:论文的核心队列样本量在不同位置出现了无法自洽的矛盾。正文和 Table 1 明确交代主队列(PC)共纳入 368 例患者,但在展示核心模型性能的 Table 2 中,主队列的样本量突然变成了 369 例。
- **证据**:正文表述为“the primary cohort (PC: n = 368...)”;Table 1 表头标明“PC (PUTH) n= 368”;而 Table 2 表头却赫然写着“PC (n = 369)”。在严格的生存分析建模中,多出或漏掉一个样本都会导致数据不对版,这属于低级但致命的方法学内部矛盾。
- **严重程度**:🟠
- **复核状态**:✅ 成立

### 发现 2:统计学异常(双生姐妹花数据与离谱小数)
- **位置**:Table 2
- **描述**:两个完全独立的验证集(VC1 和 VC2)在同一个传统临床模型(CAPRA-S)上的 C-index 竟然完全一致;同时另一模型的 HR 值出现了极不合理的小数位数。
- **证据**:Table 2 中,VC1 (n=34) 的 CAPRA-S C-index 为 0.654 [0.49–0.818],VC2 (n=83) 的 CAPRA-S C-index 也是 0.654 [0.544–0.764]。在不同样本量、不同中心的人群中算出精确到小数点后三位完全一致的数值,概率极低。此外,NCCN 模型的 HR 值被标为“1.9022”,在常规临床统计表中保留四位小数且以“2”结尾,高度疑似手误篡改或编造数据时的笔误。
- **严重程度**:🟠
- **复核状态**:✅ 成立

### 发现 3:方法学异常(复制粘贴留下的幽灵标题)
- **位置**:Table 2
- **描述**:Table 2 的标题与表格内容发生严重脱节,出现了典型的“套模板”遗留痕迹。
- **证据**:Table 2 的标题写的是“Table 2. Patient characteristics.”(患者临床特征),但表格的实际内容却是各种临床模型和深度学习模型的 HR 值、p 值和 C-index 性能对比。这说明作者极大概率是从另一篇论文或前序草稿中复制了表格框架,却忘记修改标题。结合前述的数据不一致,反映出数据处理过程的极不严谨。
- **严重程度**:🟡
- **复核状态**:✅ 成立

### 发现 4:统计学异常(心电图一样的决策曲线)
- **位置**:Figure 2 (g-i)
- **描述**:模型在验证集中的决策曲线分析(DCA)呈现出极不自然的剧烈高频震荡。
- **证据**:结合论文图片视觉分析及图注(Figure 2: Clinical benefits by decision curve analysis for 3-year BCR),Primary cohort(主队列,n=368)的 DCA 曲线相对平滑,但在样本量较小的 VC1 (n=34) 和 VC2 (n=83) 中,代表 DRS-BCR 模型的曲线呈现极其锯齿状的上下剧烈波动。这种视觉上“过于嘈杂”的曲线说明模型在极小样本上发生了严重的过拟合,或数据处理存在异常值未被清洗。
- **严重程度**:🟠
- **复核状态**:✅ 成立

## 耿同学辣评

主队列样本量一会儿368一会儿369,Table 2连标题都能从“患者特征”糊弄成“Cox回归结果”,再加上NCCN那个独树一帜的HR=1.9022和两个不同验证集里心有灵犀的0.654 C-index……同学们,这哪里是“Deep Learning”,这明明是“Deep Copy & Paste”啊!再看验证集那两条心电图一样疯狂跳动的决策曲线,模型预测的时候作者的心电图是不是也跟着一起过拟合了?

## 建议后续行动

- [x] 联系作者要求提供原始数据(尤其是 VC1 和 VC2 的 C-index 计算过程)
- [x] 在 PubPeer 上提出质疑
- [ ] 向期刊编辑部举报
- [ ] 向作者所在机构学术委员会举报

## ⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。