Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊:预印本
  • DOI:无 (arXiv: 2308.12604v2)
  • 发表年份:2023
  • 论文来源:2308.12604v2.pdf

综合评定:🔴 实锤

详细发现

发现 1:核心评价指标存在严重数学不自洽(数据造假/拼凑痕迹)

  • 位置:Table 1 (MIMIC 数据集结果), Table 2 (消融实验), Appendix Table 2 (宏平均结果)
  • 描述:在以 F1-score(F1值)作为核心评价指标的表格中,报告的 Precision (精确率, P)、Recall (召回率, R) 和 F1 之间存在大面积、系统性的数学矛盾。根据数学定义,微观/宏观 F1 值必须满足 \(F1 = \frac{2 \times P \times R}{P + R}\),但本文数据完全无视该公式。
  • 证据
    1. Table 1 (MIMIC) - Ours (本文模型):报告 P=0.501, R=0.509, F1=0.476。代入公式计算实际 F1 应为 \(\frac{2 \times 0.501 \times 0.509}{0.501 + 0.509} = 0.5049\)。报告值(0.476)与理论值(0.505)严重不符!
    2. Table 1 (MIMIC) - RGRG (对比模型):报告 P=0.461, R=0.475, F1=0.447。理论计算值应为 \(\frac{2 \times 0.461 \times 0.475}{0.461 + 0.475} = 0.4678\)。误差极大。
    3. Table 2 (消融实验) - 完整模型:同样出现了 P=0.501, R=0.509, F1=0.476 的组合。如果 F1 真是 0.476,在 P=0.501 的情况下,R 竟然需要达到 0.453 才能成立,与报告的 0.509 差之千里。
    4. Appendix Table 2 - Ours w/ SDL:宏平均下报告 P=0.396, R=0.393, F1=0.381。理论计算值应为 0.394。无论怎么算都对不上。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:对照组数据出现“薛定谔的 F1”计算标准

  • 位置:Table 1 (MIMIC 数据集)
  • 描述:在一篇论文的同一张表格中,部分对照组的数据严格遵循 \(F1 = 2PR/(P+R)\) 的数学规律,而大部分核心数据(包括作者自己提出的模型)却违背该规律,暴露出极度可疑的“手工微调”或“复制粘贴”痕迹。
  • 证据
    我们来看看 MIMIC 表现最差的一个 baseline:
    M2TR (2021):报告 P=0.240, R=0.428, F1=0.308。
    理论计算:\(F1 = \frac{2 \times 0.240 \times 0.428}{0.240 + 0.428} = 0.3074 \approx 0.308\)完全吻合!
    对比上文提到的 RGRG (计算值0.467 vs 论文0.447) 和本文 Ours (计算值0.505 vs 论文0.476),我们可以合理怀疑:作者在抄写对比模型的数据或整理自己模型的数据时,为了凸显“Ours”的优越性,强行压低了别人的 F1 值或拔高了自己的 P/R 值,但忘记同步修改 F1,导致整个表格的数学体系精神分裂。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:图片复用与拼接检测(受限)

  • 位置:Figure 1, Figure 2, Figure 3, Figure 4, Figure 5 等
  • 描述:由于本次检测仅接收到纯文本流(无像素级图片源文件),无法进行底层噪点比对、PS拼接痕迹分析和Western Blot泳道检测。
  • 证据:文本中未提供足够的原始高分辨率图片信息,无法进行像素级分析。但从现有的图表描述逻辑来看,框架图与文字描述基本对应,未发现明显的结构性矛盾。
  • 严重程度:🟡 (客观限制)
  • 复核状态:✅ 成立

发现 4:时间线与实验条件验证(通过)

  • 位置:Method / Implementation details
  • 描述:核查了论文中使用的关键模型与硬件时间线。
  • 证据:论文提及使用 ResNet-101, BERT-base, CLIP 以及 2023年发布的 Vicuna-13B。实验环境为 RTX 3090。以论文发表的 2023 年 8 月(arXiv提交时间)为基准,所有引用的模型、显卡及代码库(PyTorch 2.0)均在投稿前已完全上市并开源。训练27万样本在单卡3090上跑24小时(约2 it/s),符合该体量模型的正常算力逻辑,未发现“穿越时空”使用未来技术的造假现象。
  • 严重程度:✅ (正常)
  • 复核状态:✅ 成立

耿同学辣评

这篇论文生动地向我们展示了什么叫“只要我的计算器坏了,我的模型就能永远天下第一”。连小学生都知道 F1 是精确率和召回率的调和平均数,但在深度学习大佬的表格里,F1 居然能“脱离物理定律”自由飞翔!最搞笑的是,抄别人 M2TR 模型的数据时公式算得严丝合缝,一到自己的核心数据就开始任性瞎编。建议作者重修小学算术,或者干脆换个不用算数的学科去水论文。

建议后续行动

  • 联系作者要求提供原始的评测脚本(Evaluation script)和 log 文件,核对其 P/R/F1 是如何通过代码打印出来的。
  • 在 PubPeer 上提出质疑,公开要求解释 Table 1 和 Table 2 中的数学不自洽问题。
  • 向期刊/会议编辑部举报(若该论文已被某会议/期刊录用)。
  • 向作者所在机构(香港科技大学)学术委员会举报,要求核查其代码库实际跑出来的真实指标。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。