Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊:未知(预印本 arXiv:2308.12604v2,典型计算机视觉/自然语言处理类顶会格式)
  • DOI:未提供
  • 发表年份:2023/2024
  • 论文来源:2308.12604v2.pdf

综合评定:✅ 清白

详细发现

发现 1:图片与表格编号异常(附录排版复用)

  • 位置:附录部分
  • 描述:正文中使用了 Table 1, Table 2, Table 3 以及 Figure 1-6。而在附录中,表格和图片的编号被重新从 1 开始(Appendix 中出现了 Table 1, Table 2, Figure 1, Figure 2, Figure 3, Figure 4)。
  • 证据:正文的 Table 1 是对比 SOTA 方法,附录的 Table 1 是疾病阳性样本统计;正文 Figure 1 是初步实验图,附录 Figure 1 是超参数分析。这在采用 LaTeX 模板双栏排版直接附加 appendix 的 CS 顶会论文中极其常见,是排版习惯或模板默认设置导致的,绝非图片复制粘贴的一图多用。
  • 严重程度:🟡(轻微瑕疵,仅排版规范问题)
  • 复核状态:✅ 成立

发现 2:数据集清洗逻辑的数学自洽性验证

  • 位置:Appendix - IU X-Ray Dataset / Appendix Table 1
  • 描述:作者为了使 IU X-Ray 测试集中的“正常样本”比例与 MIMIC 数据集对齐(从 36% 降至 10%),阐述了以下操作:IU 总样本翻倍至 5910 -> 随机删除 80% 的正常图像 -> 保留 414 张正常图像 -> 最终总数 4168。经复核推导:假设删除前正常图像为 \(X\),保留 20% 即 \(0.2X = 414\),反推 \(X = 2070\)。删除数量为 \(2070 - 414 = 1656\)。初始总数 5910 - 删除的 1656 = 4254。
  • 证据:作者在原文中声称最终保留的总数是 4168,而根据其给出的“保留 414 张”的条件进行严谨数学推导,总数应为 4254。这里确实存在算术不匹配,极大概率是作者在随机删除时采用了固定数量(如直接删除了 1742 张),在文字描述中为了好理解写了“删除80%”和“保留414”,导致四舍五入或文字描述不够严密。这属于科研中常见的文字描述粗心,不构成核心数据造假。
  • 严重程度:🟡(文字描述与精确数学计算略有出入,但不影响实验有效性)
  • 复核状态:✅ 成立

发现 3:训练算力与时间线合理性

  • 位置:Implementation details
  • 描述:作者声称使用 PyTorch 2.0,在单张 RTX 3090 GPU 上训练 10 个 epoch,耗时约 24 小时。数据集 MIMIC-CXR 训练集包含 270,790 个样本。
  • 证据:原文 Datasets 部分明确定义训练集样本量为 270,790。原文 Implementation details 写明“The number of training epochs is 10, batch size is 16... The model was implemented with PyTorch 2.0 and trained with one RTX 3090 GPU for about 24 hours.”。对于 224x224 分辨率的图像输入配合 ResNet-101 与 Bert-base 架构,这个训练速度和算力消耗在工程上是完全合理且常见的,没有任何违背物理常识的“胡编乱造”。
  • 严重程度:✅(合理)
  • 复核状态:✅ 成立

发现 4:消融实验与性能提升合理性

  • 位置:Table 2, Table 3
  • 描述:通常造假论文的消融实验会呈现出极其规律的等差递增,且方差极小。本文的实验数据呈现则符合真实训练规律。
  • 证据:原文 Table 2 消融实验中,加入各个模块后 F1 分数从 0.370 提升到 0.444,再到 0.451、0.464、0.468、0.476。这种非线性的、幅度不一的提升是真实深度学习训练的典型表现。此外,在 Table 3 及其对应正文中,作者明确报告了 Feature prompt 带来了 -1.3% 的负面效果,这种“报忧”的真实数据呈现,进一步排除了随机生成器造假的可能。
  • 严重程度:✅(合理)
  • 复核状态:✅ 成立

耿同学辣评

这篇论文的底裤经得起扒!虽然 Appendix 里把 Table 重新编号搞得像一图多用,计算正常样本删除比例时也稍微算错了几个数(典型的搞 CS 的同学对具体数字马马虎虎),但整体逻辑闭环,算法参数和计算资源完全符合物理规律。现在的 AI 论文,只要没犯“用未来的数据训练过去的模型”这种赛博朋克错误,且消融实验没有像心电图一样规律,基本就可以安心吃瓜。这篇文章不仅没造假,还诚实地汇报了某些模块无效(负增长),属于是老实孩子了。

建议后续行动

  • 无需联系作者要求提供原始数据(未发现实质性造假)
  • 无需在 PubPeer 上提出质疑
  • (可选)发邮件提醒作者附录排版编号问题及数据集过滤参数的微小数学出入,帮助其完善 Camera Ready 版本。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。