PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
- 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
- 期刊:Preprint (arXiv:2308.12604v2)
- DOI:N/A
- 发表年份:2023
- 论文来源:2308.12604v2.pdf
综合评定:✅ 清白
详细发现
发现 1:图片复用与拼接检测(第一式与第三式)
- 位置:全文图表(Figure 1-5, Appendix Figure 1-4)
- 描述:作为一篇深度学习与自然语言处理方向的计算机科学论文,本文不含 Western blot、流式细胞术或显微镜图等易遭篡改的传统生物学图像。文中的图表主要为模型框架图(Figure 2, 3, 4)、数据统计柱状图/折线图(Figure 1, 6)以及生成的医疗报告文本定性示例(Figure 5, Appendix Figure 4)。
- 证据:文本中未提供原始像素图片以供分析,但基于文本提取和逻辑判断,不存在明显的“一图多用”或违背常理的图像拼接痕迹。实验数据的可视化(如 Figure 6 的 F1 分数对比)符合深度学习模型在不同疾病类别上表现参差不齐的真实常态(并非所有柱状图都呈现完美的阶梯状,存在波动)。
- 严重程度:🟡(受限于纯文本输入,无法进行像素级造假检测,但未见明显异常)
- 复核状态:✅ 成立
发现 2:数据造假与统计学异常检测(第二式与第四式)
- 位置:Table 1, Table 2, Table 3 (Appendix)
- 描述:检查了作者报告的BLEU、F1等评价指标数据。在医疗报告生成任务中,不同指标之间存在权衡是常态(例如,作者在文中诚实交代了使用DDP模块虽然提高了临床疗效CE指标,但会导致自然语言生成NLG指标轻微下降)。
- 证据:消融实验数据变化非常符合深度学习模型加入不同模块后的演进逻辑。例如,加上DDP后F1从0.370跃升至0.444,但BLEU-4从0.116降至0.106。数据呈现出真实实验中常见的“非完美”折中现象。此外,末位数字分布没有呈现出人为编造的过度整齐感。
- 严重程度:✅ 无异常
- 复核状态:✅ 成立
发现 3:时间线与设备合理性检测(第五式与第六式)
- 位置:Implementation details (方法论部分及附录)
- 描述:论文使用 PyTorch 2.0 和单张 RTX 3090 显卡训练了约 24 小时(10 个 epoch)。结合当前基准日期(2026-06-20),该论文发表于 2023 年 8 月(arXiv版本号 2308.12604)。
- 证据:对于在 MIMIC-CXR(约 27 万样本)上训练 ResNet-101 + Bert-base 架构的模型,使用单张 3090 耗时 24 小时是非常合理且符合物理规律的,不存在“用普通笔记本一周算完几百年算力”的量产型夸张吹嘘。此外,文中引用的 Vicuna-13B 和相关 2023 年的文献(如 CVPR 2023)在 2023 年 8 月的时间节点上完全自洽。方法部分不存在前后矛盾。
- 严重程度:✅ 无异常
- 复核状态:✅ 成立
发现 4:数据集使用规范性质疑(第六式)
- 位置:Appendix -> IU X-Ray Dataset
- 描述:作者指出前人划分的 IU X-Ray 测试集不适用于疾病感知评估,因此作者自行修改了测试集:将图像对拆分,并随机删除了 80% 的正常图像,以匹配 MIMIC 数据集的阳性率分布。
- 证据:原文明确描述了该数据处理逻辑:“we treat the two associated images separately, which doubles the number of samples (from 2,955 to 5,910)... we randomly removed 80% of the normal images and finally retained 414 of them... the total number of our IU test set is 4,168”。虽然这在技术上是自定义测试基准,但作者在正文及附录中均进行了透明、详细的披露,并在对比表格脚注中明确标注了评估方式的差异,排除了学术不端的故意隐瞒嫌疑。
- 严重程度:🟡 属于学术探讨范畴,非造假。
- 复核状态:✅ 成立
耿同学辣评
这是一篇非常“老实本分”的 AI 论文。没有移花接木的电泳图,没有完美如正弦曲线的假数据,甚至连显卡训练时长都老老实实交代得明明白白(单卡3090跑24小时)。作者甚至在附录里坦白了“为了证明我的模型好,我把公开测试集里的正常图片删了 80%”——虽然这波操作有点“重新定义考试题”的味道,但人家大大方方在脚注和附录里写清楚了逻辑和最终样本量。做学术嘛,菜可以,但心要正,这篇论文的诚信没毛病,散会!
建议后续行动
- 无需采取行动,论文核心数据、实验逻辑与设备耗时均自洽,未发现学术不端证据。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。