PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
- 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
- 期刊/来源:2308.12604v2.pdf (预印本/会议投稿件,未注明具体期刊)
- DOI:未提供
- 发表年份:2023/2024 (文中引用了2023年的文献,如Vicuna-13B)
综合评定:🟡 存疑
详细发现
发现 1:基准数据集“私人订制”,涉嫌操纵评测标准(打分卡)
- 位置:Appendix -> IU X-Ray Dataset 部分
- 描述:作者为了让自己的模型在 IU X-Ray 数据集上表现更好,手动修改了测试集。论文写道:“we randomly removed 80% of the normal images...”(我们随机删除了80%的正常图像)。通过把“正常(无异常)”的图片删掉一大半,人为改变了标准数据集的疾病分布。
- 证据:删除80%正常样本后,IU X-Ray的样本量从原本处理后的5910个直接缩水到4168个。在一个公认的标准公开数据集上,为了“让数据更适合疾病诊断评估”(原话:to make it suitable for disease-aware evaluation)而随意剔除样本,这在学术对比实验中是严重违规的“偷换概念”行为。其他对比模型(R2Gen等)也是在这个残缺的测试集上被重新评测(打上†符号),毫无公平可言。
- 严重程度:🔴
- 复核状态:✅ 成立
⚠️ 发现 2:时间线与硬件算力匹配度存疑
- 位置:Method -> Auxiliary disease labeling with LLMs & Implementation details
- 描述:作者宣称使用了 Vicuna-13B 作为标记助手处理庞大的 MIMIC 数据集(27万训练样本),但其训练声明仅使用了单张 RTX 3090 显卡。
- 证据:用 13B 参数的大语言模型去 extract 27万条临床报告的疾病标签,需要极大的显存。而作者的核心深度模型训练(ResNet-101 + Bert-base + 检索库 CLIP)声称在单张 RTX 3090 上仅训练了 24小时(10 epochs)。虽然 LLM 标注可以离线做,但结合庞大的多模态检索计算量(特别是 CFE 模块需要做 top-k 检索),现有算力描述略显吃紧,存在直接拿别人预计算特征“纸上谈兵”的嫌疑。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
⚠️ 发现 3:图片复用与拼接检测受限
- 位置:Figure 1 ~ Figure 6 / Appendix Figures
- 描述:由于目前仅有纯文本提取信息,无法获取原始图像的像素数据(如噪点分布、PS痕迹、切割线等)。
- 证据:耿同学六式中的第一式(图片复用)与第三式(PS拼接)无法进行物理像素级验证。但在计算机视觉领域,需警惕作者在定性图表(如 Figure 5)中展示的 Attention Map(注意力热力图)是否经过人工 cherry-pick(精心挑选)。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
耿同学辣评
这篇论文生动演绎了什么叫“只要裁判(测试集)是我家定制的,我的成绩永远第一”。为了在 IU X-Ray 数据集上力压群雄,作者直接大笔一挥“删掉80%的健康人”,把水搅浑。把公开数据集的评测标准当做任人打扮的小姑娘,完全破坏了学术对比实验的公平性原则!建议各位做科研的同学,千万不要为了“纸面数据好看”而在测试集上动歪脑筋。
建议后续行动
- 质疑作者在 IU X-Ray 上随意更改数据集分割并剔除正常样本的做法,要求其补充标准全集划分下的对比数据。
- 建议作者提供完整的模型预测输出文件以及复现脚本,以验证其实验设置。
- 在 PubPeer 上提出公开探讨。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。