PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:2308.12604v2.pdf
- 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
- 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
- 机构:The Hong Kong University of Science and Technology
- 期刊/预印本:arXiv (计算机视觉与自然语言处理交叉领域)
- 发表年份:2023
综合评定:✅ 清白
详细发现
发现 1:测试集"自定义裁剪"引发的公平性探讨(第六式:引用与方法学异常)
- 位置:Appendix - IU X-Ray Dataset 部分
- 描述:作者声称原有的 IU X-Ray 测试集(来自 Chen et al. 2020)因为某些疾病正样本太少不适合评估,因此他们提出"用自己的规则重新评估"。具体操作是:把正侧位拼图拆成单图,然后随机删除了 80% 的正常图像(从 2955 张砍到只剩 414 张),最后拼凑出一个 4168 张图的"私设靶场"来跑测试。
- 证据:在 Table 1 中,作者在 IU X-Ray 数据集上的 F1 score (0.211) 大幅超越了当前最好的方法 RGRG (0.180)。但这种大幅领先是建立在他们改变了原始数据集分布的基础上的。虽然作者极为坦诚地交代了这一操作,但在学术打假的雷达里,"为了体现我的方法好而专门构造测试集"属于典型的 Benchmark Overfitting(基准过拟合)行为。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 2:评测指标"田忌赛马"(第四式:统计学异常/数据呈现异常)
- 位置:Appendix - Macro-Averaged Results (Table 2) / Results 部分
- 描述:在主表(Table 1)中,模型在 MIMIC 数据集上的普通 F1 提升为 2.9%,由于觉得"不够震撼",作者在附录中专门引入了 Macro-averaged CE metrics(宏平均临床疗效指标),成功将提升幅度放大到了 6.3%。
- 证据:作者在文中直言不讳地写道:"the gap between the best existing method and our method is even larger than example-based CE metrics because the disease-balanced problem was explicitly addressed by our method."(因为我解决了疾病不平衡问题,所以用衡量不平衡的指标更能体现我的牛逼)。这在 AI 论文里属于"只要我换的尺子够多,总有一把能证明我最长"。逻辑自洽,但属于科研包装学的高级操作。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 3:时间线与软硬件配置自洽(第五式:产出异常检测)
- 位置:Implementation details / Auxiliary disease labeling
- 描述:作为打假专家,必须核查"穿越式"科研。本文使用了 Vicuna-13B(2023年初发布)、PyTorch 2.0(2023年3月发布)、以及大量 2023 年的参考文献(如 KiUT, DCL, RGRG 等)。
- 证据:论文预印本提交时间为 2023 年 8 月(2308.12604)。软硬件发布时间与论文实验时间线完全吻合,且单卡 RTX 3090 跑 10 个 epoch 耗时 24 小时,符合 ResNet-101 + Transformer 在 MIMIC-CXR 数据集(约 27 万样本)上的算力逻辑。未发现时间线造假。
- 严重程度:✅(无异常)
- 复核状态:✅ 成立
发现 4:数据与公式逻辑无法造假的"硬骨头"(第二式:数据造假检测)
- 位置:Table 1 / Table 2 / 公式 (6)(7)(8)
- 描述:深度学习里的指标造假成本极高(一旦开源代码跑不通就会身败名裂)。本文不仅开源了代码(github链接),且各项指标(Precision, Recall, F1, BLEU-1/4)呈现代入公式后完全自洽。消融实验(Table 2)中,加上不同模块(DDP, ADL, CFE, SDL)后指标呈阶梯式上升(F1从0.370升至0.476),且伴随有轻微的 NLG 指标(BLEU)下降,这种"按下葫芦浮起瓢"的真实代价是造假者极难模拟出来的。
- 证据:模型在提升临床诊断准确率(CE)的同时,导致生成文本的自然度(NLG)下降,作者不得不在文中解释这是因为 DDP 模块让模型不再盲目复读训练集的高频词缀。这种"承认自己有瑕疵"的数据呈现方式,正是真实科学实验的典型特征。
- 严重程度:✅(无异常)
- 复核状态:✅ 成立
耿同学辣评
这是一篇把“科研包装学”玩到了极致的 AI 论文!没伪造数据,没抄袭图片,但硬是靠着“裁剪测试集正常样本”和“自己换了一套评测指标(Macro-F1)”,把论文写成了“我设计的尺子证明我最高”的凡尔赛文学。不过有一说一,人家代码全开源,公式全对得上,硬件和时间线严丝合缝,比起生化环材那些拿 PS 画 Western Blot 的猛士,这帮搞计算机的至少在造假成本上筑起了极高的门槛!
建议后续行动
- 无需联系作者,文本和逻辑已足够清晰自洽。
- 在 PubPeer 上提出质疑(保留,主要针对其基准测试集修改的普适性问题,供学术讨论)。
- 向期刊编辑部举报(不需要)。
- 向作者所在机构学术委员会举报(不需要)。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。