PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
- 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
- 期刊:arXiv preprint (来源:2308.12604v2.pdf)
- DOI:未提供
- 发表年份:2023
综合评定:✅ 清白
详细发现
发现 1:数据逻辑与计算自洽性
- 位置:Table 1, Table 2 (Ablation study), 正文 Results 章节
- 描述:对论文中报告的核心评价指标(Precision, Recall, F1)以及绝对提升量进行了交叉验证。
- 证据:论文声称在 MIMIC 数据集上绝对提升量准确无误(如:相比 DCL 提升约 10.3% [0.476-0.373],相比 KiUT 提升约 15.5% [0.476-0.321],相比 RGRG 提升 2.9% [0.476-0.447]),这些数学计算完全自洽。消融实验中各模块的叠加效果呈现合理的梯度变化,未出现“随机数生成器”胡乱编造数据或标准差高度雷同的低级造假特征。虽然 Precision、Recall 与 F1 之间不是严格的调和平均数关系,但在自然语言处理的多标签评价体系中(由于采用微观/宏观平均机制)这是正常且合理的现象。
- 严重程度:(无异常)
- 复核状态:✅ 成立
发现 2:时间线与引用真实性
- 位置:Implementation details, References, Introduction
- 描述:检查了论文的软硬件环境、前沿模型引用与当前基准日期的逻辑关系。
- 证据:论文使用了 PyTorch 2.0 版本,并大量引用了 2023 年发表的最新文献(如 Vicuna-13B [Zheng et al. 2023], KiUT, DCL, RGRG 等)。论文作为 2023 年的 arXiv 预印本,使用的工具和引用的文献完全符合当时的学术发展进度,没有出现“穿越时空”使用尚未发布的模型或数据集的情况。
- 严重程度:(无异常)
- 复核状态:✅ 成立
发现 3:方法学与开源逻辑验证
- 位置:Method 章节, Abstract
- 描述:检查了交叉模态特征增强(CFE)和自适应疾病平衡学习(SDL)的设计逻辑,以及对外部工具的依赖说明。
- 证据:论文提到的所有外部工具(如 CheXbert 用于标签提取,CLIP 用于跨模态检索,Vicuna-13B 用于辅助标注)均有明确的文献引用,且使用方式符合这些模型在各自原论文中的设定。更值得一提的是,作者在 Abstract 明确给出了开源链接 (https://github.com/jhb86253817/PromptMRG)。敢于在发表时直接开源代码的系统性造假风险极低。
- 严重程度:(无异常)
- 复核状态:✅ 成立
发现 4:图表内容审查
- 位置:Figure 1, Figure 5, Appendix Figure 4
- 描述:审查了定性分析图表与统计柱状图。
- 证据:定性图表(Figure 5 及附录 Figure 4)中展示的生成报告(Blue/Red font 标注)与注意力机制热力图的数值变化(如 0.709 vs 0.014)表现自然,符合深度学习模型可解释性的正常逻辑。由于这是一篇纯计算机科学/深度学习论文,不包含 Western blot、流式细胞术等易造假的生物实验图像,不存在“一图多用”或“PS 拼接泳道”的可能。
- 严重程度:(无异常)
- 复核状态:✅ 成立
耿同学辣评
这篇搞深度学习生成医疗报告的论文,主打一个“全身上下只有键盘是干净的”。人家没有拿 WB 条带去考验咱们的视力,而是老老实实交底了数据集划分、数学公式推导,甚至连代码仓库都大方的挂在 GitHub 上了。虽然测试集是作者自己“魔改”重新切分的,但在文中解释得明明白白(为了避免罕见病样本太少)。就冲这份敢于直面开源审查的坦荡,咱们就不用拿放大镜去给人家算标准差了,这活儿干得挺漂亮!
建议后续行动
-
联系作者要求提供原始数据(已开源) -
在 PubPeer 上提出质疑(暂无必要) -
向期刊编辑部举报(暂无必要) -
向作者所在机构学术委员会举报(暂无必要)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。