PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
- 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
- 期刊:The Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI-24)
- DOI:未在文本中提供
- 发表年份:2024
- 论文来源:00975-AAAI24.JinH.pdf
综合评定:✅ 清白
详细发现
发现 1:图片复用与拼接检测(图像数据完整性)
- 位置:Figure 1, Figure 2, Figure 4, Figure 5, Figure 6
- 描述:无法进行像素级与噪点级分析。
- 证据:由于本次检测仅接收到论文的纯文本提取内容(无原始高清图片附件),缺乏进行 Western Blot 泳道分析、背景噪点对比或显微镜图重叠检测的客观条件。但从文本描述的逻辑来看,各图表(如架构图 Figure 2/4、定性结果图 Figure 5)的图注与正文论述高度自洽,未见明显的图注矛盾。
- 严重程度:🟡 (受限于检测媒介,无法出具绝对结论,但基于现有文本未发现异常)
- 复核状态:✅ 成立
发现 2:数据合理性与分布检测(随机数生成器检测)
- 位置:Table 1 (MIMIC & IU X-Ray 性能对比), Table 2 (消融实验), Table 3 (不同 Prompt 类型对比)
- 描述:深度学习模型的评估指标(如 F1, BLEU, METEOR 等)分布自然,末位数字杂乱无章,无人工编造数据的“过度完美”特征。
- 证据:以 Table 1 的 MIMIC 数据集 F1 分数为例,各模型的得分末位分别为 6, 8, 1, 5, 4, 2, 1, 1, 3, 7, 6。这在统计学上非常符合真实算力跑出来的浮点数运算结果。此外,Table 2 的消融实验中,加入不同模块后性能呈现合理的阶梯式上涨(0.370 -> 0.444 -> 0.451 -> 0.464 -> 0.468 -> 0.476),且作者在正文(Model Analysis 段落)坦诚指出了加入 DDP 模块会导致 NLG 指标(如 BLEU)轻微下降,这种“不遮掩缺点”的论述是真实科研探索中非常典型的特征,而非造假者常呈现的“全面碾压”。
- 严重程度:✅ (未触发红旗)
- 复核状态:✅ 成立
发现 3:统计学异常检测
- 位置:Experiments -> Implementation Details 及全文结果部分
- 描述:本文未提供 p 值、标准差或 ANOVA 相关的统计学检验数据。
- 证据:在计算机科学(特别是深度学习与计算机视觉)领域的顶会论文中,通常不要求进行传统的生物医学统计学检验(如 p<0.05),而是看重绝对指标的提升和 SOTA(State-of-the-Art)对比。因此,此处不存在 p-hacking 或统计学自相矛盾的问题,符合学科常规。
- 严重程度:✅ (符合学科规范)
- 复核状态:✅ 成立
发现 4:时间线与方法学异常(时间线闭环检测)
- 位置:Implementation Details 及 References
- 描述:软硬件环境、引用文献与论文发表年份的时间线完全闭环,无“时空穿梭”的造假痕迹。
- 证据:
- 作者在原文声称使用了 PyTorch 2.0 版本,PyTorch 2.0 于 2023 年发布,而 AAAI 2024 论文的实验时间通常在 2023 年中下旬,时间线吻合。
- 作者提到使用了 Vicuna-13B (Zheng et al. 2023) 作为辅助标记工具,且在 References 中能找到该文献,时间合理。
- 原文硬件需求为单张 RTX 3090 训练 24 小时,对于其提到的 ResNet-101 + Bert-base 架构处理 27 万级数据集(270,790 samples for training)来说,算力消耗估算合理。
- 严重程度:✅ (未触发红旗)
- 复核状态:✅ 成立
发现 5:细节纰漏排查(非造假性质)
- 位置:作者所属机构与邮箱(首页)
- 描述:第一作者 Haibo Jin 的邮箱被写为
{hjinag@cse.ust.hk}。 - 证据:原文首页明确写着
{hjinag,hche,jhc}@cse.ust.hk。hjinag存在明显的字母颠倒,大概率应为hjin(根据名字 Haibo Jin 推断)。这属于排版或作者笔误的无心之失,不涉及学术道德问题。 - 严重程度:🟡 (轻微瑕疵)
- 复核状态:✅ 成立
耿同学辣评
经过严格对照原文复核,这篇 AAAI 2024 的论文主打一个“踏实做学问”。虽然咱们“耿同学六式”平时抓生物医学造假一抓一个准,但在这种纯 CS/AI 算法论文面前,各种浮点数跑得比谁都野,经得起推敲。作者不仅没搞“全面碾压”的假数据,反而大方承认自己加了好东西(DDP)后某些语法指标会掉分——这种“有一说一”的态度,绝对值得上个大鸡腿!唯一该打屁股的是排版校对,自己名字的邮箱都能拼反,下次再写错就把你电脑的 Caps Lock 键扣掉!
建议后续行动
-
联系作者要求提供原始数据(基于现有文本证据无需进行) -
在 PubPeer 上提出质疑(未发现实质性学术不端) -
向期刊编辑部举报(无需操作) - (可选)通过邮件顺口提醒第一作者:哥们,你首页的邮箱拼写错啦!
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。