Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊:Pre-print (arXiv:2308.12604v2)
  • DOI:N/A
  • 发表年份:2023
  • 论文来源:2308.12604v2.pdf

综合评定:✅ 清白

详细发现

发现 1:图片复用检测(一图多用)

  • 位置:Figure 1, Figure 4, Figure 5 等
  • 描述:未发现明显的图片一图多用、旋转复用或对比图/凝胶图造假痕迹。本文属于深度学习/自然语言处理交叉领域的计算机论文,图片以模型架构图、数据统计柱状图、折线图以及定性分析案例为主。所有图表的上下文逻辑自洽,无不自然的重复拼接。
  • 证据:图片内容均与正文论述(如Figure 1对比基准模型,Figure 5展示生成文本案例及注意力权重)高度吻合。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

发现 2:数据造假检测(随机数生成器都不如)

  • 位置:Table 1 (主实验结果), Table 2 (消融实验)
  • 描述:提取表格中的各项评测数据(如 F1, BLEU-1, BLEU-4 等)进行末位数字和数学自洽性分析。
  • 证据
    1. 末位数字分布:提取 Table 1 中 Ours 的各项指标(0.501, 0.509, 0.476, 0.398, 0.112, 0.157, 0.268),末位数字分别为 1, 9, 6, 8, 2, 7, 8。提取 Table 2 (Ablation) 的 F1 分数(0.370, 0.444, 0.451, 0.464, 0.468, 0.476),末位为 0, 4, 1, 4, 8, 6。末位数字分布自然且均匀,未呈现“全为0或5”的随机生成器造假特征。
    2. 数学自洽性验证:在医学报告生成领域,F1 score 往往不等于 Precision 和 Recall 的简单调和平均数(因为是多标签分类且按样本/宏平均计算),这是领域特性。但在如 Appendix Table 2 中,MIMIC 数据集上 RGRG 的表现:Precision (0.355) 和 Recall (0.340) 对应 F1 (0.318),逻辑合理且符合非单调调和的数学规律。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

发现 3:图片拼接检测(PS 痕迹)

  • 位置:N/A
  • 描述:本文不含 Western blot、显微镜图等容易被 Photoshop 拼接的生物医学图像。模型架构图(Figure 2, 4)块图清晰,连线规范,定性结果图(Figure 5)带有标准的高亮和注意力机制可视化,未见异常修图痕迹。
  • 证据:无违背视觉常理的异常分界线或背景噪点突变。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

发现 4:统计学异常检测

  • 位置:Experiments 章节
  • 描述:本文为计算机科学领域的深度学习实验,未采用传统的生物统计学(如 p-value, ANOVA)。
  • 证据:实验的提升幅度(如绝对提升 2.9%, 10%, 15%)与表格中报告的绝对数值完全吻合(0.476 - 0.447 = 0.029)。没有出现选择性报告显著结果的 p-hacking 痕迹,甚至作者诚实地指出了自己模型在某些 NLG 指标(如 BLEU-4)上不如基准模型的地方,这种“自曝家丑”是真实科学探索的常见态度。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

发现 5:产出异常检测(量产型学术)

  • 位置:Implementation details
  • 描述:时间线与技术栈逻辑合理,符合真实的科研产出节奏。
  • 证据:论文提到使用了 Vicuna-13B(2023年发布的开源大模型)、PyTorch 2.0 以及对比了 2023 年的 SOTA 模型(如 RGRG, KiUT, DCL)。论文在 ArXiv 的发布版本号为 v2(通常代表经过修改),从技术更迭的时间线来看,完全符合 2023 年中上旬的技术背景。训练时间(单张 RTX 3090 训练约 24 小时处理 27 万张 MIMIC 数据)在当前算力水平下完全合理。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

发现 6:引用与方法学异常

  • 位置:Methods / Appendix
  • 描述:方法学描述严谨,内部逻辑高度自洽,无伪造试剂或设备编号的嫌疑。
  • 证据
    1. 论文公开了代码仓库:https://github.com/jhb86253817/PromptMRG,对于深度学习论文而言,开源代码极大降低了造假风险。
    2. 附录中详细交待了针对 IU X-Ray 数据集的清洗和筛选逻辑(为了平衡正负样本比例,剔除了80%的正常图片,最终保留4168张),并对预处理带来的数据量变化进行了详尽的表格展示,方法学极为扎实。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

耿同学辣评

这篇主打“Prompt 提示词”辅助医疗报告生成的 AI 论文,不仅逻辑严密、代码开源,甚至还在附录里老老实实地拆解了数据清洗过程和自身 NLG 指标下降的原因——主打一个真诚。全文六式扫描下来连个划水的破绽都没找到,属实是“用来洗眼和恢复对学术界信心的优质范本”了!

建议后续行动

  • 无需联系作者要求提供原始数据(文本与逻辑已自洽,且已开源)
  • 无需在 PubPeer 上提出质疑
  • 无需向期刊编辑部举报
  • 无需向作者所在机构学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。