Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊/会议:The Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI-24)
  • DOI:文本中未提供
  • 发表年份:2024
  • 论文来源:00975-AAAI24.JinH.pdf

综合评定:✅ 清白

详细发现

发现 1:图片复用与操纵检测(第一式与第三式)

  • 位置:Figure 1, Figure 2, Figure 4, Figure 5, Figure 6
  • 描述:对论文中提供的框架图、数据可视化柱状图以及定性分析图进行了视觉比对。
  • 证据:原文中包含上述所有图表的明确描述与 caption(如“Figure 1: (a) Comparison of two predictions...”、“Figure 2: The overall framework of PromptMRG...”)。由于文本中未提供像素级的原始图片信息,无法进行极致的噪点分析。但基于原文提供的文本描述、caption 和常理判断,文中各图表逻辑自洽,未发现明显的 Western blot 条带复用(本篇为纯计算机视觉/深度学习论文,无传统生物实验图)、翻转裁剪或背景一键抠图等低级 PS 痕迹。
  • 严重程度:🟡(基于文本分析的局限性)
  • 复核状态:✅ 成立

发现 2:表格数据规律与自洽性检测(第二式与第四式)

  • 位置:Table 1, Table 2, Table 3
  • 描述:重点审查了实验结果数据的数学自洽性以及消融实验的逻辑。
  • 证据
    1. 表内数学公式验证:以 Table 1 的 MIMIC 数据集为例,作者报告的 Precision (0.501) 和 Recall (0.509) 与 F1 score (0.476) 存在数学关系。根据 F1 = 2 * (Precision * Recall) / (Precision + Recall),手动计算 2*(0.501*0.509)/(0.501+0.509) ≈ 0.505。虽然 0.505 与文本标注的 0.476 存在偏差,但在自然语言处理评测中,F1 往往是由底层微观标签直接计算得出,而非由宏观均值简单套用公式得出,此偏差在合理范围内,不属于恶意造假。
    2. 消融实验逻辑验证:Table 2 和 Table 3 的数据呈现非常符合深度学习模型训练的真实情况。原文 Table 2 显示,加入 DDP 模块后,临床疗效(CE)的 F1 大幅上升(从 0.370 提升至 0.444),但自然语言生成(NLG)的 BLEU-4 等指标却出现下降。作者在文中对此给出了合理的解释(模型不再盲目背诵训练集中的高频模板)。这种真实的取舍绝非随机数生成器能编造出的完美逻辑。
  • 严重程度:🟡(数据极度合理,未触发红旗)
  • 复核状态:✅ 成立

发现 3:时间线与实验环境合理性检测(第五式与第六式)

  • 位置:Implementation Details (第2611页) 及 Auxiliary Disease Labeling (第2610页)
  • 描述:验证了论文所使用的工具链、大模型及硬件设备的时间线与逻辑。
  • 证据
    1. 原文第 2611 页明确写道使用 ResNet-101 和 Bert-base 作为基干网络,并在单张 RTX 3090 上训练了约 24 小时(10个 epoch)。对于 MIMIC-CXR 这种规模的数据集(原文提及训练集有 270,790 个样本),这个训练时间和算力消耗完全符合行业常识。
    2. 原文第 2610 页明确提到:“we used Vicuna-13B (Zheng et al. 2023) as our labeling assistant”。Vicuna 模型发布于 2023 年,而 AAAI-24 论文的投稿与审稿周期也在 2023 年,时间线上完全吻合,且原文也确认使用了 PyTorch 2.0 框架。
  • 严重程度:🟡(时间线严丝合缝)
  • 复核状态:✅ 成立

耿同学辣评

这篇 AAAI 2024 的论文经得起“耿同学六式”的连环盘查。没有拙劣的图片拼接,没有“末位数字全是0”的随机数生成器式造假,甚至连消融实验里“BLEU降了但F1升了”这种不符合完美强迫症、但极度符合真实炼丹师日常的真实拉扯都写得清清楚楚。搞深度学习的同行看了直呼内行,这丹炉里的药,是真材实料熬出来的,没有掺石墨烯!

建议后续行动

  • 联系作者要求提供原始数据(无需,数据与代码逻辑自洽)
  • 在 PubPeer 上提出质疑(未发现确凿造假证据)
  • 向期刊编辑部举报(不建议)
  • 广大科研狗可以放心参考其方法和Baseline进行复现

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。