Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊/会议:The Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI-24)
  • DOI:文本中未提供
  • 发表年份:2024
  • 论文来源:00975-AAAI24.JinH.pdf

综合评定:✅ 清白

详细发现

发现 1:无图片复用与拼接异常(第一式、第三式检测)

  • 位置:Figure 1 - Figure 6
  • 描述:文本提取显示,论文中的图表(框架图、柱状图、定性结果展示等)均有明确的独立作用。Figure 1 用于动机展示,Figure 2 为整体框架,Figure 3 为 LLM 提示词示例,Figure 4 为模块架构,Figure 5 为生成报告对比,Figure 6 为 F1 分数对比。
  • 证据:原文文本与图注(caption)中明确描述了各图的功能,逻辑相互独立。未发现文本描述中存在不同实验条件下的图片视觉相似性冲突。由于仅凭文本无法进行像素级比对,但在逻辑和说明层面,未发现一图多用或恶意拼接的痕迹。
  • 严重程度:✅ 无异常
  • 复核状态:✅ 成立

发现 2:实验数据合理且自洽(第二式、第四式检测)

  • 位置:Table 1, Table 2, Table 3
  • 描述:论文中的数值报告遵循了深度学习实验的常见规律,不存在统计学上的“过于完美”或造假特征。
  • 证据
    1. 末位数字分布自然,包含 1, 2, 3, 4, 5, 6, 7, 8, 9,没有刻意凑整数的痕迹。
    2. 消融实验(Table 2)中,模块的累加带来了合理的性能提升(如 F1 从 Baseline 的 0.370 逐步提升至 0.476),且某些模块(如 DDP)在提升 CE 指标(F1 从 0.370 提升至 0.444)的同时导致了 NLG 指标的轻微下降(BLEU-4 从 0.116 降至 0.106),这种 trade-off 现象是真实实验中最常出现的,造假者往往倾向于伪造“全面碾压”的数据。
    3. 论文未进行大量 p 值报告,而是采用标准的深度学习评价指标(BLEU, F1等),不存在 p-hacking 异常。
  • 严重程度:✅ 无异常
  • 复核状态:✅ 成立

发现 3:时间线与技术引用合理(第五式、第六式检测)

  • 位置:Implementation Details (Page 2611) 及 Auxiliary Disease Labeling (Page 2610)
  • 描述:论文所使用的工具、模型、硬件与投稿时间线完全吻合。
  • 证据
    1. 原文明确提及使用了 Vicuna-13B (Zheng et al. 2023) 进行辅助疾病标签生成。Vicuna 模型发布于 2023 年,而 AAAI-24 的投稿和评审期在 2023 年下半年,时间逻辑成立。
    2. 原文明确记载了硬件配置与训练时间:trained with one RTX 3090 GPU for about 24 hours(10 epochs,batch size 16,数据集 MIMIC 规模约 27 万)。基于 ResNet-101 和 Bert-base 的架构,单卡 3090 跑 24 小时是非常符合物理常识和工程经验的。
    3. 代码框架明确引用 PyTorch 2.0,该版本于 2023 年初发布,时间线吻合。
  • 严重程度:✅ 无异常
  • 复核状态:✅ 成立

耿同学辣评

这论文写得相当扎实,简直是学术界的一股清流!特别是那个消融实验,加了个模块虽然核心指标(CE F1)涨了,但语言评价指标(NLG)反而掉了一点点,作者还特别诚实地在正文里解释了一通——这种敢写出“缺点”的论文,往往才是真做实验的论文。那些连批次、算力资源和训练时间都老老实实交代的,比满嘴跑火车、数据完美得像用随机数生成器造出来的“神刊”文章可信一万倍!

建议后续行动

  • 无需联系作者要求提供原始数据
  • 无需在 PubPeer 上提出质疑
  • 无需向期刊/会议编辑部举报
  • 无需向作者所在机构学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。