Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊:The Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI-24)
  • DOI:未在文本中提供
  • 发表年份:2024

综合评定:🟠 高度可疑

详细发现

发现 1:引用与方法学异常(公式与原始设定矛盾)

  • 位置:Equation 6, Page 2610
  • 描述:作者声称借鉴了 Menon et al. (2020) 的 logit-adjusted loss,但在公式 6 的表达中,分母部分的求和项 sum_{y'!=P} e^{fy'(xE)} 并没有加上 logit 调整项 log π,而仅仅在作为分子的正类部分加上了 logπD
  • 证据:标准的 logit-adjusted loss 会根据所有类别的分布对所有 logit 进行统一调整。作者这种“只调整正类、不调整负类”的非标准写法,在数学上极其奇怪。结合原文紧接着的一句“The loss against non-positive labels remains the same as LCE.”可以确证。如果这不是排版错误,那就是作者对数学公式的生搬硬套或强行魔改,存在严重的数学自洽性问题。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:引用异常(文献格式与学术规范问题)

  • 位置:References 列表(Li, M.; et al. 2021)
  • 描述:文末的参考文献中,关于 FFA-IR 数据集的引用被极其敷衍地写成了“Li, M.; et al. 2021. Ffa-ir: Towards an explainable and reliable medical report generation benchmark. In NeurIPS.”
  • 证据:在正式的学术会议论文参考文献中,极少直接把“et al.”作为作者列表进行排版(通常应列出前三位作者)。这高度暴露了作者在撰写论文时可能使用了不规范的抓取工具,或者直接从搜索引擎摘要页复制粘贴而未加校对,态度较为敷衍。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 3:产出异常(训练算力与时间线存疑)

  • 位置:Implementation Details, Page 2611
  • 描述:作者声称使用包含 27 万+ 样本的 MIMIC-CXR 数据集,训练包含 ResNet-101(Image Encoder)、BERT(Decoder)、外加一套复杂的 CLIP 检索(Top-k=21)和 Dynamic Aggregation Transformer 模块的多模态网络,跑了整整 10 个 Epochs,仅用了“约 24 小时”,且硬件仅为“单张 RTX 3090 显卡”。
  • 证据:在单卡(24G显存)上跑 27 万张图的庞大多模态模型,还要进行 KNN 检索匹配 21 个相似报告,如果未对图像特征和文本特征进行全量离线缓存(文中未提及),这个训练速度在物理上几乎是不可能的,不禁让人对其实验细节和复现可行性产生怀疑。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 4:统计学异常(F1 分数不满足数学自洽)

  • 位置:Table 3
  • 描述:查看 Table 3 第一行(None),作者报告的 Precision 为 0.430,Recall 为 0.368,但报告的 F1 Score 却是 0.370。
  • 证据:如果按照常规的微平均计算,2PR/(P+R) 应该约为 0.396。虽然由于 CheXbert 标注导致的宏平均可能造成数学上的不完全对等,但作者在 Evaluation Metrics 部分完全没有解释这是宏平均,极容易让读者误以为是常规的微平均计算错误。这是典型的“表内数据不自洽或解释不清”的灰旗信号。
  • 严重程度:🟡
  • 复核状态:✅ 成立

⚠️ 发现 5:图片复用与拼接检测(客观条件受限)

  • 位置:All Figures
  • 描述:文本中未提供足够的图片像素级原始信息。
  • 证据:由于仅有文本提取内容,无法对 Figure 1~6(包括柱状图、网络结构图和医学报告生成示例图)进行视觉噪点比对、PS 拼接痕迹分析。虽然原文提供了相关图表的 caption 描述,但缺乏图像本身无法得出是否复用的实质性结论。
  • 严重程度:无法判断
  • 复核状态:⚠️ 依据不足

耿同学辣评

这篇论文的想法挺丰满——让模型先看病下诊断,再根据诊断写报告,这思路没毛病。但一到数学公式和排版环节就开始“放飞自我”了。公式6那是在做数学推导还是在做数独?参考文献直接拿个“et al.”糊弄事,真当看论文的各位大佬不查文献啊?此外,单卡跑27万数据加复杂多模态检索仅用24小时的“神仙速度”,以及表中莫名对不齐的 F1 分数,都让人捏把汗。建议作者端端正正把数学逻辑盘顺了、把实验细节交代清楚再上大分,不然审稿人眼里的沙子可不是那么容易揉掉的!

建议后续行动

  • 联系作者要求提供原始训练代码(特别是验证公式 6 的具体代码实现和显存/耗时优化技巧)。
  • 在 PubPeer 上提出质疑(主要针对公式 6 的数学严谨性以及 F1 分数不自洽的问题)。
  • 要求作者公开说明 Table 3 中评价指标的具体计算方式(宏平均还是微平均)。
  • 暂不向期刊编辑部举报,目前证据偏向于写作极度不严谨和核心细节缺失,暂不足以定性为系统性学术造假。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。