PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
- 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
- 期刊:[未知,从文本推断为预印本/会议论文,如 arXiv 或 CVPR/ICCV 等计算机视觉会议]
- DOI:[未提供]
- 发表年份:2023 (基于文本中的引用及 arXiv 编号推断)
- 论文来源:2308.12604v2.pdf
综合评定:✅ 清白
详细发现
发现 1:图片复用检测(一图多用)
- 位置:全文图像
- 描述:本文为深度学习/自然语言处理领域的医疗报告生成论文,文中主要包含架构图(Figure 2, 4)、定性文本对比图(Figure 1, 5)以及柱状图/折线图(Figure 1, 6)。未发现传统生物医学论文中常见的 Western blot 或流式细胞图等易被操纵的图像。
- 证据:文本中未提供足够的图片像素信息供分析,但从文本逻辑和图表说明(如 Figure 2 caption, Figure 4 caption 等)来看,各图表功能明确,未见异常的复用说明。
- 严重程度:🟡(不适用/未触发)
- 复核状态:✅ 成立
发现 2:数据造假检测(随机数生成器都不如)
- 位置:Table 1, Table 2 (Appendix), Appendix 中的数据集划分统计
- 描述:在计算机科学类论文中,数据通常以宏观评价指标(如 F1, BLEU)呈现。本文的数据呈现出真实实验特有的“不完美性”。例如,Table 1 中虽然模型在 CE metrics(临床疗效)上取得了 SOTA,但在 NLG metrics(自然语言生成)上(如 MIMIC 数据集的 BLEU-4)反而低于部分基线方法(如 RGRG)。作者在正文中诚实地承认了这一点,并用 N-gram 统计给出了合理解释(DDP 模块减少了高频通用词汇的生成,导致词匹配得分下降)。
- 证据:在 Appendix 的 IU X-Ray Dataset 统计中,作者展示了严密的数学自洽性:原 IU 数据集 2955 样本,分为正侧位片后翻倍至 5910。为对齐 MIMIC 测试集中约 8-10% 的“无异常”样本比例,作者移除了 80% 的正常样本,最终保留了 414 张,使得整体测试集数量达到 4168(414/4168 ≈ 9.9%,与文本中声称的 10% 吻合)。这种有零有整的底层逻辑和数据修正是真实科研过程的常态,而非随机生成器造出的完美假象。
- 严重程度:🟡(不适用/未触发)
- 复核状态:✅ 成立
发现 3:图片拼接检测(PS 痕迹)
- 位置:不适用
- 描述:本文涉及的图表多为矢量图或代码生成的渲染图,不存在泳道拼接、背景噪点异常等传统生物医学影像常见的 PS 拼接问题。
- 证据:无需进行像素级连点检测,原文无相关可疑图像描述。
- 严重程度:🟡(不适用/未触发)
- 复核状态:✅ 成立
发现 4:统计学异常检测
- 位置:Table 1, Table 2, Table 3
- 描述:不同于医学统计学强调 p 值和 SD,本文采用机器学习标准的宏平均评估。模型在不同数据集(MIMIC vs. IU X-Ray)上的提升幅度不同(MIMIC 上提升 2.9%,IU 上提升 3.1%),消融实验中各个模块的增益也符合逻辑叠加效应,并未出现所有指标全方位“碾压”的物理不可能现象。
- 证据:消融实验(Table 2)中,加上 SDL 模块后(从
✔ ✔ ✔ ✘到✔ ✔ ✔ ✔),Precision 略有下降(0.514 -> 0.501),但 Recall 大幅上升(0.475 -> 0.509),这种“牺牲精度换取召回”的 trade-off 完全符合 SDL(Self-Adaptive Disease-Balanced Learning)应对长尾分布设定的理论预期。 - 严重程度:🟡(不适用/未触发)
- 复核状态:✅ 成立
发现 5:产出异常检测(量产型学术)
- 位置:全文及参考文献
- 描述:从引用和调研来看,作者对 2023 年最新发表的 METrans、KiUT、DCL、RGRG 等同期工作有深入的对比和分析,并且开源了代码。
- 证据:结合提供的时间线基准,本文发表于 2023 年,使用 2022 年底至 2023 年初的工具和算力(Implementation details 中提到 ResNet-101, Bert-base, 以及引用了 Vicuna-13B 进行辅助标记,使用 RTX 3090 训练)。技术栈与时间线完全吻合,不存在穿越引用未来文献或短期拼凑海量不相关论文的特征。
- 严重程度:🟡(不适用/未触发)
- 复核状态:✅ 成立
发现 6:引用与方法学异常
- 位置:Method 部分 - Auxiliary disease labeling with LLMs
- 描述:方法学逻辑闭环。作者在分类分支中使用了 Vicuna-13B 这一大型语言模型来为额外的四种异常(Aorta, Bone/Spine 等)打标签,并在 Figure 3 中给出了具体的 Prompt 示例。这种“用大模型做弱标注辅助小模型训练”的 Pipeline 设计非常符合 2023 年 AI 学术界的演进路线。
- 证据:原文明确写道 “we leverage the ability of large language models (LLMs) to obtain labels... we used Vicuna-13B (Zheng et al. 2023) as our labeling assistant”,且文本内部不存在逻辑断裂问题。设备、算力、数据集划分的描述均详实且自洽。
- 严重程度:🟡(不适用/未触发)
- 复核状态:✅ 成立
耿同学辣评
作为一篇 AI+医疗的跨界论文,这篇证据链结实得像加了钢板的装甲车。实验里“按下葫芦浮起瓢”(CE指标涨了但NLG指标跌了)的诚实交代,以及附录里为了对齐数据集正负样本比例搞的一通“极限微操”,恰恰是真实科研打工人的写照——造假分子可懒得编这种需要自圆其说的小数点和带着遗憾的 trade-off,他们恨不得让自家模型在所有字母表里都拿第一!
建议后续行动
- 文本与逻辑审查完毕,无需进一步联系作者。
- 暂无在 PubPeer 上提出质疑的必要。
- 检测结论支持其学术诚信,建议正常引用和参考。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。