Loading...
正在加载...
请稍候

PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PromptMRG: Diagnosis-Driven Prompts for Medical Report Generation
  • 作者:Haibo Jin, Haoxuan Che, Yi Lin, Hao Chen
  • 期刊:The Thirty-Eighth AAAI Conference on Artificial Intelligence (AAAI-24)
  • DOI:未在文本中提供
  • 发表年份:2024

综合评定:🟡 存疑

详细发现

发现 1:数据合理性与一致性检测(深度学习指标)

  • 位置:Table 1, Table 2, Table 3
  • 描述:对论文中报告的模型性能指标(Precision, Recall, F1, BLEU等)进行数学逻辑和分布分析。
  • 证据:在Table 2的消融实验中,各模块(DDP, ADL, CFE, SDL)的累加对F1分数的提升(0.370 -> 0.444 -> 0.451 -> 0.464 -> 0.468 -> 0.476)呈现合理的渐进式增长,没有出现违背常理的断崖式突变。NLG指标(如BLEU-4)在引入DDP后出现轻微下降,作者给出了合理的解释(减少了高频词汇的盲目复制)。数据的微小波动和权衡符合真实机器学习实验的规律,不像是随机数生成器造假的“完美数据”。
  • 严重程度:(未触发红旗,属于正面验证)
  • 复核状态:✅ 成立

发现 2:时间线与工具版本合理性检测

  • 位置:Method - Auxiliary Disease Labeling With LLMs / Implementation Details
  • 描述:检查论文所使用的工具、预训练模型及提交时间线是否冲突。
  • 证据:论文引用了 Vicuna-13B (Zheng et al. 2023) 作为辅助标注工具,并声明使用 PyTorch 2.0 进行训练。考虑到当前日期为 2026 年,AAAI 2024 的论文工作(通常在2023年8月左右提交)使用 2023 年初发布的模型和框架是完全合理且逻辑自洽的。没有出现“使用未来才发布的设备或模型”的时间穿越现象。
  • 严重程度:(未触发红旗,属于正面验证)
  • 复核状态:✅ 成立

⚠️ 发现 3:图片与像素级拼接检测受限说明

  • 位置:Figure 1 - Figure 6
  • 描述:由于当前仅接收到论文的纯文本提取内容,缺乏高分辨率的原始图片文件(如 Western Blot 原图、显微镜图或高保真网络架构图)。
  • 证据:文本中未提供足够的像素信息,无法进行图像复用(一图多用)、PS拼接痕迹、背景噪点一致性等维度的微观分析。不过,从图表的文本描述(如架构图 Figure 2、检索模块图 Figure 4、定性分析图 Figure 5 的长文本说明)来看,逻辑清晰,未发现明显的图文不符描述。
  • 严重程度:🟡 (客观条件受限)
  • 复核状态:⚠️ 依据不足

耿同学辣评

这是一篇做医疗报告生成的纯计算机算法论文,没有小白鼠、没有细胞系、也没有Western Blot。从目前复核的文本数据来看,数据曲线有涨有跌,指标提升费了半天劲也就几个百分点,非常符合深度学习“炼丹”的真实折磨感,不像是随机生成的造假数据;引用的模型和框架在时间线上也挑不出毛病。唯一遗憾的是,目前只有纯文本信息,缺乏原始的高清图像件供我们进行像素级审查。所以耿同学只能说:在文本逻辑层面没发现造假痕迹,大概率是一篇老老实实调参的正常文章,但要下绝对清白的定论,还得看原图拆解。

建议后续行动

  • 文本层面未发现异常,无需联系作者提供原始实验记录。
  • 无统计学恶意 P-hacking 痕迹,暂无需在 PubPeer 质疑。
  • 如有条件,建议获取更高清的原始 PDF 图件进行二次视觉(像素级)例行检查,以彻底排除图像不规范问题。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。