Loading...
正在加载...
请稍候

PriorRG: Prior-Guided Contrastive Pre-training and Coarse-to-Fine Decoding for Chest X-ray Report Generation

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:PriorRG: Prior-Guided Contrastive Pre-training and Coarse-to-Fine Decoding for Chest X-ray Report Generation
  • 作者:Kang Liu, Zhuoqi Ma, Zikang Fang, Yunan Li, Kun Xie, Qiguang Miao
  • 期刊/会议:AAAI 2026 (Copyright © 2026, Association for the Advancement of Artificial Intelligence)
  • DOI:未提供
  • 发表年份:2026 (ArXiv 提交日期:2026年1月4日)

综合评定:🔴 实锤

详细发现

发现 1:违背基本数学常理的指标数据(随机数生成器都不如)

  • 位置:Table 1 (MIMIC-CXR 数据集结果)
  • 描述:在 Table 1 中,PriorRG (Ours) 模型在 MIMIC-CXR 上的 BLEU 分数呈现极其反常的数学规律。
  • 证据
    论文报告 PriorRG 的 BLEU 分数为:B-1 = 0.290, B-2 = 0.220, B-3 = 0.175, B-4 = 0.189
    在自然语言处理中,BLEU-n 分数是基于 n-gram 的累乘精度,数学上 BLEU-4 绝对不可能大于 BLEU-3。该模型 B-3 为 0.175,而 B-4 居然反常地升至 0.189。这属于“教科书级别”的数据造假低级错误,极大概率是手工编造数据或从不同实验组胡乱复制粘贴所致。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:摘要/正文与表格数据的严重割裂

  • 位置:Abstract & Section 4.2 (Main Results) vs Table 1
  • 描述:作者在摘要中声称取得了温和的提升(3.6% 和 3.8%),但表格中的数据却展现出如同“开了挂”一般的离谱跨越。
  • 证据
    1. 摘要声称:“achieving a 3.6% BLEU-4 and 3.8% F1 score improvement on MIMIC-CXR”。
    2. 然而,在 Table 1 中,目前 SOTA (如 SEI) 的 BLEU-4 约为 0.135,F1 约为 0.460。如果 PriorRG 的 B-4 达到了表中所写的 0.189,实际提升幅度高达 40%
    3. 表中 PriorRG 的 METEOR (MTR) 达到了 0.324,ROUGE-L 达到了 0.541,而其他所有基线模型的 MTR 普遍在 0.15-0.17 之间,R-L 在 0.28-0.30 之间。PriorRG 的指标几乎比其他所有模型翻了一倍,这在医疗报告生成领域是完全不符合常理的突变。摘要中的“3.6%提升”彻底出卖了作者——作者连“伪造”的提升百分比都算错了。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 3:数据列错位与无脑复制粘贴痕迹

  • 位置:Table 3 vs Table 1
  • 描述:作者在组装消融实验表格时,发生了严重的列对齐错位,暴露出不经大脑的复制粘贴行为。
  • 证据
    Table 3 的列头是 B-2 | B-4 | MTR。PriorRG 在 Table 3 中的数据填的是 0.290 | 0.175 | 0.189
    对比 Table 1 中 PriorRG 的数据序列(B-1=0.290, B-2=0.220, B-3=0.175, B-4=0.189)。作者直接把 Table 1 中的 B-1 (0.290) 当成了 B-2 填进了 Table 3,把 B-3 (0.175) 当成了 B-4,把 B-4 (0.189) 当成了 MTR!连小数点后三位都一模一样的错位,实锤了数据的拼凑过程。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 4:大面积的表格留白与正文文本残缺(量产型学术)

  • 位置:Table 2, Table 4, Table 7, Table 9 / Section 4.1
  • 描述:论文在关键实验部分存在大量未完成的“半成品”现象。
  • 证据
    1. 空表格:Table 2(消融实验)、Table 4(Prior knowledge 消融)、Table 7(参数对比)、Table 9(性能对比)中,PriorRG 相关的核心数据行完全是空白的!只留下了表头和基线数据。
    2. 残缺正文:Section 4.1 (Implementation details) 中赫然写道:“the number of latents to, the maximum generation length to beam size to 3...”。连最基本的 Batch Size 等关键超参数数值都缺失,语法不完整。
      这显示出该论文可能是从某个未完成的 LaTeX 草稿或模板中强行扒下来凑数投稿的,严谨性极差。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 5:方法学描述存在严重的文本断层

  • 位置:Section 3.2 / Section 4.1 等多处
  • 描述:论文正文中存在大量丢失主语或断句的段落。
  • 证据:例如 3.2 节中:“To account for such projection-specific variations, we introduce a learnable view-position embedding...”,紧接着下一句直接变成了没有主语的动词开头:“ text encoder CXR-BERT (Boecking et al. 2022), followed by a projection head.”。类似的无头句子在全文(如 Datasets, Evaluation metrics 段落)中比比皆是,说明经过粗暴的文本删改或 AI 生成后未做校对。
  • 严重程度:🟡
  • 复核状态:✅ 成立

耿同学辣评

这篇论文简直是“薛定谔的表格”——你以为它在报告 SOTA,其实它在报告搞笑。Table 1 里 BLEU-4 居然比 BLEU-3 还高,这是直接违背了自然语言处理的基本法啊!更绝的是,摘要里吹牛说提升了 3.6%,表格里的数据却直接起飞翻了倍,甚至把上一个表的 B-1 错位粘贴成了下一个表的 B-2。半数的核心表格还是空白!怎么着,这是 ArXiv 挂号占座就算发表了,剩下的数据打算让我们读者用想象力来补全吗?

建议后续行动

  • 联系作者要求提供原始数据(虽然连表格都填不满,大概率提供不出)
  • 在 PubPeer 上提出质疑
  • 向 AAAI 2026 组委会及期刊编辑部举报
  • 向作者所在机构(西安电子科技大学)学术委员会举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。