Activating Associative Disease-Aware Vision Token Memory for LLM-Based X-ray Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Activating Associative Disease-Aware Vision Token Memory for LLM-Based X-ray Report Generation
- 作者:Xiao Wang, Fuling Wang, Haowen Wang, Bo Jiang, Chuanfu Li, Yaowei Wang, Yonghong Tian, Jin Tang
- 期刊:IEEE TRANSACTIONS ON *** (投稿预印本,未显示具体期刊名)
- DOI:未提供(预印本 arXiv:2501.03458v1)
- 发表年份:2025
- 论文来源:2501.03458v1.pdf
综合评定:🟠 高度可疑
详细发现
发现 1:核心方法与实现细节严重脱节(“究竟用了啥提取特征?”)
- 位置:Section III.B (Methodology) 与 Section IV.B (Implementation Details)
- 描述:论文在核心方法论部分明确写道:“Given the input X-ray imagex... we first adopt the Swin-Transformer [4] for the feature extraction.” 然而,在实验的实现细节部分,作者却写道:“The input X-ray images were resized... and divided into 16×16 patches, which were then fed into MambaXray-VL [3] for visual feature extraction.”
- 证据:Swin Transformer(基于CNN/局部窗口注意力)和 Mamba(基于状态空间模型 SSM)是两种架构完全不同的视觉主干网络。作者在自己提出的网络结构图(Fig. 2)中画的是 Swin,但在跑实验时却声称换成了参考文献 [3](即MambaXray-VL,2024年10月底刚挂上 arXiv 的模型)。这说明作者在写 Methodology 时可能存在复制粘贴过往论文草稿的痕迹,或者实验根本没有按照所写的框架去跑。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:低级文本复制粘贴痕迹(“连脚注都抄上了?”)
- 位置:Section IV.D (Analysis of different CAMs)
- 描述:在分析不同类别的 CAM 激活图时,正文表格上方出现了一个孤零零的上标数字
1,紧接着在下方有一行链接说明:1 https://github.com/jacobgil/pytorch-grad-cam。 - 证据:这是非常典型的直接从其他论文或模板中 Copy-Paste 带入的脚注残迹。这说明作者在拼接这篇论文时非常粗心,未对稿件进行基本的审阅校对,结合“发现 1”,进一步印证了论文方法论和实验部分存在拼接缝合的嫌疑。
- 严重程度:🟡
- 复核状态:✅ 成立
⚠️ 发现 3:图片复用与拼接检测受限
- 位置:全文 Figures (Fig 1-6)
- 描述:由于当前仅能获取纯文本信息,无法获取高分辨率的原始图片文件。
- 证据:文本中未提供足够的图片信息,无法进行像素级分析、WB blot 检测或流式细胞图噪点对比。但在深度学习论文中,特征图和生成报告的对比图较难做假,主要风险在于结构图的逻辑一致性(见发现1)。
- 严重程度:无法判断
- 复核状态:⚠️ 依据不足
发现 4:数据一致性核查
- 位置:Section IV.C (Comparison on Public Benchmark Datasets) 与 Tables I-III
- 描述:对文中宣称的提升幅度进行反算验证。
- 证据:文中称在 IU X-Ray 上 BLEU-4 比 R2GenGPT 提升 19.2%。根据表格,R2GenGPT 为 0.161,AM-MRG 为 0.192,(0.192-0.161)/0.161 ≈ 19.25%,数据自洽。MIMIC-CXR 的 F1 分数提升 19.5% 等描述也均能对上。这说明虽然模型架构描述出现了严重纰漏,但表格内的基础算术逻辑是完整的,数据本身“太完美”或“捏造随机数”的特征不明显。
- 严重程度:🟡
- 复核状态:✅ 成立
耿同学辣评
好家伙,这就是传说中的“精神分裂式”写论文吗?前面方法部分信誓旦旦说“我用的是 Swin Transformer 画的结构图”,到了实验部分一转眼“其实我偷偷塞了别人刚发出来的 Mamba”?如果实验真的是用 Mamba 跑的,那你整篇论文推导的 Hopfield 网络对接 Swin 输出的公式岂不是全在纸上谈兵?连别人的 GitHub 链接脚注都原封不动地复制进来,各位同学,写论文可长点心吧,Ctrl+C 和 Ctrl+V 的距离,往往就是学术不端的开始!
建议后续行动
- 联系作者要求提供完整的训练代码和日志,核实究竟使用了哪个视觉主干网络。
- 在 PubPeer 上提出质疑,要求作者澄清 Methodology 与 Implementation 之间的巨大矛盾。
- 督促作者在正式发表前进行极其严格的校对。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。