Activating Associative Disease-Aware Vision Token Memory for LLM-Based X-ray Report Generation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Activating Associative Disease-Aware Vision Token Memory for LLM-Based X-ray Report Generation
- 作者:Xiao Wang, Fuling Wang, Haowen Wang, Bo Jiang, Chuanfu Li, Yaowei Wang, Yonghong Tian, Jin Tang
- 期刊:IEEE TRANSACTIONS ON *** (2025早期录用/预印本)
- DOI:未提供
- 发表年份:2025
- 论文来源:2501.03458v1.pdf
综合评定:🟠 高度可疑
详细发现
发现 1:核心数学公式与维度存在致命自相矛盾(降维打击式的数学错误)
- 位置:Page 5, 公式 (2) 及其上下文描述
- 描述:论文在第三部分(C. Associative Memory Augmented Features)声称,Modern Hopfield Network(MHN)的输入查询特征 \(f_i \in \mathbb{R}^{768}\),而更新后的输出特征 \(f^*_i \in \mathbb{R}^{4096}\)。然而在公式 (2) 定义的能量函数 \(E(f^*_i) = \|f^*_i - f_i\|^2 - ...\) 中,直接对 768 维的 \(f_i\) 和 4096 维的 \(f^*_i\) 进行了减法操作(L2范数计算)。
- 证据:原文明确写道“Given a query feature \(f_i \in \mathbb{R}^{768}\)... maps the query to an updated feature \(f^*_i \in \mathbb{R}^{4096}\)”,并在公式(2)中列出 \(E(f^*_i) = \|f^*_i - f_i\|^2 - \beta \log \dots\)。在数学和线性代数中,不同维度的向量无法直接相减求范数。这说明作者要么是直接从其他论文(可能是处理4096维特征的代码或论文)里复制粘贴了公式却忘记修改维度,要么根本没搞懂自己模型的张量流。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:方法描述与实现细节严重脱节(“挂羊头卖狗肉”式写论文)
- 位置:Section III.B (Page 4) 与 Section IV.B (Page 6)
- 描述:在方法介绍部分(III.B),作者信誓旦旦地写道:“we first adopt the Swin-Transformer [4] for the feature extraction”以及“we divide the X-ray image into 196 non-overlapping patches”。然而在实验的实现细节部分(IV.B),作者却突然改口:“...fed into MambaXray-VL [3] for visual feature extraction”。
- 证据:原文 Page 4 确实写了 "we first adopt the Swin-Transformer [4] for the feature extraction";而 Page 6 确实写了 "which were then fed into MambaXray-VL [3] for visual feature extraction"。Swin Transformer 与 MambaXray-VL 是两套完全不同的底层架构,这种前后矛盾的写法极大概率是拼凑实验结果时出现的低级失误,存在学术不端预警信号。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:消融实验的“Baseline”强得离谱(数据造假检测)
- 位置:Table IV (Page 8) 与 Table II (Page 7)
- 描述:在消融实验(Table IV)中,作者团队自己的 Baseline 模型(未使用V-Hopfield和R-Hopfield)在 MIMIC-CXR 数据集上的 Precision, Recall, F1 分别达到了 0.539, 0.396, 0.458。
- 证据:根据原文 Table II,对比的所有SOTA模型中表现最好的 CoFE (ECCV 2024) 的 F1 仅仅只有 0.405。而作者自己最基础的 Baseline 在 Table IV 中的 F1 竟然达到了 0.458,超越了所有已知顶尖方法 5% 以上。这在深度学习研究中极度不符合常理,作者极有可能在 Baseline 中偷用了未公开的预训练权重,或者直接对 CE 指标数据进行了人为拔高。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 4:模板化痕迹严重(量产型学术特征)
- 位置:全文多处,如 Section IV.C 和 Section IV.D
- 描述:文章行文充满了一种“填空式”的机械感。例如在描述表格时:“The table clearly indicates that...”,“As depicted in Table...”,“In our experimental setup...”。大量关于 Hopfield Network 优越性的描述更像是套话,缺乏针对具体 X-ray 特征空间的实质性分析。
- 证据:行文风格与套路化语言属于主观判断,缺乏明确可以定性为学术造假的具体原文硬证据,仅能作为辅助疑点。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
⚠️ 发现 5:无法进行像素级图片打假(信息缺失)
- 位置:Figure 1 ~ Figure 6
- 描述:文本中未提供足够的原始图片像素信息,无法进行第一式(一图多用)和第三式(PS拼接痕迹)的深度像素级检测。
- 证据:基于纯文本确实无法对图片视觉元素进行像素级判断,原文仅在 Figure caption 及正文中提及了部分图片展示的内容(如热力图、生成报告对比等),无法作为实质性造假依据。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足
耿同学辣评
这篇论文简直是典型的“缝合怪”大翻车!前脚在方法里写用了 Swin-Transformer,后脚在实验里就变成了 MambaXray-VL,合着你们的代码会七十二变是吧?更离谱的是公式里 768 维的向量硬生生减去 4096 维的向量,这已经不是学术造假的问题了,这是基本的高维线性代数没及格啊!另外,自己不带任何创新模块的 Baseline 居然能碾压所有人公开的 SOTA,把指标当成橡皮泥随便捏是吧?拿着连数学公式都算不对、前后逻辑打架的“水稿”来发 IEEE Transactions,真当审稿人和读者是不懂代码的吃瓜群众吗?建议作者赶紧把论文撤回,先去重修一下矩阵论再回来搞科研吧!
建议后续行动
- 联系作者要求提供原始数据及代码(特别是核实到底是 Swin 还是 Mamba 提特征)
- 在 PubPeer 上提出质疑(要求作者对公式(2)的维度不匹配进行公开解释)
- 向期刊编辑部举报(指出其核心方法与公式存在不可调和的学术矛盾)
- 要求作者公开 Baseline 的训练日志与预训练权重来源
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。