ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
- 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
- 期刊:Medical Image Analysis (2025)
- DOI:未在文本中明确提供(arXiv 预印本编号:2312.13316v4)
- 发表年份:2025
- 论文来源:2312.13316v4.pdf
综合评定:✅ 清白
详细发现
发现 1:实验设备与算力时间线验证(第六式:引用与方法学异常)
- 位置:Section 4.4 Implementation Details
- 描述:论文声称在 MIMIC-CXR 数据集(377,110 图像+文本对)上使用 4 张 A100 GPU,以有效 batch size 为 8192 训练了 120 个 epoch,耗时约 20 小时。在 FFA-IR 数据集上训练 60 个 epoch 耗时约 15 小时。
- 证据:原文 Section 4.4 明确指出:“our framework runs for 120 epochs on 4 A100 GPUs, taking approximately 20 hours. The training batch size is set to 256 for each GPU, and we utilize a gradient accumulation step of 8. Consequently, the effective batch size reaches 8,192.”。数学逻辑自洽(256 batch * 4 GPUs * 8 accumulation steps = 8192),算力消耗符合 ViT-B/16 架构在 4 张 A100 上的真实吞吐量。
- 严重程度:✅ 合理
- 复核状态:✅ 成立
发现 2:大语言模型时间线与引用验证(第六式:引用与方法学异常)
- 位置:Section 3.1 Context Distillation / Section 4.4
- 描述:论文使用 GPT-3.5-turbo API 和微调的 Vicuna-7B 模型对 2019 年的 MIMIC-CXR 数据集报告进行蒸馏。论文标注的当前日期基准为 2026 年,发表于 2025 年。
- 证据:原文 Section 3.1 提及使用 ChatGPT (GPT-3.5-turbo) 和 Vicuna7B (Chiang et al., 2023) 进行上下文蒸馏。这些前序大语言模型在 2022-2023 年发布,发表于 2025 年的论文使用它们完全符合时间逻辑,且引用规范,无“时空穿越”嫌疑。
- 严重程度:✅ 合理
- 复核状态:✅ 成立
发现 3:AI 论文的数据分布特征验证(第二式:数据造假检测)
- 位置:Tables 4, 5, 6, 7, 8, 9, 10, 11
- 描述:表格中汇报了大量的 AUC, ACC, Dice, mAP 指标,涵盖不同比例(1%, 10%, 100%)的微调数据集。
- 证据:审视原文中提供的所有表格数据,未出现“过于完美”的等差数列或违背常理的突变。消融实验(Table 7, 8, 9)中,去掉核心模块后性能下降的幅度(如 0.5%~3% 不等)非常符合深度学习领域真实的模块贡献率分布,末位数字杂乱无章,没有人工编造数据的痕迹。
- 严重程度:✅ 合理
- 复核状态:✅ 成立
发现 4:图像与排版分析受限说明(第一/三式:图片复用/拼接检测)
- 位置:Figure 1 ~ Figure 6
- 描述:由于本次检测输入仅为文本提取内容,无法获取图像的原始像素矩阵。
- 证据:根据原文的图文描述,本文包含架构图(Fig 1/3/4)、T-SNE 可视化图(Fig 5)以及交叉注意力热力图(Fig 6)。从文本描述来看,这些可视化图表用于辅助说明模型的表征学习效果,符合纯计算机视觉与深度学习论文的常规呈现方式,未发现文本层面描述的相互矛盾。
- 严重程度:✅ 暂无异常
- 复核状态:✅ 成立
耿同学辣评
今天咱们不看 WB 图,来看看 AI 炼丹炉里的数据是不是注水了。这篇论文可以说是“根正苗红”的 AI 算法 paper,没有湿实验那些移花接木的 PS 痕迹。4 张 A100 炼丹 20 小时的账算得清清楚楚,消融实验的涨点也是一步一个脚印。咱们打假最怕遇到那种“凑出来”的完美数据,但这篇论文的指标分布有着 AI 训练特有的“玄学”粗糙感——这就对了,真实世界哪有那么多完美闭环!
建议后续行动
-
联系作者要求提供原始数据(论文已提供 GitHub 开源链接:https://github.com/ToniChopp/ECAMP) - 在 PubPeer 上提出质疑(不需要,未发现异常)
- 向期刊编辑部举报(不需要,未发现异常)
- 向作者所在机构学术委员会举报(不需要,未发现异常)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。