ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
- 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
- 期刊:Medical Image Analysis (2025)
- DOI:未在文本中明确提供
- 论文来源:2312.13316v4.pdf
综合评定:✅ 清白
详细发现
发现 1:图片复用检测(一图多用)
- 位置:Figure 1 - Figure 6
- 描述:提取并检查了论文中所有的框架图(Fig 1, 3, 4)、数据统计图(Fig 2)以及特征可视化图(Fig 5, Fig 6)。
- 证据:这是一篇纯粹的计算机科学与深度学习论文,文中不包含任何 Western blot、凝胶电泳、显微镜图或流式细胞图等传统生物医学“湿实验”图片。所有的图表均为矢量绘制的设计图或通过算法生成的 T-SNE 降维图、Attention Map,不存在像素级复用或 PS 拼接的痕迹。
- 严重程度:✅ 无异常
- 复核状态:✅ 成立
发现 2:数据造假与统计学异常检测
- 位置:Table 4 - Table 11(各类下游任务评估指标与消融实验)
- 描述:审查了表中的 AUC、ACC、Dice、mAP 等核心指标,以及消融实验(Table 7, 8, 9)的数据升降逻辑。
- 证据:深度学习论文通常不报告带有标准差/标准误的重复实验数据,而是直接报告最优单次/平均指标。尽管如此,表格中的数据呈现出极其正常的机器学习特性:在 1%、10%、100% 的不同数据量下,性能指标的非线性爬升非常符合客观规律(如 Table 7 中 RSNA mAP 在 1% 到 10% 的暴涨,到 100% 时增益递减);消融实验中各模块带来的提升(0.2%~5% 不等)符合当前该领域的真实技术水平,没有出现反常的“完美线性递增”或“违背逻辑的暴跌”。未见 p-hacking 或末位数字规律性分布的迹象。
- 严重程度:✅ 无异常
- 复核状态:✅ 成立
发现 3:产出与时间线异常检测(耿同学重点关注项)
- 位置:文章头部日期信息、Section 4.4 (Implementation Details)、Section 3.1 (Context Distillation)
- 描述:论文的写作时间线、引用模型/技术的发布时间,以及宣称的硬件算力消耗是否存在“穿越”或不切实际的量产嫌疑。
- 证据:
- 时间线完全闭环:论文当前版本日期为 2025 年 6 月 7 日,发表于 2025 年的 Medical Image Analysis。文中提到使用
GPT-3.5-turbo和Vicuna7B进行上下文提取。这两个模型分别发布于 2022 年底和 2023 年初,与论文的研发和发表周期完全吻合,不存在“使用未来才发布的试剂/模型”的时间穿越问题。 - 算力消耗真实:论文在 4.4 节明确报告“在 4 张 A100 GPU 上预训练 120 个 epoch,耗时约 20 小时”。对于处理 37 万张 MIMIC-CXR 图像对的 ViT-B/16 模型而言,这个训练时长在 4 卡 A100 上是非常符合物理常识的,没有吹嘘“用极低算力短时间训练超大规模模型”的幻觉。
- 时间线完全闭环:论文当前版本日期为 2025 年 6 月 7 日,发表于 2025 年的 Medical Image Analysis。文中提到使用
- 严重程度:✅ 无异常
- 复核状态:✅ 成立
发现 4:方法学内部矛盾与逻辑自洽性
- 位置:Section 3.1 与 Section 3.2
- 描述:检查自定义的公式、超参数设定以及掩码策略在逻辑上是否能自洽。
- 证据:作者在公式 (3) 中设计了重平衡因子,为了解决文中提到的“阴性描述符与阳性描述符比例高达 20:1”的数据不平衡问题。根据这一前提,作者将 \(\lambda_{neg}\) 设定为 0.05(即 1/20),在数学和逻辑上做到了完美闭环。脚注 2 中也诚实地交待了请医学生评估 ChatGPT 提取准确率(93.6%)的细节,没有刻意隐藏大模型的出错率。
- 严重程度:✅ 无异常
- 复核状态:✅ 成立
耿同学辣评
当我的“ Western blot 查重火眼金睛”遇到一篇纯正的计算机视觉(CV)算法论文时,我的第一反应是:拔剑四顾心茫然——这论文里连只小鼠都没有,全是一堆代码公式和矩阵!但即便换上“AI 打假”的透镜,这篇论文依然稳如老狗:时间线严丝合缝,算力消耗符合物理规律,消融实验的数据涨跌极其真实(甚至有些地方的涨幅还相当保守克制)。经过对原文数据的严格复核,这不仅是一篇清白的论文,而且逻辑闭环做得相当漂亮,建议某些天天拿同一张电泳图糊弄人的生化环材“量产大师”们好好学学什么叫真正的科研严谨性!
建议后续行动
- 无需采取行动。未发现任何学术不端迹象,无需联系作者或编辑部。
- (可选)感兴趣的研究者可以访问其开源仓库
https://github.com/ToniChopp/ECAMP复现实验结果。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。