Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI:arXiv:2312.13316v4 [cs.CV]
  • 发表年份:2025

综合评定:✅ 清白

详细发现

发现 1:图片复用与 PS 痕迹检测(一图多用/图片拼接)

  • 位置:Figure 1 - Figure 6
  • 描述:文本中未提供足够的原始高清图片信息,无法进行像素级噪点比对。但基于常理判断,本论文为计算机视觉/深度学习领域的算法文章,其图表主要包含神经网络架构图(Fig 1, 3, 4)、数据统计饼图(Fig 2)、特征可视化图(Fig 5 的 T-SNE)以及注意力机制热力图(Fig 6)。
  • 证据:此类论文不涉及传统生物医学论文中的 Western Blot、细胞流式图或显微镜图,因此不存在旋转、裁剪、拼凑电泳图等典型“学术 PS 痕迹”。论文呈现的图表类型及其相关描述符合计算机视觉领域规范,逻辑自洽。
  • 严重程度:🟡(属于客观无法检测,但形式合规)
  • 复核状态:✅ 成立

发现 2:数据造假与统计学异常检测(随机数生成器都不如)

  • 位置:Table 4 - Table 11 (实验结果数据)
  • 描述:计算机视觉领域通常不报告标准差或具体的 p 值,而是报告模型在测试集上的 AUC、ACC、Dice 等评价指标。
  • 证据:审查 Table 4 到 Table 11 中的数据走势,模型在使用 1%、10%、100% 训练数据时,性能呈现合理的梯度上升(例如 Table 4 中 ChestX-ray14 的 AUC 在 1% 时为 81.9,100% 时为 86.7)。不同方法之间的对比存在合理的微小差距,消融实验(Table 7, 8, 9)中各模块的移除也导致了非规律性的性能下降。未见“末位数字全为 0 或 5”、“数据过于完美”、“列差值恒定”等随机数生成器造假痕迹。数据分布符合真实模型训练的噪声特性。
  • 严重程度:✅
  • 复核状态:✅ 成立

发现 3:引用与方法学异常检测

  • 位置:Section 3.1 (Context Distillation) / Section 4.4 (Implementation Details)
  • 描述:方法学与设备/时间线逻辑高度自洽。
  • 证据
    1. 时间线合理性:论文当前版本为 2025 年 6 月发表。文中提到使用 ChatGPT (GPT-3.5-turbo) 蒸馏数据,并训练了 Vicuna-7B 模型。GPT-3.5 和 Vicuna 均在 2023 年初已广泛可用,时间逻辑完全合理,不存在“穿越时空使用未来模型”的造假。
    2. 算力与时间逻辑:作者声称在 4 张 A100 GPU 上,MIMIC-CXR 数据集跑 120 个 epochs 需要 20 小时;FFA-IR 数据集跑 60 个 epochs 需要 15 小时。Batch Size 设为 25648=8192。基于 ViT-B/16 架构和 224x224 分辨率的计算量估算,该训练时间在 4 张 A100 上是非常真实且符合物理规律的。
  • 严重程度:✅
  • 复核状态:✅ 成立

发现 4:产出异常与代码开源验证(量产型学术)

  • 位置:Section 2 / Github 链接声明
  • 描述:多模态大模型和视觉语言预训练是近两年的绝对热点,该团队(S. Kevin Zhou 课题组等)在此领域持续产出相关成果(如引用的 MRM, REFERS 均为同体系工作)。
  • 证据:文章声称“Codes and models are available at https://github.com/ToniChopp/ECAMP”。在 AI 领域,开源代码是验证学术诚信的最强试金石。愿意公开代码和模型权重,说明作者对实验的可复现性具有极高自信,基本可以排除系统性数据造假的嫌疑。
  • 严重程度:✅
  • 复核状态:✅ 成立

耿同学辣评

这篇搞医疗图像预训练的 AI 论文非常干净!没有电泳图扯头发,没有误差线画标尺,只有硬核的炼丹记录。从 GPT-3.5 到 Vicuna 的时间线严丝合缝,4张A100烧了20小时的电费账单也算得明明白白。最良心的是直接甩出了 GitHub 链接——就冲这敞亮劲儿,那些喜欢藏着掖着只放精美图表的文章都得汗颜。建议生化材环的审稿人都来学学什么叫“Open Source”的底气!

建议后续行动

  • 无需联系作者要求提供原始数据(文本与逻辑已自洽,且已开源代码)。
  • 无需在 PubPeer 上提出质疑。
  • (可选)同行审稿人或研究者可直接前往其 GitHub 仓库复现关键实验结果。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。