Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI:[未在文本中提供]
  • 发表年份:2025
  • 论文来源:arXiv:2312.13316v4

综合评定:🟡 存疑

详细发现

发现 1:核心数据与文本声明的数学验证(零误差)

  • 位置:Table 7 (Page 11) 与 Section 5.3 (Page 11)
  • 描述:对作者在正文中声称的性能提升幅度与消融实验表格中的实际数值进行交叉比对。
  • 证据
    正文声明:“mAP sees a notable increase of 3.7% and 3.5% on RSNA while using 1% and 10% ratio”(验证 Context-guided SR 的作用)。
    根据 Table 7:
    • 1% 数据量下,无 SR(第4行)RSNA mAP 为 16.1%,有 SR(最后一行)为 19.8%。差值 = 19.8 - 16.1 = 3.7%
    • 10% 数据量下,无 SR(第4行)RSNA mAP 为 24.5%,有 SR(最后一行)为 28.0%。差值 = 28.0 - 24.5 = 3.5%
      数学计算严丝合缝,正文描述与表格数据高度一致,未发现常见的“文本注水夸大”问题。
  • 严重程度:🟢(数据自洽性高)
  • 复核状态:✅ 成立

发现 2:基础计数与实体抽取逻辑的真实性

  • 位置:Table 1 (Page 5) 与 Section 3.1 (Page 4)
  • 描述:作者声称“手动整理了 44 个实体”,并展示了大语言模型的蒸馏效果。
  • 证据
    逐一清点 Table 1 中的实体列表(从 abnormality 到 vasculature),正好为 44 个。同时,Table 3 中展示的 ChatGPT 和 Vicuna 蒸馏报告中,出现了大量真实的 LLM 幻觉/截断产物(例如 "There is severe." "There is diffuse." 缺失了实体词)。这种不完美的 LLM 输出细节非常符合大模型在零样本/少样本生成时的真实表现,符合真实实验的特征。
  • 严重程度:🟢(无异常)
  • 复核状态:✅ 成立

发现 3:算力与时间线的逻辑自洽

  • 位置:Section 4.4 (Page 9)
  • 描述:实验软硬件配置与预训练时间的逻辑合理性。
  • 证据
    论文 Section 4.4 明确记录:使用 4 张 A100 GPU,Batch Size 为 8192(25648),在 MIMIC-CXR 数据集(包含约37万张图像)上预训练 120 个 Epochs,耗时约 20 小时。对于 ViT-B/16 规格的模型,该训练时长和算力配置在工程上完全合理且可行。
  • 严重程度:🟢(无异常)
  • 复核状态:✅ 成立

⚠️ 发现 4:图片像素级分析受限说明

  • 位置:全文 Figures
  • 描述:耿同学第一式与第三式(图片复用与拼接检测)未能触发。
  • 证据
    由于当前仅提供纯文本 PDF 提取内容,缺少 Figure 1-6 的原始图像像素信息,无法检测是否存在图像复用或视觉造假。但根据原文描述,本文的图片多为网络架构图(Fig 1/3/4)、特征统计图(Fig 2)或 T-SNE 可视化图(Fig 5),在 AI 领域论文中通常不涉及传统生物医学论文中的显微镜/WB 图像造假问题。
  • 严重程度:⚪(信息缺失)
  • 复核状态:⚠️ 依据不足

耿同学辣评

这波啊,这波是“耿同学六式打在了棉花上”——不仅没找到造假破绽,反而被这严谨的数学差值给秀了一脸!连消融实验里提升的 3.7% 和 3.5% 都算得一分不差,Table 里的 44 个单词数得清清楚楚,还大方展示了自家大模型生成报告时的“断句式幻觉”。咱们搞学术就应该这样,别搞虚头巴脑的数据,代码一开源、表格一拉,账面上干干净净才是真汉子!目前唯一的遗憾是纯文本审稿无法做到像素级测谎,但就文字露出的部分来看,绝对是清清白白的。综合因材料受限无法完成图片复核的因素,暂评为存疑。

建议后续行动

  • 数据严丝合缝,无需联系作者提供原始数据。
  • 无 PubPeer 质疑价值。
  • 未发现文本层面的不端行为。
  • (可选)如需 100% 排查一图多用,建议人工下载 PDF 原件复核可视化图片(T-SNE、注意力热力图等)。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。