Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI/来源:arXiv:2312.13316v4 (文件名:2312.13316v4.pdf)
  • 发表年份:2025

综合评定:✅ 清白

详细发现

发现 1:无法进行像素级图片复用与拼接检测(图片缺失)

  • 位置:Figure 1 - Figure 6
  • 描述:本论文涉及大量框架图、T-SNE 降维可视化图(Figure 5)以及注意力热力图(Figure 6),这些通常是打假的重点关注对象。
  • 证据:由于当前仅有纯文本输入,未提供原始的高清图片文件或图片附件,无法使用图像反查工具或分析噪点/背景纹理。因此无法判断是否存在图片复用、PS拼接或局部翻转等违规操作。原文的 figure caption 证实了这些图片的存在(如 Fig. 5 提及 T-SNE visualizations,Fig. 6 提及 Cross-attention maps)。
  • 严重程度:⚪ 信息不足(非异常)
  • 复核状态:✅ 成立

发现 2:方法学与时间线逻辑自洽(无时间穿越现象)

  • 位置:Method (Section 3.1) / Implementation Details (Section 4.4)
  • 描述:论文提及使用 GPT-3.5-turbo API 和微调 Vicuna-7B 模型进行报告蒸馏,并使用 4 张 A100 GPU 训练 120 个 epoch 耗时约 20 小时。
  • 证据:原文 Section 3.1 明确提到“by using GPT3.5-turbo API... train a Vicuna7B”,Section 4.4 明确记载“runs for 120 epochs on 4 A100 GPUs, taking approximately 20 hours”。以当前日期为基准,GPT-3.5-turbo 与 Vicuna-7B 均在论文提交前已广泛开源使用。对于 ViT-B/16 规模的模型在 MIMIC-CXR 这种规模的数据集上,4 张 A100 跑 20 小时符合物理客观规律,未出现“使用了未来才发布的设备或模型”的时间线冲突。
  • 严重程度:🟢 正常
  • 复核状态:✅ 成立

发现 3:真实的数据“不完美性”(反而证明了真实性)

  • 位置:Table 3: Examples of report distillation
  • 描述:论文展示了 ChatGPT 和 Vicuna-7B 蒸馏医疗报告的示例。通常造假者会编造完美的 LLM 输出来佐证其方法的有效性,但这篇论文展示了非常真实的“幻觉”或“漏词”现象。
  • 证据:原文 Table 3 中,第一组数据原文为 "There is mild left base is seen...",Vicuna-7B 蒸馏为 "There is no definite focal.";在第二组数据中,ChatGPT 甚至输出了未完成的句子 "The cardiac"。这些典型的 LLM 生成瑕疵和截断被原封不动地写进了论文,不仅符合当前大语言模型在处理非标文本时的真实表现,也从侧面排除了“批量人工编造完美数据”的嫌疑。
  • 严重程度:🟢 正常
  • 复核状态:✅ 成立

发现 4:实验数据分布合理,未触发“随机数生成器”红旗

  • 位置:Table 4 ~ Table 11
  • 描述:对论文中的大量消融实验和对比实验数据(AUC, ACC, Dice, mAP)进行分布和逻辑检查。
  • 证据
    1. 梯度变化合理:在 Table 7 的消融实验中,单独去除全局或局部特征(MSCF 设为 ×)会导致对应任务的指标产生变化,符合多尺度特征融合的设计初衷。
    2. 小数点无规律:结果数值(如 Table 4 中的 81.9, 85.1, 86.7, 88.8 等)没有呈现整齐的阶梯状排列,末位数字 0-9 分布均匀,未发现 Excel 拖拽生成的痕迹。
    3. 超参数敏感性合理:Table 9 中测试了 \(\lambda_{neg}\) 从 0.025 到 0.5 的变化,指标呈现经典的“先升后降”的抛物线趋势(最佳点为 0.05),这非常符合深度学习超参数搜索的真实表现。
  • 严重程度:🟢 正常
  • 复核状态:✅ 成立

发现 5:统计报告缺失(AI领域通病,非造假)

  • 位置:全篇实验结果
  • 描述:所有实验表格均只报告了单一数值,未报告标准差(SD)或置信区间(CI),也未进行显著性检验(如 p-value)。
  • 证据:查阅原文 Table 4 至 Table 11,均仅报告了单一平均数值,无误差棒或显著性标记。虽然这属于 AI/CV 领域长期被诟病的“不够严谨”之处,但并不违背学术道德,属于该领域的常规报告模式。耿同学视角来看:虽然想挑刺说没有误差棒,但大家(顶刊/MIA)都是这么发的,不能单凭这个扣造假的帽子。
  • 严重程度:🟢 正常
  • 复核状态:✅ 成立

耿同学辣评

这篇论文不仅代码开源,还在 Table 3 里大方展示了 Vicuna 和 ChatGPT 那些“半截话”和“胡言乱语”的蒸馏结果,主打一个真诚!没有满篇完美无瑕的假数据,没有反人类的 GPU 训练时长,各种消融实验的曲线也十分符合物理规律。科研嘛,主打一个实事求是,你把大模型偶尔“犯蠢”的 log 都放上来,反倒让人觉得这活儿是真实干出来的。规矩,耿同学给你点个赞!

建议后续行动

  • 无需联系作者要求提供原始数据(基于现有文本信息未见异常)
  • 无需在 PubPeer 上提出质疑
  • 无需向期刊编辑部举报
  • 若后续获取了本论文的原始高清图片文件,可进一步进行像素级重叠与 PS 痕迹检测。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。