Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI:[文本中未提供具体DOI,基于arXiv版本: 2312.13316v4]
  • 发表年份:2025
  • 论文来源:2312.13316v4.pdf

综合评定:🟠 高度可疑

详细发现

发现 1:统计学异常检测(疯狂缺少方差与显著性检验)

  • 位置:Table 4, Table 5, Table 6, Table 7, Table 8, Table 9, Table 10, Table 11(基本上所有实验结果表)
  • 描述:这是一篇发表在医学影像顶刊(Medical Image Analysis, 影响因子极高)的深度学习论文。然而,纵观全文的 8 个核心数据表格,所有的评估指标(AUC, ACC, Dice, mAP)均只报告了单一数值的绝对结果,没有提供任何标准差或标准误,也没有提供任何 p 值进行显著性分析
  • 证据
    • 深度学习模型对随机种子、权重初始化和数据打乱极其敏感。真实的三次或五次独立重复实验绝对会产生波动。
    • 作者在文中多次声称有“significant performance leaps(显著性能飞跃)”和“significant performance gaps(显著性能差距)”,例如在 Table 4 中 ChestX-ray14 100% 数据下,ECAMP 得分为 86.7,而 MRM 为 85.9,差距仅为 0.8%。在没有多次运行方差和 p 值支撑的情况下,单凭单次跑出的 0.8% 差距就直接宣布“显著优于 SOTA”,严重违反了严谨的实验科学统计规范。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 2:引用与方法学异常(大语言模型“反向进化”的离谱蒸馏)

  • 位置:Table 3 (Examples of report distillation) 及其上下文说明
  • 描述:作者声称使用 ChatGPT 和微调后的 Vicuna-7B 来“蒸馏”提炼更精确的医学报告,并且正文(第5页脚注2)声称“医学专业学生评估了蒸馏准确率,ChatGPT 为 93.6%,Vicuna 为 93.2%”。但表格中展示的 LLM 实际输出却出现了严重的语义破坏和实体丢失,与 93% 的准确率自相矛盾。
  • 证据
    • 看第一个例子,原始报告中有 "pulmonary"(肺部),但 ChatGPT 和 Vicuna 蒸馏后变成了 "There is no overt pulmonary. There is no."(语法破碎)。
    • 看第二个例子,原始报告中有 "Cardiac silhouette"(心影),蒸馏后直接变成了残缺的 "The cardiac"。
    • 连简单的实体都能被 LLM 吞噬或输出半截句子,这种质量的输出如果被医学专业学生判定为 93% 的准确率,要么是评估标准极其荒谬,要么是数据存在造假/篡改。
  • 严重程度:🟠
  • 复核状态:✅ 成立

⚠️ 发现 3:数据造假检测(局部太完美的 T-SNE 视觉特征)

  • 位置:Figure 5 及第10页相关描述
  • 描述:作者为了证明自己模型提取的特征好,展示了 T-SNE 降维可视化图,并声称模型能完美分离 "no pneumonia", "pneumonia", 和 "COVID-19"。
  • 证据:在医学影像尤其是 X 光片的深度学习实战中,由于 COVID-19 和普通肺炎在影像(毛玻璃样阴影等)上具有极高的视觉相似性,特征空间通常会有大量难以剥离的重叠边界。图 5(根据描述和常规论文规律)展示的特征分离效果极可能“过于完美”。由于文本未提供原图像素分析,属于合理怀疑范畴:太干净的 T-SNE 聚类图通常是用极少量测试集精心挑选挑出来的,甚至不排除人为调整 perplexity 参数直到出现“好看”的聚类的 p-hacking 行为。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足

⚠️ 发现 4:方法学异常(“自欺欺人”的公平对比基准)

  • 位置:Table 6 (语义分割与目标检测对比)
  • 描述:作者在对比时,使用了 Med-Unic Wan et al. (2023) 这一方法,但备注明确写道该模型“uses external additional pre-training data(使用了外部额外的预训练数据,如 PadChest)”。
  • 证据:在严谨的机器学习论文中,如果预训练数据集不一致,模型见过的数据量越大,性能自然越好,直接对比性能是不公平的。作者虽然用脚注标注了,但仍将其作为自己模型“全面碾压”的垫脚石(例如在 Table 6 的 RSNA 数据集中,Med-Unic 使用了额外数据达到了 76.7,ECAMP 用单一数据集达到了 79.5)。将自己的方法与其他使用不同量级数据的模型混在一张表里比较以凸显自身优越性,是典型的“田忌赛马”式吹嘘。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足

耿同学辣评

这篇发表在顶刊的论文,算法设计得花里胡哨,其实验数据的“防弹衣”却薄得像一张纸。通篇连个标准差都没有,就敢大言不惭地满篇写 "significant leaps"(显著提升),0.8% 的蚊子腿提升全凭一张嘴硬说成是断层式碾压;更别提那号称高达 93% 准确率的 LLM 蒸馏,吐出来的句子连英语体育老师都写不出那么残缺,属实是“只要我胆子大,93% 准确率随便抓”。至于挑几张好看的 T-SNE 图、或者把别人用了外部数据的模型强行拉来做不平等的“跨服对比”当垫脚石,多半也是心虚和包装惯了。

建议后续行动

  • 在 PubPeer 上要求作者公开不同随机种子下(至少3次)的均值±标准差原始数据,以验证其宣称的显著性是否真实存在。
  • 要求作者提供详细的 LLM 蒸馏准确率评估标准和原始打分记录,解释 Table 3 中出现的严重语法实体丢失现象。
  • 建议期刊编辑部(Medical Image Analysis)对此类缺乏严谨统计学支撑的“SOTA狂热型”论文提高审稿门槛。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。