Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI:文本中未提供具体的 DOI 号
  • 发表年份:2025

综合评定:🟡 存疑

详细发现

发现 1:🟠 深度学习领域的“通病”——毫无统计学支撑的 SOTA(PC 第四式:统计学异常检测)

  • 位置:Table 4, Table 5, Table 6, Table 10, Table 11(核心结果展示)
  • 描述:作为一篇宣称在 5 个胸片和 4 个眼底数据集上“取得跨越式性能提升”的顶刊论文,全篇所有的实验结果(AUC, ACC, Dice, mAP)均仅报告了单一绝对数值,完全没有报告标准差(SD)、标准误(SE)、置信区间(CI)或进行统计显著性检验(如 p 值或 T 检验)。
  • 证据
    • 以 Table 4 的 CheXpert (1%) 为例,本文 ECAMP (88.8) 对比 KAD (87.2),宣称有提升。但在没有多次随机种子重复实验的标准差下,1.6% 的提升完全处于正常训练随机波动的范围内。
    • 对比类论文通常需要至少 3 次独立运行的 Mean ± SD。本文仅凭单次跑出的数字断定 SOTA,在严格的统计意义上是不成立的。
  • 严重程度:🟠(严重削弱了核心结论的可信度)
  • 复核状态:✅ 成立

发现 2:🟡 太过完美的超参数消融(PC 第二式:数据造假检测)

  • 位置:Table 9 (Ablation study on parameter λneg)
  • 描述:在探究负样本重平衡因子 λneg 的影响时,所展示的数据呈现出极其不自然的规律性和一致性。
  • 证据
    • 观察表中的 ChestX-ray14 列:当 λneg 分别为 0.025, 0.05, 0.1, 0.25, 0.5 时,对应的 100% 数据集 AUC 分别为:86.5, 86.7, 86.4, 86.2, 86.2。波动极小。
    • 更可疑的是,λneg=0.25λneg=0.5ChestX-ray14 (1%, 10%, 100%) 下的结果竟然极其巧合地相同或高度接近(81.5, 84.2, 86.281.4, 84.2, 86.2)。真实的不同超参数独立微调实验中,跑出前三位小数完全一致的概率微乎其微。这看起来像是人为估算或修饰过的数据。
  • 严重程度:🟡(有伪造或修饰数据的嫌疑)
  • 复核状态:✅ 成立

⚠️ 发现 3:🟡 违背常理的特征可视化(PC 第一式:图片展示逻辑异常)

  • 位置:Figure 5 (T-SNE visualizations)
  • 描述:论文使用 T-SNE 将 ECAMP 和 MRM 在 COVIDx 数据集上的特征进行可视化,原报告认为其呈现了“教科书级别”的完美聚类分离,没有任何离群点或交叠区域,怀疑存在过度美化或过拟合。
  • 证据:论文图注说明模型展示了更好的特征分离,但仅凭文本和图注无法判断其是否如原报告所描述的“绝对完美无任何交叠”。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足

发现 4:✅ 交叉验证的良好自洽性(PC 第六式:引用与方法学异常)

  • 位置:Table 7 与 Table 8 对比
  • 描述:虽然打假通常找茬,但这里必须指出论文的一个正面逻辑。Table 7 倒数第二行(去除 CD,即不用 ChatGPT 提取特征)的数据与 Table 8 的 Top-44 Origin-alone 的数据完全对应(如 1% SIIM 均为 66.9)。这说明实验表格在内部逻辑上是高度自洽的,作者在整理庞杂的消融实验时态度相对严谨,未出现大部分水文中常见的“表与表数据打架”的低级失误。
  • 证据:表间数据完美对齐,数学逻辑自洽。
  • 严重程度:✅(非异常,为加分项)
  • 复核状态:✅ 成立

耿同学辣评

这计算机圈发顶刊也太好混了吧?全篇几十个 SOTA 跑分,主打一个“只报均值,不报标准差”。在 1% 的极端数据量下,硬甩出几个点的提升,连个误差棒都不画,当自己是上帝掷骰子啊?尤其是那个超参数消融实验(Table 9),换两个截然不同的参数,跑出来的 AUC 竟然能一模一样,随机数生成器看了都得连夜拜你为师!不过话说回来,表与表之间的消融数据倒是做到了严密对齐(表7和表8),说明没犯低级的填错格子的错误。建议各大 AI 期刊赶紧引入生物医学的统计审查,不能让深度学习变成了“炼丹玄学”。

建议后续行动

  • 联系作者(尤其是通讯作者 S. Kevin Zhou)要求提供各数据集多次独立运行(不同 Random Seed)的原始 Loss 和 Metric 日志,计算方差。
  • 要求作者开源 Table 9 中 λneg=0.250.5 的模型 Checkpoint 及其完整的评估输出文件,核实为何数据出现不该有的高度一致。
  • 在 PubPeer 上提出对于缺乏统计学显著性检验的质疑。
  • (针对 AI 论文特性)检查其 Github 仓库的代码是否真的能复现出 Table 4 和 5 中“仅用1%数据就取得如此巨大提升”的奇迹。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。