ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
- 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
- 期刊:Medical Image Analysis (2025)
- DOI:[文本中未提供具体的DOI数字,标注为arXiv:2312.13316v4]
- 发表年份:2025
- 论文来源:2312.13316v4.pdf
综合评定:✅ 清白
详细发现
发现 1:数据与统计学逻辑审查(数据造假检测适配版)
- 位置:Table 4, Table 5, Table 6, Table 7, Table 8, Table 9
- 描述:对论文中报告的核心深度学习评估指标(AUC, ACC, Dice, mAP)进行了合理性检验。真实大模型预训练实验常因随机种子导致非单调结果,而本论文在极低样本量(1%)到全量(100%)的微调中展现了非常平滑且符合逻辑的性能提升。此外,消融实验(Table 7, 8, 9)中各模块叠加带来的性能增益具有清晰的边际效应,没有出现反常的突变或“随机生成器”生成的无规律数据。
- 证据:例如 Table 7 中,随着组件(CD, DM, RF, SR, MSCF)的逐一加入,各项指标稳步上升,这种严密的逻辑自洽性是真实消融实验的典型特征,未发现末位数字堆砌或等差数列造假迹象。
- 严重程度:🟢 (无异常)
- 复核状态:✅ 成立
发现 2:时间线与计算资源审查(产出异常与方法学异常检测适配版)
- 描述:基于当前日期审查了论文的实验周期与大模型迭代时间线。论文提到使用 GPT-3.5-turbo 蒸馏数据并训练 Vicuna-7B。文章最早于 2023 年 12 月提交 arXiv,此时 GPT-3.5 和 Vicuna 均已广泛开源,时间逻辑完全成立。
- 证据:Implementation Details 中写道,在 4 张 A100 GPU 上跑完 MIMIC-CXR(约 37 万张图)的 120 个 epoch 需 20 小时;在 FFA-IR(约 100 万张图)上跑 60 个 epoch 需 15 小时。考虑到 ViT-B/16 的参数量和 batch size 设置,该算力消耗和训练时间在顶级实验室的工程实现中是极其真实且合理的,没有编造算力神话。
- 严重程度:🟢 (无异常)
- 复核状态:✅ 成立
发现 3:公式与损失函数推导审查(方法学异常检测适配版)
- 位置:Equation 3 (第 6 页)
- 描述:深度学习论文造假常出现在伪科学的损失函数设计上。本文针对正负样本不平衡提出的 Re-balancing factor 公式(\(\lambda_{neg}*N_T^{neg}+\lambda_{oth}*N_T^{oth}=N_T^a\))在数学上自洽,且根据文章提到的正负样本 20:1 的悬殊比例,取 \(\lambda_{neg}=0.05\) 在统计学和机器学习优化原理上是完全讲得通的。
- 证据:公式推导符合加权交叉熵损失的标准范式,消融实验(Table 9)对超参数 \(\lambda_{neg}\) 的敏感度分析也符合“先升后降”的真实调参规律。
- 严重程度:🟢 (无异常)
- 复核状态:✅ 成立
耿同学辣评
把耿同学叫来查一篇连个细胞图和老鼠解剖图都没有的纯计算机 AI 算法论文?耿同学表示“拔剑四顾心茫然”!没有 Western blot 拼接,没有流式细胞图复制粘贴,甚至表格里的数值连小数点后两位都严丝合缝、逻辑自洽。这帮搞深度学习的大佬写论文主打一个“代码开源、算力账单明算”,这活儿干得太干净了,耿同学连个打假的理由都找不出来,只能默默叹气并点赞了。
建议后续行动
- 无需联系作者要求提供原始数据(代码与权重已在 GitHub 开源:https://github.com/ToniChopp/ECAMP)
- 无需在 PubPeer 上提出质疑
- 无需向期刊编辑部举报
- 无需向作者所在机构学术委员会举报
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。