ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:2312.13316v4.pdf
- 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
- 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
- 期刊:Medical Image Analysis (2025)
- DOI:未在文本中明确提供(属于 arXiv 预印本/期刊接收版本)
综合评定:✅ 清白(基于文本与数据逻辑)
详细发现
发现 1:数据"不完美"恰恰证明了真实性
- 位置:Table 3 (Page 7) - Examples of report distillation
- 描述:在展示 ChatGPT 和 Vicuna-7B 提取报告的示例表中,原文报告存在拼写错误(如将 "effusion" 拼写为 "ffusion")。而在 AI 模型(特别是 Vicuna-7B)的生成结果中,这个拼写错误 "ffusion" 被原封不动地保留了下来(例如:"There is no pleural ffusion.")。
- 证据:学术造假者在编造或美化实验结果时,往往倾向于呈现“教科书般完美”的数据,通常会自觉或不自觉地修正拼写错误。这种模型忠实地继承了原始数据集中的脏数据(拼写错误)的现象,高度符合大语言模型真实的运行逻辑,是数据真实性的一个强有力的“反向”证据。
- 严重程度:🟢(真实性的证据)
- 复核状态:✅ 成立
发现 2:算力与时间线逻辑严密自洽
- 位置:Section 4.4 (Page 9-10) - Implementation Details
- 描述:作者声称在 MIMIC-CXR 数据集上使用 4 张 A100 GPU 训练 120 个 epochs,耗时约 20 小时。
- 证据:我们来验算一下作者的算力账单:单卡 Batch Size 设为 256,4 张卡通过梯度累加(步长为8),有效 Batch Size 达到了 256 × 4 × 8 = 8192。MIMIC-CXR 包含约 37 万张图像。这个级别的有效批次大小和训练轮次,在 4 张 A100 上跑 20 小时是非常符合物理常识和目前深度学习训练规律的。造假文章经常会出现“用一张笔记本显卡一夜跑完上百万数据”的荒谬时间线,本文在此经得起推敲。
- 严重程度:🟢(真实性的证据)
- 复核状态:✅ 成立
发现 3:消融实验文本与数据高度吻合
- 位置:Section 5.3 (Page 11) 与 Table 7
- 描述:耿同学向来强调,造假表格最容易在文本吹牛和具体数据的对不上号上露馅。本文在 5.3 节的消融分析中指出:“As listed in the 4th row and the last row of Table 7, employing context-guided SR provides performance gains from 83.0% to 86.3% and 92.3% to 95.0% on COVIDx.”
- 证据:核对 Table 7 的第 4 行(无 SR)和最后一行(有 SR),在 COVIDx 数据集 1% 和 10% 的列中,数值精确显示为 83.0->86.3 以及 92.3->95.0。耿老师拿着放大镜找了一圈,加减法毫无破绽,不仅文本与图表严丝合缝,各模块的递进增益也非常符合逻辑。
- 严重程度:🟢(真实性的证据)
- 复核状态:✅ 成立
发现 4:模型结构定义的术语轻微不规范
- 位置:Section 4.4 (Page 9) - Implementation Details
- 描述:文中提到:“We utilize an 8-layer ViT-B/16 ... as the backbone ... and a 4-layer ViT-B/16 for the image decoder.”(我们使用 8 层的 ViT-B/16 作为图像编码器,4 层的 ViT-B/16 作为解码器)。
- 证据:在计算机视觉领域,标准的 ViT-B/16 架构通常被定义为具有 12 层 Transformer 块。作者这里所谓的“8层ViT-B/16”在严格术语上是不规范的,大概率是从标准的 12 层模型中截取了前 8 层,或者使用了非标准的配置。这属于方法学描述上的瑕疵或实验室内部的俗称,虽不构成学术不端,但容易引起读者的困惑。
- 严重程度:🟡(方法学描述瑕疵)
- 复核状态:✅ 成立
耿同学辣评
各位同学,这论文看着真让人提神!虽然耿老师拿着放大镜想找点数据造假的蛛丝马迹,比如验算一下 Batch Size 的乘法,或者看看文本和表格的差值对不对得上,结果人家全算对了。最逗的是,表 3 里的 AI 模型连医生原报告里 "effusion" 拼错成 "ffusion" 的毛病都原样复刻了——这哥们儿是真把大模型跑出来的傻乎乎的结果直接贴上去了,连美颜滤镜都没开,主打一个“真诚”。这种保留了“粗糙真实感”的论文,相比于那些 P 得连误差线都完美对称的“学术神作”,可信度要高得多!
建议后续行动
- 无需联系作者要求提供原始数据(文本逻辑严密,无明显造假动机与痕迹)
- 无需在 PubPeer 上提出质疑
- 文本中未提供足够的图片信息,无法进行像素级分析(建议未来若有他人针对其架构图或 T-SNE 图进行复核,可重点关注)
- 若需精益求精,可建议作者澄清文中 ViT-B/16 具体的截断/层级设定。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。