Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 论文来源:2312.13316v4.pdf
  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI:文本中未提供
  • 发表年份:2025

综合评定:🟠 高度可疑

详细发现

发现 1:方法学展示与逻辑自相矛盾(严重文本异常)

  • 位置:Table 3 (Page 7)
  • 描述:表3展示了Context Distillation(上下文蒸馏)的效果,但其展示的ChatGPT和Vicuna-7B输出结果存在明显的文本损坏,且直接违背了表2中定义的Prompt规则和脚注2中声称的准确率。
  • 证据
    1. 文本截肢现象:表中多处出现“pleural ffusion”、“severe ffuse”、“di ffuse”等残缺词汇。这是典型的PDF连字复制粘贴错误(如 ffi 连字丢失),说明作者在制作论文图表时极其敷衍,直接复制了乱码文本。
    2. 违反Prompt设定与常理:表2的Prompt明确要求“不要生成其他单词”,格式必须是“There is [a] [b]”。但表3中,ChatGPT的输出居然出现了“There is status post CABG with aligned median sternotomy wires”(一长串非格式化文本),甚至出现了无实体的半截话“There is severe.”、“There is no.”。
    3. 自相矛盾的准确率:脚注2声称医学系学生评估ChatGPT的蒸馏准确率高达93.6%。但如果模型在真实评估中大量输出“There is severe.”这种缺少主语(实体)的无意义半句话,是不可能获得93.6%准确率的。这说明表3要么是伪造的展示样例,要么真实数据清洗存在灾难级的Bug(实体被正则匹配或脚本误删)。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:异常的性能提升跳跃(小样本奇迹)

  • 位置:Table 4 & Table 5 (Page 8)
  • 描述:在COVIDx数据集的Linear-probe(线性探针)和Fine-tune实验中,ECAMP在使用1%极少量数据的情况下,性能呈现出与对比方法极不协调的巨大跨越。
  • 证据:以Table 5 (Linear-probe) 的1%数据为例,ECAMP达到了86.3%的ACC,而对比的强基线方法MRM(79.8%)、Med-UniC(76.5%)、MGCA(74.8%)等均在70-80%之间徘徊。在1%标注(即仅几百张图片)的线性分类下,能拉开近7-10%的绝对差距,在医学图像预训练领域极为罕见。虽然不能直接断定数据造假,但这种“一骑绝尘”且缺乏充分消融解释的拉升,通常需要警惕是否存在数据泄露或特定的trick。
  • 严重程度:🟡
  • 复核状态:✅ 成立

发现 3:引用与术语规范瑕疵

  • 位置:Section 3.1 (Page 5) & Reference
  • 描述:作者将ChatGPT的引用标注为“ChatGPT Brown et al. (2020)”。
  • 证据:Brown et al. (2020) 实际上是GPT-3的论文。ChatGPT(以及论文中自己提到的GPT-3.5-turbo)是2022-2023年发布的基于InstructGPT/RLHF微调的模型,并非GPT-3本身。虽然这是AI圈常见的“偷懒引用”,但严谨性堪忧。
  • 严重程度:🟡
  • 复核状态:✅ 成立

⚠️ 发现 4:图片复用与拼接检测

  • 位置:全文 Figures
  • 描述:无法进行像素级分析。
  • 证据:文本中未提供足够的原始图片分辨率信息,无法进行Western Blot或显微图的PS痕迹和复用比对。但从现有的T-SNE图(Fig 5)和注意力机制图(Fig 6)的描述来看,未发现明显逻辑冲突。
  • 严重程度:ℹ️ 无法判断
  • 复核状态:⚠️ 依据不足

耿同学辣评

用大模型清洗数据,结果连基础的 effusion(积液)都被截肢成了 ffusion,ChatGPT被迫跟着输出了一堆“无头无尾”的半截话,这就叫“精准蒸馏”?自己声称准确率93.6%,难道医学影像界的新规定是:只要语气像个老中医,没有主语的诊断就是最高境界?这篇论文的数学公式写得天花乱坠,结果在最基本的文本展示环节翻了车,这图表排版简直是主打一个“只要有数字就行,字母无所谓”。

建议后续行动

  • 联系作者要求提供原始数据(特别是 Table 3 中被清洗后的 10,000 条 ChatGPT 原始输出日志,验证是否真的存在大量实体丢失的半截话)。
  • 在 PubPeer 上提出质疑(重点询问 Table 3 中破损的文本和与 Prompt 规则相悖的输出是如何产生的)。
  • 向期刊编辑部举报(指出其图表存在严重的数据呈现错误或伪造样例嫌疑,要求核查其实际代码逻辑)。
  • 要求作者开源 Table 3 对应的完整清洗脚本和 prompt 运行日志。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。