Loading...
正在加载...
请稍候

ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
  • 作者:Rongsheng Wang, Qingsong Yao, Zihang Jiang, Haoran Lai, Zhiyang He, Xiaodong Tao, S. Kevin Zhou
  • 期刊:Medical Image Analysis (2025)
  • DOI:未在文本中明确提供
  • 发表年份:2025
  • 论文来源:2312.13316v4.pdf

综合评定:🟡 存疑

详细发现

发现 1:数据造假与统计学异常检测

  • 位置:Table 4, Table 5, Table 7, Table 8, Table 9
  • 描述:对论文中报告的核心分类、分割、检测指标,以及消融实验数据进行了末位数字分布和趋势逻辑分析。
  • 证据
    1. 末位数字分布:提取表4中ECAMP及各对比方法的AUC/ACC数值,末位数字(0-9)分布均匀,未发现人为编造数据常见的“集中于5/0”或过度规律现象。
    2. 增量逻辑:在表7和表8的消融实验中,随着训练数据比例的增加(1% -> 10% -> 100%),性能呈现合理的边际递减效应(即涨幅放缓),完全符合深度学习模型的正常训练逻辑。
    3. 自洽性:不同表格间报告的Baseline(如MRM、GLoRIA)数据基本保持一致,未发现为了突显自身而过度贬低Baseline的明显异常。
  • 严重程度:🟢 无异常
  • 复核状态:✅ 成立

发现 2:引用与方法学异常

  • 位置:Section 3.1 (Context Distillation), Section 4.4 (Implementation Details)
  • 描述:审查了论文使用大语言模型进行数据蒸馏的工程合理性和时间线。
  • 证据
    1. 时间线合理性:论文发表于2025年,其预印本初版时间为2023年底。使用GPT-3.5-turbo进行上下文蒸馏并微调Vicuna-7B作为本地蒸馏器,符合当时AI领域的工程常识和技术发展节点。
    2. 方法学逻辑:使用GPT API生成1万条数据作为种子,再训练本地小模型处理剩余几十万条MIMIC-CXR数据,这是大模型时代非常标准且合理的低成本数据扩展策略,逻辑自洽。
    3. 损失函数公式严谨性:Equation 3 中的权重分配逻辑在数学上能够保证总损失的尺度不发生偏移,方法学描述过关。
  • 严重程度:🟢 无异常
  • 复核状态:✅ 成立

⚠️ 发现 3:图片复用与拼接检测(局限性声明)

  • 位置:Figure 1 ~ Figure 6
  • 描述:尝试对论文的框架图、T-SNE图、热力图等进行视觉层面的伪造筛查。
  • 证据:由于仅凭借纯文本无法进行像素级别的比对、噪点分析和PS边界检测,无法在此维度给出绝对定论。但就文本描述和框架逻辑(如Figure 4的梯度回传设计)来看,图表内容与方法描述高度一致,未发现明显的图文矛盾。
  • 严重程度:🟡 无法判断(受限于纯文本检测)
  • 复核状态:⚠️ 依据不足

发现 4:代码与开源验证

耿同学辣评

这活儿干得相当漂亮!无论是用ChatGPT“套话”提炼病历重点,还是精心设计的遮掩策略,都属于AI界“合法开挂”的典范。公式推导没破绽,消融实验做得满满当当,末位数字也完全没有“随机数生成器”的塑料味,核心文本和实验数据上没有发现任何造假嫌疑。唯一的小遗憾是,由于缺乏原始像素图片,目前无法对论文的图表进行视觉查重,因此综合评定暂时保持谨慎的“存疑”态度。但总体来看底盘很稳,建议某些天天搞PS拼图糊弄人的“水神”们好好学学什么叫专业!

建议后续行动

  • 联系作者要求提供原始数据
  • 在 PubPeer 上提出质疑
  • 向期刊编辑部举报
  • 呼吁网友提供论文原图,以补充视觉层面的查重验证
  • 暂排除文本与数据层面的造假嫌疑,正常参考其学术观点

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。