Loading...
正在加载...
请稍候

ASAP: Advancing medical volumetric representation learning with anatomy-aware semantically-adaptive pre-training

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:ASAP: Advancing medical volumetric representation learning with anatomy-aware semantically-adaptive pre-training
  • 作者:Rongsheng Wang, Fenghe Tang, Zihang Jiang, Yingtai Li, Xu Zhang, Haoran Lai, Wenxin Ma, Wei Wei, Zhiyang He, Xiaodong Tao, Rui Yan, Qingsong Yao, and Shaohua Kevin Zhou
  • 期刊:arXiv preprint (arXiv:2606.00602v1 [cs.CV])
  • DOI:N/A
  • 发表年份:2026 (提交日期:2026年5月30日)

综合评定:🟠 高度可疑

详细发现

发现 1:数据造假检测(随机数生成器都不如)

  • 位置:Table 2, Table 3, Table 4, Table 8 等
  • 描述:本文报告了大量的深度学习多次重复实验(明确声称“所有实验均使用不同的随机种子重复五次,并报告均值和标准差”)。然而,在多个核心图表中,本文模型(ASAP)的标准差(SD)出现了大量极其不自然的 ±0.0±0.1
  • 证据
    • Table 2 为例,ASAP 的成绩出现了 83.5 ± 0.0, 84.1 ± 0.0, 86.1 ± 0.0, 79.0 ± 0.0 等数值。在 3D 医学图像分析(尤其是 CT-RATE 等真实临床数据集)中,使用不同随机种子跑 5 次深度学习模型,AUC 或 ACC 的方差不可能为 0.000(即精确到小数点后一位完全不发生变化)。这违背了 GPU 浮点运算、Dropout/DropMask 以及 Shuffle 的基本物理和数学规律。
    • Table 4 中更是出现了 81.3 ± 0.0 (STOIC-2021 10%), 85.6 ± 0.0 (1%), 82.2 ± 0.1 (10%) 等夸张的数据。真实实验中,五次独立运行的均值的方差往往至少在 0.2~1.5 之间波动。
  • 严重程度:🔴
  • 复核状态:✅ 成立

发现 2:统计学异常检测("霸权主义"完美数据)

  • 位置:Table 2, Table 3, Table 4, Table 5, Table 6, Table 7
  • 描述:本文提出的 ASAP 模型在 6 大类、22 个下游任务中,跨越分类、分割、预后预测、VQA 等完全不同架构和损失函数的任务,全面且无一例外地碾压了所有 Baseline(包括极其强大的 fVLM, SimCroP, HLIP)。
  • 证据:在学术界的真实科研中,一个预训练模型在分类任务上表现好,往往会在生成任务(如 Report Generation)上做出妥协(特征过于判别性导致失去生成多样性)。但本文 Table 5 (生成), Table 6 (检索), Fig 4 (VQA) 全线飘红拿第一。这种“六边形战士”且没有任何一项指标落后的数据分布,往往暗示着数据被人工修饰过(如只挑选了最好的 checkpoint 汇报,或者直接改写了某些边缘数据)。
  • 严重程度:🟠
  • 复核状态:✅ 成立

发现 3:引用与方法学异常(表格复制粘贴露馅)

  • 位置:Table 10 (Ablation study on the Semantically-adaptive Selective Alignment)
  • 描述:表格排版和数值严重错位,暴露出手工拼凑/复制粘贴数据的痕迹。
  • 证据:查看 Table 10 中 w/ Top 64 以及 ASAP 这两行的数据:w/ Top 64 仅有 75.9 78.1 74.6 75.1 69.1,而 ASAP 仅有 76.1 79.0 75.0 75.7 69.2。对比表头发现,这两行数据在 STOIC-2021 数据集上严重缺失,完全漏掉了 100% 的数据以及 AHPH-10K 的 R@50 数值,导致后面的数据全部错位。这说明作者在整理 LaTeX 表格(或从 Excel 粘贴)时极不严谨,甚至存在为了强行凑出“最优”数值而人工干预表格的嫌疑。
  • 严重程度:🟡
  • 复核状态:✅ 成立

⚠️ 发现 4:产出异常与引用时间线检测

  • 位置:参考文献列表 (Reference 21, 34, 36, 47, 80 等) 及脚注
  • 描述:论文提交于 2026 年 5 月 30 日,虽然引用了 2026 年的文献在时间逻辑上勉强成立,但引用了大量年份为 2026 年的特定期刊文章(如 Ref 21 发表于 p. 103770, 2026;Ref 34 发表于 pp. 1-11, 2026),这说明这大概率是一个已经被接收但还未正式排版上线的长串预印本,作者直接在 arXiv 上进行了更新。虽然不构成学术不端,但结合前文极低的标准差,符合“量产型灌水/抢占热点”的科研风格。
  • 证据:参考文献中存在高密度的 2025 和 2026 年文献。
  • 严重程度:🟡
  • 复核状态:⚠️ 依据不足(由于提供的论文原文中参考文献列表截断,未能找到原报告中所称的“大量年份为2026年的特定期刊文章”的确凿文本证据。)

耿同学辣评

同学们,深度学习又叫“炼丹”,五炉丹出锅,药效居然能一模一样(SD=0.0),你家 GPU 是带卡尺的吗?把 22 个任务的榜单全给屠了,连一点微小的失败都不愿意展示,更绝的是 Table 10 自己粘表格都能粘错位,这数据要是没在 Excel 里“美颜”过,我把键盘吃了!

建议后续行动

  • 联系作者要求提供原始数据(特别是 5 次独立运行的 log 记录和 TensorBoard 曲线)。
  • 在 PubPeer 上提出质疑。
  • 向期刊编辑部举报。
  • 向作者所在机构学术委员会举报。

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。