Pathology-Aware Reconstruction with Discriminative Knowledge Boosting Alignment for CheXray Vision-Language Pre-training
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:Pathology-Aware Reconstruction with Discriminative Knowledge Boosting Alignment for CheXray Vision-Language Pre-training
- 作者:Anonymous Author(s)
- 期刊/会议:MM '25 (Submission Id: 3264)
- DOI:XXXXXXX.XXXXXXX (暂无,处于匿名评审阶段)
- 发表年份:2025 (会议预期时间)
- 论文来源:3264_Pathology_Aware_Reconstru (1).pdf
综合评定:🟠 高度可疑
详细发现
发现 1:跨表格核心数据自相矛盾(拉高基线嫌疑)
- 位置:Table 1 vs Table 4 / Table 5
- 描述:作为本文核心卖点的主打实验结果,在主表和消融实验表中居然出现了完全不同的数值。在 Table 1 中,作者声称自己的模型在 ChestX-ray14 (1% 数据) 上达到了 81.4% 的 AUC;然而在 Table 4(声称同样使用 1% 数据进行的消融实验)以及 Table 5 中,最终模型(PAR ✓, DKBA ✓ / MGCA prior)的 AUC 却变成了 80.8%。COVIDx、SIIM 等其他数据集在两表中完全一致,唯独最能体现分类性能的 ChestX-ray14 的数据被悄悄改动了 0.6%。
- 证据:Table 1 "Ours" 在 ChestX-ray14 1% 下为 81.4;Table 4 "PAR ✓, DKBA ✓" 下为 80.8;Table 5 "MGCA" 下为 80.8。同一次实验,三处出现两个结果。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:睁眼说瞎话的“性能提升”(数据与结论相反)
- 位置:Table 4 及其对应文本 (Section 5.3.1)
- 描述:作者在文中大言不惭地写道:“These results collectively validate the complementary benefits of PAR... and DKBA...”(这些结果共同验证了 PAR 和 DKBA 的互补优势)。但查看 Table 4 的真实数据:当只有 DKBA 时,ChestX-ray14 的 AUC 为 81.0;然而当把作者主打创新的 PAR 加上去后(PAR ✓, DKBA ✓),AUC 不升反降,跌到了 80.8!作者把性能下降硬生生说成了“优势验证”。
- 证据:Table 4 第二行 DKBA 单独使用为 81.0,第四行 PAR+DKBA 联合使用反而下降至 80.8。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:数据造假/复制粘贴痕迹(随机数生成器都不如)
- 位置:Table 1
- 描述:在 Table 1 中,作者自己的模型在 CheXpert 数据集上,使用 1% 训练数据和 10% 训练数据,得出的 AUC 分数竟然一模一样,精确到了小数点后一位(1% 为 89.5,10% 也是 89.5)。在真实的深度学习实验中,训练数据量增加 10 倍,各项指标连小数点后第一位都完全雷同,概率几乎为零,极度涉嫌编造数据或复制粘贴时的低级失误。
- 证据:Table 1 "Ours" 行,CXP 数据集 1% 和 10% 列均为 89.5。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 4:文本与表格的数学逻辑冲突
- 位置:Section 5.3.3 (Ablation study of training task) & Table 6
- 描述:作者在解释联合训练机制时写道:“Joint reconstruction-alignment pre-training improves fine-grained task performance... (row 1 vs 3)”(联合训练提高了细粒度任务性能,见表6第1行对比第3行)。但我们去看 Table 6:Row 1(仅重建)的 SIIM(细粒度分割任务)得分为 66.7,而 Row 3(联合训练)的 SIIM 得分下降到了 64.6。64.6 < 66.7,这叫“提高”?
- 证据:Table 6 中 Row 1 SIIM 为 66.7,Row 3 为 64.6,数值下降,与作者声称的“improves”完全背道而驰。
- 严重程度:🟠
- 复核状态:✅ 成立
发现 5:引用错乱(方法学异常)
- 位置:Section 2.1 (Related Work)
- 描述:作者在介绍相关工作时写道:“MedUnic [23] integrates multimodal medical data...”。但翻开参考文献列表,[23] 是 Bo Liu 等人发表的关于 SAT (Semantics-Aware Triage) 的论文,而真正的 Med-UniC 论文是列表里的 [33](Zhongwei Wan 等人,2024年)。这说明作者在写论文时极大概率是直接复制粘贴了别的文章的句子,连引用编号都忘了改。
- 证据:[23] 指向 SAT,[33] 才是 Med-UniC,但正文将 Med-Unic 标注为 [23]。
- 严重程度:🟡
- 复核状态:✅ 成立
发现 6:算力与产出时间线的疑点
- 位置:Section 4.3 (Implementation Details)
- 描述:作者声称在 MIMIC-CXR(包含超 37 万张图像)上进行预训练,重建阶段跑 200 个 epoch,对齐阶段跑 15 个 epoch,使用的是区区“两张 NVIDIA RTX 4090 显卡”。在 ViT-B/16 架构下,用两张 24G 显存的 4090 跑 37 万张图的多模态预训练 200 个 epoch,时间成本极其高昂(通常需要数周甚至满载运行几个月)。虽然不是完全不可能,但在常规顶会论文的算力配置中显得极为寒酸和可疑。
- 证据:Section 4.3 硬件配置与庞大的数据集/训练轮次存在明显的不对称。
- 严重程度:🟡
- 复核状态:✅ 成立
耿同学辣评
这篇论文把 AI 时代某些“炒概念、凑数据”的套路玩得明明白白:主打创新的模块加上去之后性能不升反降,作者直接选择“掩耳盗铃”,硬着头皮宣称取得了“互补优势”;主表为了挤过 SOTA,随意将分数小幅“微调”,结果跟自己后面的消融实验表对不上,直接翻车;甚至连增加 10 倍数据量后指标连小数点都不带变的。这种前言不搭后语、复制粘贴连参考文献都不改的做派,是把审稿人当成了不具备基本算术能力的工具人啊!
建议后续行动
- 要求作者提供完整的训练日志、原始代码以及划分 1%/10% 数据的随机种子
- 在 PubPeer 或公开平台上对 Table 1 和 Table 4 之间 81.4 vs 80.8 的数值冲突提出公开质疑
- 仔细核查图片(虽然本次纯文本分析未涉及,但面对如此敷衍的文本数据,建议 Reviewer 让其提供无篡改的原始 Loss 曲线和权重文件)
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。