LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 标题:LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
- 作者:Weiquan Huang, Aoqi Wu, Yifan Yang 等
- 期刊/会议:AAAI-26 (The Fortieth AAAI Conference on Artificial Intelligence)
- 发表年份:2026
- 论文来源:17251-AAAI26.HuangW-CV.pdf
综合评定:🟠 高度可疑
详细发现
⚠️ 发现 1:引用与方法学异常(违背常理的“零样本”跨语言飞跃)
- 位置:Section 4.2 (Zero-Shot Multilingual Text-Image Retrieval) / Table 2
- 描述:论文声称在视觉编码器仅使用英文数据(DreamLIP的CC3M和CC12M英文子集)进行微调的情况下,直接赋予了模型强大的多语言检索能力。在Table 2中,原本多语言能力为0的 EVA-L-224 模型(Flickr-CNC I2T得分仅4.4),加上LLM2CLIP后,直接飙升到了 90.6。
- 证据:这是一个严重违背深度学习常理的逻辑漏洞。如果视觉编码器在Stage 2的对比学习中,只接收到英文Image-Text pair的对齐训练,其更新后的视觉特征空间只会向英文文本特征空间靠拢。在没有任何多语言图文对进行对齐训练的情况下,仅靠文本端换成多语言大模型(Llama 3.1),视觉特征是无法自动“魔幻般”地与中文等其他语言特征完美对齐的。从4.4到90.6的跨度,在理论上极难成立,高度怀疑存在评测数据泄露、评测脚本bug,或者直接是数据造假。
- 严重程度:🔴
- 复核状态:⚠️ 依据不足(注:论文Table 2确实存在从4.4到90.6的异常数据跨度,且Section 4.2明确声明视觉编码器仅在英文文本上训练,原报告指出的现象存在;但仅凭当前文本信息断定其完全违背常理且涉嫌造假,缺乏代码复现和更深层的理论实锤依据,故判定为依据不足/高度存疑。)
发现 2:数据造假检测(均值计算存在数学不自洽)
- 位置:Table 1 (Systematic comparison of model performance)
- 描述:作者声称计算了5个数据集的平均Top-1准确率,但表格中的“Avg”列数值与左侧各分项数据存在无法解释的数学误差。
- 证据:以 CLIP (Radford et al. 2021) ViT-L/14 (224分辨率) 的 I2T(图像到文本) retrieval 结果为例。5个数据集的得分分别为:Flickr (85.2), COCO (56.3), SG4V (84.2), Urban (68.3), DOCCI (65.8)。真实数学平均值应为 (85.2+56.3+84.2+68.3+65.8)/5 = 71.96。然而,表格中给出的 Avg I2T 却是 72.8。这说明表格中的均值要么是手工编造,要么作者引用了其他未公开的、结果更差的实验数据来强行凑数。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 3:图片复用检测(受限声明)
- 位置:Figure 1, Figure 2 等
- 描述:文本中未提供足够的图片像素级信息,无法进行一图多用或PS拼接痕迹的深度分析。
- 证据:仅凭文本描述无法判断实验配图的真实性。
- 严重程度:🟡
- 复核状态:⚠️ 依据不足(注:提供的原文仅包含Figure 1和Figure 2的Caption文本,缺乏原图像素信息,无法得出实质性造假结论。)
耿同学辣评
好家伙,现在的论文是连计算器都懒得用了吗?Table 1 里 CLIP L/14 的 I2T 平均分,用脚趾头算也是 71.96,作者硬生生给凑成了 72.8。连小学生都会算的均值都能出错,这篇 AAAI 2026 的稿子校对质量实在感人!更离谱的是,用纯英文数据微调视觉端,中文检索分数就能原地起飞,从 4.4 火箭式飙升到 90.6!按这个逻辑,我天天看英文原版书,闭着眼睛就能自动精通八国语言了是吧?虽然这种“跨语言魔法”因为没有实锤暂时只能算存疑,但这两大硬伤凑在一起,水分怕是比 LLaVA 生成的长文本还要多啊!
建议后续行动
- 联系作者要求提供 Stage-2 训练的详细日志,特别是验证多语言评测的具体代码和数据集划分,要求其对跨语言飞跃做出合理解释。
- 要求作者公开解释 Table 1 中 Avg 列存在的数学计算错误原因,核实是否为数据填报造假。
- 在 PubPeer 上提出质疑。
- 向 AAAI 会议组委会及微软/同济大学学术委员会举报核实。
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。