LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
2026-08-06 15:10
🔍 耿同学打假报告
论文信息
- 论文来源:lw9LongVU.pdf
- 标题:LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
- 作者:Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, 等 (Meta AI, KAUST, Korea University)
- 期刊/会议:Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267, 2025
- DOI:文本中未提供
- 发表年份:2025
综合评定:🟠 高度可疑
详细发现
发现 1:数据造假检测(跨表复制粘贴/异常重复)
- 位置:Table 15, Table 16, Table 17, Table 18 (附录中的消融实验)
- 描述:在针对四个完全不同的超参数(DINO Threshold, STC Threshold, Sliding Window K, Sliding Window J)进行的消融实验中,MVBench 这一列的分数出现了令人费解的高度重复,甚至完全一致。
- 证据:
- Table 15 (DINO阈值) MVBench列:66.88, 66.86, 66.95, 66.86, 66.86
- Table 16 (STC阈值) MVBench列:66.88, 66.86, 66.95, 66.86, 66.86
- 这两组数据完全一模一样。在真实的深度学习实验中,修改视觉编码器的相似度阈值(DINO Threshold)与修改空间token压缩阈值(STC Threshold)是截然不同的操作,导致输出精度到小数点后两位完全相同的概率在统计学上几乎为 0。这极度疑似在填表时发生了复制粘贴的造假行为或凭空捏造数据。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 2:数据造假检测(数学计算自洽性崩塌)
- 位置:Table 4 及 Appendix 中的 Table 9 (Ablation study on each subtask in MLVU)
- 描述:表格中所列出的各子任务分数的算术平均值,与作者在表格中报告的平均值数学上不吻合。
- 证据:以 Table 4 / Table 9 的第一行 "DINO" 为例,各子任务得分为:24.15, 59.09, 68.16, 52.89, 71.24, 74.00, 86.36。计算其真实平均值为:(24.15+59.09+68.16+52.89+71.24+74.00+86.36) / 7 = 62.27。然而,作者在 Avg 列中报告的平均值却是 62.54。这种均值计算错误表明作者不仅可能没有亲自计算,甚至可能是为了追求某个目标数值而直接编造了一个汇总结果。
- 严重程度:🔴
- 复核状态:✅ 成立
发现 3:数据分布异常(过度完美与敷衍的造假)
- 位置:Table 15, 16, 17, 18 (MVBench 列) 及 Table 18
- 描述:除了发现 1 中指出的跨表复制问题,在同一张表内,数据的波动也呈现出极其敷衍的特征。
- 证据:在 Table 18 (Sliding window J ablation) 中,MVBench 列的四个数值为:66.88, 66.95, 66.86, 66.83。不仅变化极小,且小数点后第二位几乎全在 80~90 之间徘徊。与发现 1 结合来看,作者很可能在造数时直接锁定了某个数值(如 66.8x)并在附近随手敲了几个数充当实验结果,随后在不同表格间反复复用。
- 严重程度:🟠
- 复核状态:✅ 成立
⚠️ 发现 4:图片复用与拼接检测
- 位置:全文图片
- 描述:由于输入仅为文本提取内容,缺乏原始图片的像素级信息。
- 证据:文本中未提供足够的图片信息,无法进行 Western blot 背景噪点、图片翻转或 PS 痕迹的视觉比对分析。
- 严重程度:🟡 (无法判断)
- 复核状态:⚠️ 依据不足
耿同学辣评
好家伙,ICML 2025 的论文,数学算术算不对,连 Ctrl+C 和 Ctrl+V 都按不明白!改 DINO 阈值和改 STC 阈值的 MVBench 成绩能一模一样,小数点后两位都不带变的,这大模型是被你施了什么定身法吗?算平均分还能强行多算出 0.3 分,建议作者重回小学进修一下算盘,或者下次造假数的时候好歹用个 Excel 的 AVERAGE 函数吧!
建议后续行动
- 联系作者要求提供原始实验日志与产出数据(强烈建议)
- 在 PubPeer 上提出质疑
- 向期刊/会议编辑部举报(由于涉嫌表格系统性数据编造,建议向 ICML 主办方或数据审查委员会通报)
- 向作者所在机构学术委员会举报
⚠️ 免责声明
本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。