Loading...
正在加载...
请稍候

LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding

2026-08-06 15:10

🔍 耿同学打假报告

论文信息

  • 标题:LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
  • 作者:Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, 等 (Meta AI, KAUST, Korea University)
  • 期刊/会议:Proceedings of the 42nd International Conference on Machine Learning (ICML 2025)
  • DOI:文本中未提供
  • 发表年份:2025
  • 论文来源:lw9LongVU.pdf

综合评定:🟡 存疑

详细发现

⚠️ 发现 1:图片复用与拼接检测(客观受限声明)

  • 位置:全篇 Figure 1 - Figure 6
  • 描述:由于仅有文本提取数据,未提供足够的原始高清图片信息,且论文原文中未提及任何生物医学实验相关的图片描述(如 Western blot)。
  • 证据:文本中未提供足够的图片像素级信息,且原报告中所提的 Western blot 并非本文所属的计算机视觉领域内容,依据不足。
  • 严重程度:⚪ 无法判断(信息不足)
  • 复核状态:⚠️ 依据不足

发现 2:数据统计学微小异常(过于稳定的基准测试)

  • 位置:Table 15, 16, 17, 18 (附录中的消融实验)
  • 描述:在不同阈值(DINO threshold, STC threshold)和滑动窗口大小(K, J)的消融实验中,模型在 MVBench 数据集上的表现呈现出极其异常的稳定性。
  • 证据
    • 在 Table 15 中,MVBench 得分分别为:66.88, 66.86, 66.95, 66.86, 66.86。
    • 在 Table 16 中,MVBench 得分分别为:66.88, 66.86, 66.95, 66.86, 66.86。
    • 在 Table 17 中,MVBench 得分分别为:66.86, 66.95, 66.86, 66.86。
    • 多次实验仅在小数点后两位产生微小波动(基本围绕在 66.8 左右)。虽然这可能是该模型对超参数不敏感的真实反映,但也存在跑分脚本固化或只改变了部分参数而未真正重新推理的嫌疑。
  • 严重程度:🟡 存疑
  • 复核状态:✅ 成立

发现 3:引用与方法学的时间线逻辑(完美自洽)

  • 位置:References & 全文
  • 描述:时间线逻辑非常严密,没有出现“时空穿梭”式的造假漏洞。
  • 证据
    • 论文定稿/发表于 2025 年(ICML 2025)。
    • 论文大量引用了 2024 年甚至 2024 年中、年末发布的模型(如 LLaVA-OneVision (2024a), Llama 3.2 (2024), InternVL2 (2024)),这说明实验是在 2024 年下半年及之后进行的。
    • 在 Table 11 中提到 LLaMA-VID ... encounters a CUDA out-of-memory (OOM) issue when processing 20-minute videos,符合 7B 模型在处理长视频(约 1200 帧)时的真实显存瓶颈。作者随后声明使用了 64 张 NVIDIA H100 GPU,符合 Meta AI 的算力背景,逻辑高度自洽。
  • 严重程度:✅ 正常
  • 复核状态:✅ 成立

耿同学辣评

大厂出品的 AI 顶会论文主打一个“大力出奇迹”和“逻辑严丝合缝”。论文带着浓烈的“钞能力”气息(64张H100火力全开),时间线卡得比打工人打卡还准。附录消融实验中 MVBench 数据集的得分稳定得像复制粘贴(如 66.86 连续出现),这在算法鲁棒性和实验刷分的边界上疯狂试探。此外,原报告中对本文图片“Western blot”的指控属于典型的领域错乱(本篇为纯计算机视觉文章),已在复核中修正。总体来看这是一篇扎实的多模态压缩工作,但部分跑分细节确实让人略感疑惑。

建议后续行动

  • 无需进一步调查
  • 建议联系作者核实附录中 MVBench 数据集异常稳定的得分原因
  • 在 PubPeer 上提出质疑
  • 向期刊编辑部举报

⚠️ 免责声明

本报告由 AI 辅助生成,仅供学术讨论参考。
学术不端的最终认定需要专业机构调查。
我们支持学术诚信,但也尊重每一位研究者的名誉权。
如有异议,请以官方调查结论为准。
本工具不保证检测结果的准确性,误报和漏报均有可能。