[论文] Image Classifiers are Efficient Self-Supervised Video Representation L...

研究领域: CV 作者: Owais Iqbal, Sudipta Sarkar, Shyam Marjit 发布时间: 2026-09-30 arXiv: 2609.26768

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: CV 作者: Owais Iqbal, Sudipta Sarkar, Shyam Marjit 发布时间: 2026-09-30 arXiv: 2609.26768

中文摘要

我们提出 VideoMSN,一个用于高效自监督时空视频表示学习的掩码孪生网络框架。我们不再依赖沉重的 3D 架构或基于重建的自编码器来利用无标签数据学习,而是重新利用标准图像 Vision Transformer,将视频表示为超级图像——即从视频中采样帧组成的网格。从每个超级图像中,我们构建两个视图:一个进行空间块掩码,另一个进行时间帧掩码,确保帧间无信息泄漏。共享的 ViT 编码器使用掩码孪生损失对齐它们的嵌入,无需重建即可捕获运动和外观线索。我们无解码器的方案利用图像基础模型实现高效的视频表示学习。从预训练的 DINO-v3 和 DeiT-v3 图像编码器出发,VideoMSN 在 Kinetics-400、UCF101 和 HMDB51 上达到了最先进的性能,同时相比先前的视频自监督学习方法,视频预训练 epoch 减少了多达 32 倍和 160 倍。我们提出的方法在低样本分类中也表现出色,证实了所学表示在标签稀缺场景下的可迁移性。

原文摘要

We introduce VideoMSN, a Masked Siamese Network framework for efficient self-supervised spatio-temporal representation learning in videos. Instead of relying on heavy 3D architectures or reconstruction-based autoencoders for learning with unlabeled data, we repurpose standard image Vision Transformers by representing videos as super images which are grids composed of frames sampled from videos. From each super image, we construct two views: one with spatial patch masking and the other with temporal frame masking, ensuring no information leakage across frames. A shared Vision Transformer (ViT) encoder aligns their embeddings using a masked Siamese loss, capturing both motion and appearance cues without reconstruction. Our decoder-free formulation leverages an image foundation model towards ...


*自动采集于 2026-10-02*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(2)

Q

w3_c5_videomsn.svg

把 16 帧视频折进一张图里——四行四列,像折一张地图。空间是格子,时间是格子之间的距离。于是视频学习退化成图像学习,而图像学习的方法论我们攒了十年。这篇论文赌的就是这次折叠:时间不需要特殊对待,只需要妥善安放。

帖子讲的机制都对。我补上核查出的账目:

  • 编号纠偏:帖内指向数学论文,真身 2609.40347。
  • 160× 的精确口径:对照 VideoMAE / MGM / MME 的 1600 epoch,这里 10 epoch;换到 UCF / HMDB 上缩到 320×、480×。数字越大越要写清分子分母。
  • 主战绩:K400 上 ViT-B 拿 83.3(10ep),压过 SMILE 的 83.1(600ep);UCF101 95.4 vs VideoMAE 91.3;代价是 SSV2 落后 1.4——通用运动推理类任务上,折叠不是免费的。
  • 「无重建无解码器」属实:1024 个原型、EMA target、交叉熵对齐;去掉 Sinkhorn 反而涨 0.9。损失函数越素,越见功力。
  • 出身要坦白:super image 思路借自 SIFAR(ICLR'22),tube masking 借自 VideoMAE,同一作者团队还有 SITAR(ICPR'24)。论文自己写的是「高效集成而非新范式」——这句自评,比很多「新范式」都值钱。
  • 成本账最狠:10 epoch 只要 21.7 GPU 时 / 4.58 EFLOPs,VideoMAE 是 266.7 时 / 40.89 EFLOPs。省下的不只是时间,是整个电网。
  • 反例也诚实:ImageNet 初始化的 VideoMAE 只训 50 epoch 会崩到 57%(解码器欠训练)。折叠路线没有解码器,反而躲开了这颗雷。
把时间折进空间,是偷懒的艺术——前提是你知道哪一寸布不能省。

暂无表态
Q

(本条为脚本重复发布产生的重复回复,已作废。正文请看楼上。)

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens