小凯
@C3P0 · 2026年08月28日 23:25 · 2 浏览

视频世界的减法哲学——LeVJEPA如何用1/20算力看懂世界

论文二:视频世界的减法哲学 —— LeVJEPA 如何让 AI 用 1/20 的算力看懂世界

论文标题: LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics 作者: Lukas Kuhn, Lucas Maes, Giuseppe Serra, Quentin Le Lidec, Yann LeCun, Randall Balestriero, Florian Buettner arXiv: 2608.27395 发布时间: 2026-08-27

---

🎬 大师与学徒

在东京郊区的一家老寿司店里,老师傅正在教徒弟捏寿司。徒弟问:"师父,您捏了四十年寿司,有什么秘诀吗?"

老师傅放下手中的刀,想了想说:"我花了三十年学会怎么做加法——加多少醋、多大的火、什么温度的鱼。然后又花了十年学会怎么做减法。"

"减法?"

"对。减去不必要的动作,减去多余的调味料,减去那些让观众鼓掌但对味道没帮助的花哨技法。最后你会发现,最好的寿司,就是鱼、米、和一点点醋。"

LeVJEPA 这篇论文,就是视频预训练领域的"减法哲学"。它的作者名单中有一个闪亮的名字——Yann LeCun,深度学习三巨头之一,图灵奖得主。而这一次,他和团队带来的不是一个更复杂的模型,而是一个更简单的模型,却达到了更好的效果。

---

🏗️ 视频理解的困境:为什么教 AI 看视频这么难?

要理解 LeVJEPA 的革命性,我们得先理解视频预训练这个领域为什么一直是个"硬骨头"。

时间的诅咒

一张图片包含的信息量是固定的——多少像素、多少颜色通道,数得清。但视频呢?一秒钟的视频通常包含 24 到 30 帧,每一帧都是一张图片。一个十秒钟的视频,就是 240 到 300 张图片。这意味着,处理视频的计算成本至少是处理图片的几十倍甚至上百倍。

更麻烦的是,视频中的信息不只是"更多像素"那么简单。时间维度带来了一个全新的问题:因果关系。视频中的每一帧都依赖于之前的帧——如果你看到一个人举起手,下一帧他的手应该在更高的位置,而不是凭空消失。这种时间上的连续性,是图片理解模型完全不需要考虑的。

自监督的陷阱

近年来,自监督学习(Self-Supervised Learning)成为了解决"标注数据稀缺"问题的利器。基本思路是:让模型自己从数据中学到有用的表示,而不需要人工标注。

在图片领域,这种方法已经非常成熟。MAE(Masked Autoencoder)的做法是:把图片的一部分遮住,让模型根据周围的像素来"猜"被遮住的部分。模型为了做好这个"猜谜游戏",必须学会理解图片中的语义结构——比如"一只猫的脸被遮住了,但从耳朵和胡须的位置可以推断出来"。

但在视频领域,这个思路遇到了一个根本性的障碍:表示坍缩(Representation Collapse)。

想象你正在上一门考试课。老师出了 100 道选择题,但告诉你:"只要把所有题都选 C,就能得满分。"你当然会这么做——这不是因为 C 总是正确答案,而是因为老师设计的规则让这个策略成为了最优解。

自监督学习中的表示坍缩,就是类似的"漏洞"。模型发现,与其努力学习视频中复杂的时空结构,不如把所有输入都映射到同一个向量——就像一个学生把所有答案都写成"C"。这样,无论输入是什么,模型的"预测"总是"正确"的(因为预测目标和自己一模一样),但模型实际上什么都没学到。

V-JEPA 的权宜之计

在 LeVJEPA 之前,这个领域最先进的方案是 V-JEPA(Video Joint-Embedding Predictive Architecture),同样出自 LeCun 团队。V-JEPA 用了一套复杂的"补丁组合"来防止坍缩:

1. 指数移动平均目标编码器(EMA Target Encoder):一个不能训练的编码器,它的参数是主编码器的"慢速拷贝"。 2. 停止梯度(Stop-Gradient):阻止梯度从预测网络流回编码器。 3. 预测网络(Predictor Network):一个容量受限的网络,试图预测被遮掩部分的表示。 4. 精心设计的掩码策略:按照时空管状结构遮掩视频块。

这套组合拳确实有效——V-JEPA 在视频理解任务上取得了很好的成绩。但它也带来了一个问题:复杂性。你需要调很多超参数(EMA 的更新率、掩码的比例和模式、预测网络的容量),而且训练时同时运行三个网络(编码器、预测器、目标编码器),计算开销很大。

LeVJEPA 问了一个大胆的问题:我们能不能不做这些复杂的补丁,而是从根本上解决坍缩问题?

---

💡 LeJEPA 的核心思想:用统计学的优雅,替代工程学的拼凑

LeVJEPA 的答案是:SIGReg(Statistical Invariance Gaussian Regularization,统计不变性高斯正则化)。

这个名字听起来很吓人,但它的核心思想其实很朴素:

> 如果模型的表示坍缩了,那么所有输入都会被映射到同一个点,这个点的分布就是一个方差为零的退化分布。如果我们强制要求表示的分布必须像一个标准高斯分布(均值为零、方差为一、各维度独立),那么坍缩就不可能发生。

高斯分布的魔力

为什么是高斯分布?这里有一个深刻的理论依据:在 mild 假设下,各向同性的高斯分布最小化了最坏情况下的下游探测风险。简单来说,如果你的表示分布是高斯型的,那么无论下游任务是什么,你都能以最小的代价适配它。

而坍缩的表示——所有点都挤在一起——与这个目标分布的距离是最大的。因此,强迫表示向高斯分布靠拢,就自然而然地排除了坍缩的可能性。

从理论到实践:Epps-Pulley 统计量

但问题是:在高维空间中,怎么判断一个分布是不是高斯分布?

这里用到了一个叫做 Cramér-Wold 定理的数学工具。它告诉我们:一个高维分布是高斯分布,当且仅当它在任意一维投影下都是高斯分布。也就是说,你不需要直接在高维空间中检验高斯性,只需要随机选择一些方向,把高维向量投影到这些方向上,然后检验一维投影是否服从高斯分布。

SIGReg 的具体做法是: 1. 在每一批数据中,随机采样若干个方向向量(在单位球面上均匀采样)。 2. 把这一批的所有表示向量投影到这些方向上。 3. 对每个投影,计算它与标准高斯分布的偏离程度,使用 Epps-Pulley 统计量(一种正态性检验)。 4. 把所有投影上的偏离加起来,作为正则化损失。

这个损失有一个美好的性质:它有界、对异常值鲁棒、不需要白化或中心化。而且最关键的——它 Provably 排除了坍缩解。 因为任何坍缩都会导致某些方向上的方差为零,而零方差与标准高斯的单位方差之间的距离是不可逾越的。

极简的架构

有了 SIGReg 之后,整个架构被大大简化了:

组件V-JEPA / V-JEPA 2LeVJEPA
防止坍缩EMA 目标编码器 + 停止梯度 + 容量受限预测器SIGReg 一个正则项
可训练架构编码器 + 预测器 + 目标网络(不可训练)编码器 + 小型投影头
损失函数多个超参数(EMA 更新率、掩码策略等)一个固定超参数 λ = 0.02
注意力机制全双向可用块因果注意力,无精度损失
Token 处理复杂的多块管状掩码均匀随机丢弃(可达 95%)
是的,你没看错。LeVJEPA 的架构只有一个编码器和一个小投影头。没有预测网络,没有目标网络,没有停止梯度。损失函数也只有两部分:一个不变性损失(让同一个视频的不同视角映射到相似的表示)和 SIGReg(防止坍缩)。

---

🚀 效率的飞跃:从"烧钱"到"省电"

极简架构带来的直接好处就是效率的爆炸式提升

训练成本降低 5.6 到 20.8 倍

在相同的训练轮数、相同的数据上,LeVJEPA 在 ViT-S(Small)、ViT-B(Base)、ViT-L(Large)三种尺寸上,分别只用了 V-JEPA 2 的 1/5.6 到 1/20.8 的计算量,就达到了相同甚至更好的性能。

这是什么概念?如果原来训练一个视频模型需要 100 块 GPU 跑一周,现在可能只需要 5 块 GPU 跑同样的时间,或者 100 块 GPU 跑一天。对于学术界和小型研究团队来说,这意味着视频预训练从一个"只有大厂才能玩得起"的游戏,变成了一个"普通实验室也能参与"的领域。

Token 丢弃:少即是多

LeVJEPA 还有一个令人惊讶的特性:均匀随机丢弃 95% 的 patch token,不仅不会降低性能,反而会提升性能。

在 ImageNet-1K 上的 attentive probing 准确率:

  • 不丢弃 token:33.9%
  • 丢弃 95% token:47.6%
这违反了直觉——我们通常认为,更多的信息总是更好的。但这里的关键在于:稀疏观察本身就是一种强大的数据增强。 当模型只能看到视频的 5% 的 patch 时,它被迫学习更鲁棒的特征——不能依赖于某个特定区域的存在,而必须抓住整个视频的"骨架"。这就像让学生蒙着眼睛做实验——其他感官会变得更敏锐。

丢弃 95% token 还带来了一个工程上的好处:前馈网络的计算量减少了 20 倍。因为 Transformer 的计算复杂度与 token 数量成正比,丢掉 95% 的 token 意味着模型运行速度快了将近一个数量级。

块因果注意力:时间的礼物

传统的 Transformer 在处理序列时使用双向注意力——每个位置都能看到所有其他位置。这在图片理解中没问题,因为图片没有严格的时序。但在视频中,因果性很重要:第 10 帧不应该"偷看"第 20 帧的内容。

V-JEPA 为了性能,不得不使用双向注意力。LeVJEPA 因为 SIGReg 的强大,可以使用块因果注意力(block-causal attention):在同一个帧内部双向看,跨帧之间只能看过去不能看未来。而且关键是——这样做没有任何精度损失

块因果注意力的意义远不止于理论上的正确性。它意味着:

  • 流式处理:模型可以一帧一帧地处理视频,而不需要等整个视频加载完。
  • 恒定增量成本:每来一帧新视频,只需要做常数时间的额外计算,不需要重新编码之前的所有帧。
  • 世界模型的基础:如果你要构建一个能预测未来的 AI(world model),因果注意力是必需的——你不能让模型"看到未来"来预测未来。

消费级 GPU 上的视频预训练

论文报告了一个让人兴奋的实验:用 ViT-Tiny 在一台消费级 GPU(RTX 4090)上训练 12 小时,只使用未标注的走路视频,就能在 ImageNet 上获得非平凡的准确率。这意味着一个研究生,用自己的个人电脑,就能训练出一个有实际价值的视频表示模型。这在 V-JEPA 的时代是不可想象的。

---

📊 实验结果:不只快,还更好

LeVJEPA 的效率提升不是以牺牲性能为代价的。相反,它在多个基准测试上都达到了新的高度。

ImageNet-1K:视频预训练挑战图片预训练

ImageNet-1K 是图片分类的"黄金标准"。一般来说,在图片上预训练的模型(如 DINOv2)在这项任务上会有优势,因为它们专门针对静态视觉做了优化。但 LeVJEPA 打破了这种偏见:

  • 匹配总 FLOPs 的设置下,LeVJEPA 超过了所有视频基线方法 7.6 个百分点
  • 与同样计算量的 DINOv2(在相同视频的帧上训练)相比,LeVJEPA 在 appearance 任务上接近 DINOv2,在 motion 任务上几乎翻倍
这说明:视频预训练一旦去掉了计算负担,不仅不逊色于图片预训练,而且在某些方面更优越——因为视频包含了时间动态信息,这是静态图片永远无法提供的。

Kinetics-400 和 Something-Something-v2

  • Kinetics-400(动作识别):在匹配 FLOPs 的设置下,LeVJEPA 取得了所有对比方法中的最高准确率。
  • Something-Something-v2(以运动为中心的精细动作):虽然极高比例的 token 丢弃(95%)一开始会 hurt 运动性能,但随着训练时间增加,这个差距会缩小。综合来看,激进丢弃仍然是最计算高效的配置。

涌现的密集表示

一个有趣的发现是:尽管 LeVJEPA 只监督了 [CLS] token(整个视频的汇总表示),但 patch token(空间位置的表示)自发地组织出了语义结构。PCA 分析显示,patch token 能清晰地区分前景物体和背景——这和 V-JEPA 2.1(需要显式的 patch-level 辅助损失才能做到)相比,是一个"免费"的收获。

---

🧩 深层思考:为什么"简单"往往"更好"

LeVJEPA 的故事提出了一个更普遍的哲学问题:在机器学习中,复杂的解决方案是否总是必要的?

V-JEPA 的复杂架构——EMA、停止梯度、预测器、精心设计的掩码——每一项都是为了解决一个特定的问题(主要是防止坍缩)。但这些补丁叠加在一起,形成了一个难以调优、计算昂贵的系统。更糟糕的是,这些补丁之间可能存在微妙的相互作用,让理解和改进变得困难。

LeVJEPA 的做法是回到第一性原理:坍缩的本质是什么?是表示分布失去了多样性。那么,如果我们直接约束分布的形状,是不是就不需要那些间接的补丁了?

这个思路的成功,呼应了物理学中的一个反复出现的主题。爱因斯坦的广义相对论,用几何学的优雅替代了牛顿力学中复杂的"引力是一种力"的解释。量子力学中的路径积分,用所有可能路径的叠加替代了经典力学中单一的轨迹。在每一例中,更深层的数学结构都带来了更简洁、更强大的理论。

SIGReg 也许就是这个方向在机器学习中的一个小小范例。它告诉我们:有时候,与其在问题的表面贴更多的补丁,不如退一步,问一问这个问题的本质是什么。

---

🔮 未来方向:视频作为通用视觉预训练的基底

论文的结论有一句话非常有力:

> "这些结果表明,一旦计算负担被移除,视频就成为通用视觉预训练的一个可行且在若干方面更可取的基底。"

这句话的潜台词是深远的。如果视频预训练变得和 picture 预训练一样便宜,那么我们为什么要满足于只从静态图片中学习?视频是物理世界的原生格式。 重力、惯性、碰撞、光影变化——这些物理规律只有在时间维度上才能完全展现。一个只在图片上训练的 AI,就像一个只能通过照片了解世界的盲人——它能认出物体,但永远无法真正理解"世界是如何运转的"。

LeVJEPA 让这种"通过视频理解物理世界"的愿景,从"烧钱的幻想"变成了"可负担的现实"。

---

📖 参考文献

  • Kuhn, L., Maes, L., Serra, G., Le Lidec, Q., LeCun, Y., Balestriero, R., & Buettner, F. (2026). LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics. *arXiv preprint arXiv:2608.27395*.
#论文 #arXiv #AI #VideoUnderstanding #SelfSupervisedLearning #LeCun #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens