先承认这篇写得漂亮:LeCun 挂在作者列表第七位,标题里的"without the Heuristics"不是谦辞。摘要我核过了,5.6–20.8× 更少预训练算力、matched total FLOPs 下超最强视频基线 7.6 个点、block-causal attention 无可测精度损失、单超参且全程不调——都对。
但有三处,是把论文写得比论文更漂亮。
一、"丢 95% token 让 FFN 少 20 倍"——限定词被偷换了
论文原话是:token dropping "reduces the cost of each forward pass by up to a factor of (1−ρ)⁻¹ in the feed-forward layers"。ρ=0.95 ⇒ 1/0.05 = 20×,算对了。
问题在"up to"和"in the feed-forward layers"这两个限定。帖子接着写"Transformer 的计算复杂度与 token 数量成正比,丢掉 95% 意味着速度快了近一个数量级"——这句是错的。注意力是 O(n²),FFN 是 O(n)。丢 95% token 时 FFN 真的省 20 倍,注意力那部分只省大约 (1/0.05) 的平方根量级。全模型 FLOPs 是两者的加权,不会正好 20×。论文自己只敢在 FFN 这一层上写 "up to",帖子把这一层的结论推广到了全模型。
限定词不是装饰。它是承重墙。【直引:论文原文 "by up to a factor of (1-rho)^-1 in the feed-forward layers"】
二、RTX 4090 → RTX 5080,而且漏了最有说服力的那个数
论文 §5.3 原话:ViT-Tiny 在单张消费级 GPU(RTX 5080, 16 GB)上训 12 小时,数据是 Walking Tours 里的 8 段视频、约 62 万帧、约 500 万 clip,ImageNet top-1 从初始化的 8.9% 提升到 25.2%。
型号错了,更可惜的是漏了 8.9 → 25.2。这两个数才是这一节真正的论点:12 小时、一张消费卡、零标注、纯无监督,从 8.9% 走到 25.2%。帖子只写了"获得非平凡准确率"——"非平凡"是多少?没有数。1.2 秒出 60 帧 vs V2M4 一小时出一段 那种对比也不该跟这节抢戏,效率那张牌已经被 5.6–20.8× 打完了。
三、SSv2 的限定词被削平了
帖子写"95% 丢弃一开始会 hurt 运动性能,随着训练时间增加差距缩小"。论文原话精确得多:"accuracy declines for dropping ratios beyond 0.3" —— 超过 0.3 就开始降,不是 0.95 才降。而且论文给了恢复机制:延长训练后高丢弃率能追回低丢弃率的准确率。
这条限定词一被削掉,结论就变形了:从"95% 是个临界点"变成"95% 也能用"。事实上 ρ=0.9 与 ρ=0.95 在 ImageNet 上是 47.4% vs 47.6%,在观测波动内完全持平——再丢一半 token 免费。真正在动的是运动侧,而运动侧从 0.3 就开始敏感了。换句话说:省 token 这件事在静态外观上几乎无代价,在运动上从丢七成就开始收费。
四、顺手校一下那个 33.9 → 47.6
数字真实,原话是 "from 33.9% when all tokens are processed to 47.6% at ρ=0.95"。但论文在这一段的小标题写的是 ImageNet linear probing,而他处用 attentive probing 协议——这是论文自己的口径混用,不是帖子加的锅。不过帖子直接断言"attentive probing 准确率"就越界了。
λ = 0.02 是真的,而且比帖子说的更强:原文明写 "fixed to λ=0.02 in all trainings and is not tuned for any experiment in this paper"——整篇论文没调过这个超参。这是"少即是多"最硬的一块砖:去掉全部 heuristics 之后,唯一留下的旋钮连试都没试过。
下一根钉子
盯运动侧的 ρ–准确率曲线有没有第二个回升点。现在 ρ>0.3 单调降、靠延长训练追平——如果哪天出现"先降后升"的非单调形状(某个中等丢弃率在长训练下反超 ρ=0),那 ρ=0.95 的免费午餐就变成有代价的了,界线的位置也会跟着动。另一个更近的钉子:SSv2 上那个 55.0% 的 frozen attentive probing,它超过 ViT-L 那一档,是这篇论文在运动侧唯一压得住的数字,值得看它能不能在更严的 probe 协议下复现。