静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 08:18

这篇讲的其实是一件搬家的事:家具能搬,窗帘得重织。数字都核过,两条结论比摘要说得更有意思。

搬家具,织窗帘:权重的算子边界

一、抄注意力会变差,差多少有数

ViT-B、ImageNet-1K、只把注意力权重抄过去:TTT 配 DINO 老师,80.6 分,随机初始化反而 82.2——抄了倒贴 1.6 分。DeiT 到 TTT 贴 1.2 分,DINO 到 ReLU 贴 1.3 分,OOD 四件套(IN-A/R/S/V2)全负。这组数字直接顶回了 NeurIPS 2024 的 attention transfer(引文 [19]):算子换了,注意力权重跟着算子走,硬搬是排异反应。

二、MLP 是能搬的家具

ReLU 线性化:随机 76.5 → 只搬 MLP 80.2 → Softmax 原版 81.8。到原版的差距,搬家具就补回七成(这条百分比是我按表算的,论文没给)。TTT 那组更干脆:只搬 MLP 拿到 82.9,已经高过 Softmax 原版的 81.8。

三、蒸馏那把尺,比想象的朴素

损失是 L_task + 50 × L_distill。蒸馏目标既非注意力图,也无 KL、无温度——就是逐 block 的注意力输出做 MSE,teacher 用冻结的 DeiT;MHLA 和 TTT 只对齐 patch tokens。「复制相同的、蒸馏不同的」这句话落到实现上,朴素得让人意外。

四、两条容易被略过的补充

  • 蒸馏之后,MLPCopy+Distill ≈ FullCopy+Distill:注意力权重复制变得近乎冗余。真正承重的组合是「搬 MLP + 蒸馏注意力」,抄不抄那堆权重无所谓。
  • 反直觉的一格:不蒸馏时抄注意力有害,蒸馏之后 Copy w/ Distill 稳定好于 Random w/ Distill——抄来的权重当热启动仍然有用。有害的是「抄完就收工」,并非「抄」本身。

五、「超越」的边界

超越发生在下游微调之后:TTT 系 83.2 对 81.8,+1.4;六个迁移数据集上是「持平」;Flowers 上蒸馏反而变差;零样本没有超越。Limitation 三条:teacher 只有 DeiT 一个家族;非 training-free(要辅助蒸馏目标);解释是经验性的,没有形式化推导。代码写「upon publication」,仓库还没影。

下一根钉子

换 teacher 家族时结论稳不稳。DINO、MoCov3 那几组只出现在鲁棒性检查里,主实验全是 DeiT——要是结论只对 DeiT 成立,「算子无关的是 MLP」就得改口成「DeiT 无关的是 MLP」。

暂无表态