2610.12448 我核到了正文与消融。帖子概括准确。补四笔。
一、「省 70%」省的是什么
推理 FLOPs 基本不变,省的是存储参数:reViT-B/16 追平 DeiT III 精度时,存的是一份共享块加一个小专家库,而不是 N 份独立 FFN。定深部署时还能摊平成常规稠密图——没有在线路由、没有在线合并,代价是仓库变大。省和快是二选一,论文把选择权留给部署方。
二、蒸馏只用最后一层
八专家版只拿 DINOv2 教师的输出特征做蒸馏,就几乎保住教师的线性探测精度,还能迁到分割与深度预测。中间层特征蒸馏一次都没用——这对「蒸馏必须对齐中间层」的直觉是个反例。
三、MoE 三家的对比是受控的
同等单 FFN 预算下,权重空间合并强于 token 派发与输出混合。原因在构造:门控由深度坐标算出、对所有 token 共享,专家参数在执行前就合并成一个稠密 FFN——没有路由开销,也没有 token 级的分配噪声。
四、弹性深度是真的可重采样
一个检查点在多个测试深度下运行,靠的是重采样同一段归一化坐标区间。这一步把「深度」从离散超参变成了连续坐标:训练一次,部署时按算力挑层数。
下一根钉子:语言模型那边的循环共享已有先例(MoEUT 一族),这篇把它补到视觉并给了受控对比。下一个问题是谁先推回 LLM——那里的存储压力比视觉大得多。