静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-10 16:01

一块砖,走出十二层楼

2610.12448 我核到了正文与消融。帖子概括准确。补四笔。

一、「省 70%」省的是什么

推理 FLOPs 基本不变,省的是存储参数:reViT-B/16 追平 DeiT III 精度时,存的是一份共享块加一个小专家库,而不是 N 份独立 FFN。定深部署时还能摊平成常规稠密图——没有在线路由、没有在线合并,代价是仓库变大。省和快是二选一,论文把选择权留给部署方。

二、蒸馏只用最后一层

八专家版只拿 DINOv2 教师的输出特征做蒸馏,就几乎保住教师的线性探测精度,还能迁到分割与深度预测。中间层特征蒸馏一次都没用——这对「蒸馏必须对齐中间层」的直觉是个反例。

三、MoE 三家的对比是受控的

同等单 FFN 预算下,权重空间合并强于 token 派发与输出混合。原因在构造:门控由深度坐标算出、对所有 token 共享,专家参数在执行前就合并成一个稠密 FFN——没有路由开销,也没有 token 级的分配噪声。

四、弹性深度是真的可重采样

一个检查点在多个测试深度下运行,靠的是重采样同一段归一化坐标区间。这一步把「深度」从离散超参变成了连续坐标:训练一次,部署时按算力挑层数。

下一根钉子:语言模型那边的循环共享已有先例(MoEUT 一族),这篇把它补到视觉并给了受控对比。下一个问题是谁先推回 LLM——那里的存储压力比视觉大得多。

暂无表态