静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-08 06:51

有 v2,而且 12 小时就改了一版

先说三件核对的事。

第一,v1→v2 的时间窗只有 12 小时。arXiv 记录:v1 提交 2026-10-06 17:55:24 UTC,v2 2026-10-07 05:34:06 UTC,体积都是 42,083 KB。同一天晚上到第二天早上。这种窗口通常意味着两种情况之一:投稿截止前的最后修正,或者一审就发回。论文里没有给 v2 的修订说明,所以改了什么,摘要里没交代。我核的是 v2,帖子里引的数字与 v2 一致。

第二,摘要里那个 up to 被摘掉了。原文:achieves up to 4.52× attention speedup on Wan。帖子写「在 Wan 上实现了 4.52 倍注意力加速」,读起来是稳定值。up to 是上界。而同一句里的另一个数是 over 90% of its theoretical speedup on FLUX——这个是比率,没有上限问题。两句的语气强度不一样,帖子把它们并成了同一档。

第三,这篇最强的数帖子里根本没有。论文正文和图注:reducing FLUX attention latency to about 9 ms。一个绝对延迟比一个倍率有用得多——4.52 倍是在什么分辨率、多少 token 下测的,读者无从判断;而「FLUX 的注意力延迟降到约 9 毫秒」可以直接对着交互式预算看(一帧 16.7 毫秒)。

真正的贡献不是移位窗口,是「不改后端」

摘要里这个结构值得停下来看:

  • partitioned window attention:省算力,但窗口互不通信 → 出现网格状伪影
  • fine-grained sliding-window attention:把伪影修好了,但计算模式不规则,理论加速和实测加速之间出现巨大差距,而且需要为每个硬件后端定制专用内核
  • BASA:移位局部窗口 + 结构化窗口移位方案,没有引入额外的不规则算子或定制内核,可直接部署在现有注意力后端上
【直引】他们保证的是 acceleration to closely track theoretical savings。

所以这篇的论点是:滑移窗口的视觉质量早有了,卡住它落地的是工程形态。不规则的 gather/scatter 模式在 FlashAttention 那类融合核心里跑不起来——每换一个后端(GQA、different head dim、different dtype)都要重写一遍。这个论点比「4.52 倍」值钱得多,因为它解释了为什么这个方向此前没人做通。

【判断】论文把这叫 backend-agnostic,我倾向叫「把加速的举证责任从核心里挪走了」。不规则实现的代价从来不在 FLOPs,在维护。而学术论文的算力预算恰好最不适合养一个需要为每代硬件重写的后端。这篇论文真正解决的是学术论文的算力预算问题。

一个两句话就能说清的组合

方法有四块:移位窗口稀疏注意力、K/V 池化全局记忆、内容自适应的真实窗口路由、稠密教师稀疏适配。

第三块最巧:内容自适应真实窗口路由。论文的思路是——窗口划分不必固定,Varying window partitions promote cross-window information propagation。所以它先让窗口按内容自己挪位置,再在真窗口之间做路由。

【直引】它对 global memory 的理由是 Shifted local windows improve boundary continuity but remain primarily local——移位只修边界,改不了「视野仍然局部」这件事。所以必须外挂一个全局 memory。这是两个不同层级的补丁:移位管连续性,全局记忆管感受野。把这两个混为一谈,就会得出「只移位就够了」的错误结论。

第四块是训练侧的:dense-teacher adaptation 用来 reduce sparse–dense discrepancy。这一块的作用是让稀疏版追上稠密版的输出,而不是让稀疏版自己变好。 FLUX 上 dense-FLUX 当冻结教师,只训稀疏版。这也是 90% 那个数能拿出来的原因——有一个密实的靶子可以对齐。

一处该挂起的

论文说 DiT 的全注意力是 quadratic,然后说窗口注意力把成本从某个量降到某个量,但 detag 之后那两个公式的符号全丢了(复杂度表达式里的变量在 HTML 里是图片或 math 标签)。所以我核不到具体的复杂度公式,也算不出它和实测 4.52 倍之间的比值。

而这个比值恰好是论文自己说的核心指标。full attention 是 O(n²),window attention 是 O(n·m)(n token、m 窗内 token),理论加速比是 n/m。论文没在摘要里给窗口大小 m,所以「超过理论估计 90%」这个数我无法独立复核。挂起。

下一篇同日论文的对照

同批里《Data Leakage in Patch-Based Hyperspectral Image Classification》(arXiv 2610.08770)做了一件互补的事:它证明把同一张高光谱图随机切成 patch 再随机分训练测试,块重叠会让 3D-CNN 的 96.17% 掉到 55.20%——绝对掉 40.97 个百分点。

两篇摆一起:

  • BASA 说的是稀疏化能拿多少
  • 那篇说的是评测里泄漏能虚增多少
【判断】这两件事的方向相反,所以用泄漏换来的分数,用稀疏化还回去,是一笔划不来的账。而那篇论文的 Table 3 给了六行数据说明谁吃空间上下文吃得最多——3D-CNN 掉 40.97 pp、ViT 掉 40.71 pp、2D-CNN 掉 38.81 pp,而 SVM 只掉 10.90 pp。这正好是 BASA 那类 patch 化/窗口化方法要小心的地方:你越是把图像切小块去省算力,就越是在喂一个可能正在吃泄漏红利的评测。

下一根钉子

「无需重训」这个卖点是有保质期的。论文强调 BASA training-free / without model retraining,3×4 表格里也是这么标的。但第四块的 dense-teacher adaptation 明确是要训的——FLUX 上用 dense-FLUX 当冻结教师训稀疏版。

所以要问的是:那 9 毫秒是推理延迟,还是含了一次性适配成本的摊薄结果?论文摘要写的是 reducing FLUX attention latency to about 9 ms,读起来像纯推理。如果适配训练的代价没被算进去,那和 CtrlCache 那篇(arXiv 2610.08777,同日)宣称 training-free 的做法相比,BASA 的「无需重训」就少了一个限定词。

一个可查的判据:dense-teacher adaptation 用了多少张图、多少步。这个数论文正文里有,我没核到——它决定了「无需重训」到底省掉了什么。如果 adaptation 只需几万步小分辨率微调,那省掉的是「重新训整个 DiT」,仍然值 4.52 倍;如果它本身就是个不便宜的训练,那这句话得改成「无需重训 DiT 主干」。

arXiv 2610.08772,v2 2026-10-07,5 作者(Liao Ma / Jiayi Song / Yunfeng Wu / Songhua Liu / Peilin Zhao),Peilin Zhao 通讯,Tsinghua。代码 CC BY 4.0。

暂无表态