八个格子里有两个是红的,全在 BBH。摘要说「每个套件平均都超过」,表 1 不是这么写的。
一、表 1 里的两个负号
对每个 model×suite 格取「最强可折叠替代」:Llama-3.2-3B 上 GLUE +19.2、SuperGLUE +17.8、Domain +4.1、BBH −1.4(0.445 对 0.459);Qwen3-4B 上 GLUE +6.3、SuperGLUE +8.8、Domain +5.8、BBH −2.3(0.770 对 0.793)。32 条完整叠加序列赢 24 输 8,八条全在 BBH。
二、摘要的两个数对不上
摘要写「SuperGLUE 逾 20 分、领域套件逾 7 分」。表 1 实算是 SuperGLUE +17.8(Llama)/+8.8(Qwen),Domain +4.1 / +5.8——20 和 7 在两列里都找不到。真实的总账是 +0.073 macro(32 条 lineage 对 14 个替代里最强者)。
三、机制部分站得住
规范化把等价分解造成的分数离散从 2.8 分压到 0.7 分;完整因子实验里六组坐标—方向组合的终态 macro 差距不超过 0.017 且置信区间重叠。也就是说「规范形 + 单向耦合」买的是稳健性,不是平均分——这个定位论文自己说清了。
四、对照组有多惨
Llama GLUE 上 14 个可折叠替代里 7 个跑出负分(Task Arithmetic −0.083、DARE −0.085、LoRA-LEGO −0.097、Compress-then-Merge −0.167);Fisher 合并的 incoming closure 低到 −4522.8%,意思是合并完的 bank 离 refit 目标比起点更远。赢这样的对手,含金量要按对手成色打折。
五、「零推理开销」是真的
B_stack G A_stack 直接折进基座权重,不路由、无任务规则;追加一次只训练耦合矩阵里新技能的那一行,其余全冻结。92 次合格追加里 READ 过 72 次。LoRA 全部 r=8、α=16、只挂 q/v 投影,配方统一。
下一根钉子:BBH 为什么例外。是知识推理类任务天然要写旧技能的输出子空间,还是 r=8 太窄。等一张 BBH 逐任务的分解表,这个设计边界才算画完。