Attention Residuals(AttnRes)与其他残差变体的对比
Kimi 这篇论文(arXiv:2603.15031)主要针对 PreNorm + 固定权重残差 的痛点提出 AttnRes,同时在 Related Work(Section 6)和 Table 5 中系统对比了多种残差机制。下面我用论文原文 + 原理分析,给你一个清晰、结构化的对比(包含公式)。
1. 各残差变体核心机制(公式对比)
- 标准固定残差(PreNorm/PostNorm 基础)
- PostNorm(原 Transformer)
- PreNorm(当前主流,如 LLaMA)
- ReZero(2020, Bachlechner et al.)
- SkipInit / LayerScale(类似变体)
- Highway Networks(更早的门控残差)
- DenseFormer(2024)
- mHC(Manifold-Constrained Hyper-Connections,2025/2026)
- Attention Residuals(AttnRes,本文创新)
2. 核心差异总结(论文观点 + 原理)
| 变体 | 权重类型 | 是否输入依赖 | 可访问范围 | 主要问题/局限 | AttnRes 优势(论文实证) |
|---|---|---|---|---|---|
| PreNorm/PostNorm | 固定 =1 | 否 | 仅上一层 | PreNorm:幅度 O(L) 爆炸 + 稀释 PostNorm:梯度消失 | 彻底解决稀释,幅度/梯度均匀(Fig.5) |
| ReZero/SkipInit/LayerScale | 可学习标量/向量 | 否(慢学习) | 仅上一层 | 只能“放大或缩小当前层”,无法跳层选择 | 更灵活:动态选择任意先前层 |
| Highway | 输入依赖门控 | 是 | 仅上一层 | 仍受限于单层交互 | 扩展到全深度注意力 |
| DenseFormer | 固定标量 | 否 | 所有先前层 | 权重不随输入变化 → 无收益 | 加上输入依赖后大幅超越 |
| mHC | 学习混合矩阵 | 是 | 多流递归 | 内存/通信开销极高 | 相同收益下开销更低 |
| AttnRes | softmax Attention | 是 | 所有先前层 | 开销稍高(Block 版解决) | 最强表达力:内容依赖 + 全深度选择 |
3. 论文实验验证
- Scaling Law:AttnRes 在不同计算预算下都一致优于 baseline(包括 PreNorm)。
- 48B 真实预训练(Kimi Linear):下游全任务提升(GPQA 多步推理 +7.5,HumanEval 代码 +3.1)。
- 分析图:AttnRes 输出幅度不随深度爆炸,梯度在各层分布更均匀(完美解决 PreNorm 稀释)。
- Block AttnRes(分块版)几乎零额外开销,却保留大部分收益,可直接落地。