[论文] STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State ...

研究领域: NLP 作者: Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Zhenan Sun, Ying Wei 发布时间: 2026-09-29 arXiv: 2609.38169

论文概要

研究领域: NLP 作者: Bingchen Yao, Haobo Xu, Haokun Lin, Yichen Wu, Ziyu Guo, Renrui Zhang, Zhichao Lu, Zhenan Sun, Ying Wei 发布时间: 2026-09-29 arXiv: 2609.38169

中文摘要

线性注意力用固定大小的循环状态替代不断增长的KV缓存,但在并发服务下,这些持久状态可能成为显著的内存瓶颈。直接将循环状态量化到低精度往往导致严重的精度下降,因为量化误差会通过连续的状态更新传播。我们发现这些误差的影响取决于两个互补的维度:时间上,长寿命记忆中的误差可能跨多个解码步持续存在;空间上,不同键行(key row)的误差对模型输出的影响各不相同,而状态幅值在行和列两个方向上都有显著差异。基于这些观察,我们提出STEPQuant——一个面向Delta-rule循环状态的时空训练后量化框架。STEPQuant根据误差大小和记忆寿命分配精度,并基于状态分布和键行对输出误差的影响联合拟合键行和值列的缩放因子。在Qwen3.8-27B和Kimi-Linear-48B-A3B-Instruct上,跨越长生成和短生成基准的实验表明,STEPQuant在名义6-bit预算下紧密匹配FP32状态精度,其4-bit配置优于均匀INT8。集成到SGLang并配合优化的GPU内核,6-bit STEPQuant实现了超过5倍的循环状态压缩,并将总服务内存减少高达68.7%。代码已开源。

原文摘要

Linear attention replaces growing KV caches with fixed-size recurrent states, yet these persistent states can become a substantial memory bottleneck under concurrent serving. Directly quantizing recurrent states to low precision often leads to severe accuracy degradation, as quantization errors propagate through successive state updates. We discover that the impact of these errors depends on two complementary dimensions: temporally, errors in long-lived memory can persist across many decoding steps; spatially, errors in different key rows affect model outputs differently, while state magnitudes vary substantially along both rows and columns. Motivated by these observations, we propose STEPQuant, a spatial-temporal post-training quantization framework for Delta-rule recurrent states. STEPQu...


*自动采集于 2026-10-01*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

均匀 INT6 从 80.60 崩到 45.04,STEPQuant 拉回 80.59——这部分是硬活。但 5 倍和 68.7% 各带一个前提。

先说真的。并发服务下循环状态成为内存瓶颈(§1 图 1a),不假;直接低比特量化崩掉,也不假——Qwen 上均匀 INT6 从 80.60 掉到 45.04。STEPQuant@6bit 是 80.59,FP32 是 80.60,逐任务最大落差只有 −0.94(Qwen HMMT)与 −1.27(Kimi GPQA-D)。吞吐还没掉:表 F7 里 B=512 时 Qwen decode 从 6,040 涨到 7,280 tok/s。校准只用 32 段 ×2048 token 的 WikiText-2,成本可以忽略。这个组合是真的。

但三个数字都是"条件最优值"。

  • 全文没有 FP16/BF16 状态基线。 所有对比都是 FP32 vs INT4/6/8。如果一套服务栈的状态本来就是 FP16,那 5.03× 的真实收益是 5.03÷2≈2.5×。这是最该有、却没有的一条基线。
  • 68.7% 是单一工况。 Qwen + W4 权重 + batch=512(§5.6,419.73→131.18 GiB);Kimi 只有 53.7%(附录 F.4)。更要紧的是它依赖 SGLang radix-cache 给每请求预留 5 个状态槽(附录 F.3 的 (5B+1)S)——按 1 槽/请求算,同工况降幅只有约 46%。图 1a 那句"70 并发时状态超过 BF16 权重"同理:5 槽下 50.3 GiB > 50.09 GiB 成立,去掉超预留要约 341 并发才越线。
  • "4-bit 优于均匀 INT8"是均值口径。 26 个逐任务对比里输掉 4 个:Kimi EvalPlus 74.54 vs 75.46、ARC-C 90.96 vs 91.98、WinoGrande 54.93 vs 55.80、Qwen MMLU 82.07 vs 82.19。Kimi 长生成 4-bit 掉 3.00 分,主因是 AIME 2026 从 68.33 崩到 59.17(−9.16)。论文自己在 §1 也承认 Kimi 4-bit"仍有明显差距"。
一条读起来别扭但很值钱的观察:4-bit 反常地优于 6-bit。Qwen 表 1 里 LCB 86.35>85.42、HMMT 73.86>73.30、GPQA 81.57>80.87,表 2 短生成均值 87.63>87.54;W4 设定下表 3 的 AIME 4-bit 85.42 甚至高出 FP32 基线(82.92)2.5 分。位宽与精度非单调,指向分配器不够稳,或评测噪声——MATH-500 每问只有 4 个样本,LCB/EvalPlus 5 个。

可复算:内存账对得上,而且几乎全部来自状态池。W4 权重 16.55 GiB;(5×512+1) 槽 ×146.8125 MiB = 367.2 GiB,压缩后 ×31.4375 MiB = 78.6 GiB,差 288.6 GiB,与实测差 288.55 GiB 吻合到 0.05。所以 68.7% ≈ 状态池降幅 × 状态池占比(87.5%)。

另外两条:名义 6-bit 的实际平均位宽是 6.30 bit,4-bit 是 4.30 bit(表 G8);基线里 DAMP 的数字是从对方论文抄的、未复现,作者自陈评测设置不同无法严格对比,而表 G8 里 DAMP 9.9bit 的保持率 100.99% 反而略高于本文 6bit 的 100.51%——这张表不能当胜负判据。

一句话:5× 读作"相对 FP32",68.7% 读作"Qwen + W4 + batch 512 + 5 倍状态槽预留"。你的服务栈若不超预留、或基线本就是 FP16,这两个数各打一次折。

5 倍与 68.7%,各带一个星号

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens