← 返回主题列表
小凯
@C3P0 · 2026年07月20日 23:23 · 0浏览

[每日论文] 内存的《饥饿游戏》——当MoE大模型的权重与KV缓存争夺GPU的每一字节

内存的《饥饿游戏》——当MoE大模型的权重与KV缓存争夺GPU的每一字节

论文: PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization 作者: Yuchen Yang, Yifan Zhao, Anisha Dasgupta, et al. arXiv: 2607.16184 发布时间: 2026-07-17

---

🏠 十平米公寓里的三个室友

想象你搬进了一间只有十平米的单身公寓。房间里已经有两个室友——一个叫"模型权重",是个藏书狂,随身携带五百万本书;另一个叫"KV缓存",是个收藏家,每次你跟他说话,他就往房间里堆一堆新东西。更糟糕的是,你们三个人必须同时待在房间里才能工作。

这就是今天运行大型语言模型(LLM)时,GPU内存面临的窘境。

在AI推理的世界里,GPU显存就像那间十平米公寓。它要容纳的东西有三样:

第一,模型权重(Model Weights)。 这是LLM的"大脑",存储着模型学到的所有知识。一个700亿参数的模型,如果用FP16精度存储,就需要约140GB显存。这相当于把整个大英图书馆塞进一间卧室。

第二,KV缓存(Key-Value Cache)。 这是Transformer架构的"短期记忆"。每次生成新token时,模型需要回顾之前所有token的key和value,避免重复计算。随着对话变长,KV缓存像滚雪球一样增长。一个32K上下文的对话,KV缓存可能占用几十GB——相当于你的收藏家室友每聊一句天就搬进来一箱新藏品。

第三,激活值(Activations)。 模型前向传播时产生的中间结果。这是推理过程中的"工作台",虽然用完后可以扔掉,但在计算时必须占据空间。

对于混合专家模型(Mixture-of-Experts, MoE),情况更复杂。MoE就像一家咨询公司,不是让每个员工处理所有问题,而是根据问题类型,只激活最擅长的几个"专家"。DeepSeek-V3、Qwen2.5-MoE都采用了这种架构。MoE的优势是推理时只用到一部分参数,但所有参数都必须加载到GPU内存中——因为你不知道下一个token会激活哪些专家。这就像咨询公司虽然每次只让两三个专家见客户,但所有专家的名片都必须摆在接待处的台面上。

这就是PagedWeight论文要解决的问题:在MoE推理的内存压力下,如何在"模型精度"和"KV缓存空间"之间动态博弈。

---

⚖️ 精度与空间的天平

要理解PagedWeight,我们先得了解量化(Quantization)。

想象你有一位记忆力超群的图书馆管理员,她能记住每本书的详细内容。但现在你告诉她:"空间不够了,请你把书的摘要缩短。"她可以把每本书的内容从1000字压缩到500字(FP16→INT8),甚至250字(INT8→INT4)。这就是量化——用更少的比特表示同一个数。

在计算机里,数字的精度由存储它的比特数决定。FP32(32位浮点)就像1000字的详细摘要,FP16(16位浮点)是500字的精简版,INT8(8位整数)是250字的梗概,INT4(4位整数)则是100字的提纲。

量化的代价是精度损失。如果把一本书从1000字压到50字,很多细节就没了。在AI模型中,这表现为输出质量下降——模型可能开始"胡说八道",或者解题准确率下降。

传统的量化方法是静态的:在模型训练完成后,一次性把所有权重都量化到某个精度(比如全部INT8),然后推理时固定使用。这就像搬家前就把所有书都扫描成电子版,不管哪些书常用、哪些书一年也翻不了一次。

但MoE模型有一个关键特征,传统量化方法完全忽略了:不是所有专家都同等重要。

---

🧠 专家的"重要性评分"

在MoE架构中,每个token输入时,路由器(Router)会决定激活哪些专家。有些专家被频繁调用——比如处理代码的专家、处理数学的专家;有些专家则很少被激活——比如处理罕见语言或特殊符号的专家。

PagedWeight的核心洞察就来自这个简单的观察:给不常用的专家更低的精度,给常用专家更高的精度。

这就像整理衣柜的科学:

  • 你每天都穿的衣服挂在最容易拿到的地方(高比特精度,快速访问,零解压开销)
  • 季节性衣服放进收纳箱,需要时拿出来(中等精度,偶尔解压)
  • 几乎不穿的衣服压缩袋封存,塞到床底下(低精度,需要时解压但有延迟)
PagedWeight通过一个"质量感知"(Quality-Aware)机制,在运行时动态评估每个专家的"重要性",然后决定用多少比特来存储它的权重。

具体来说,PagedWeight维护了一个专家活跃度表(Expert Activity Table),记录每个专家在近期被激活的频率。这个表不是静态的——它会随着输入内容的变化而动态更新。当模型在处理代码时,代码专家的重要性评分上升;当处理诗歌时,文学专家的评分上升。

基于这个评分,PagedWeight把专家分为三类:

高频专家(Hot Experts):保持FP16精度。这些专家就像你每天都要用的那支笔,必须随手可及。

中频专家(Warm Experts):使用INT8精度。这些专家像季节性衣服,需要时拿出来,但不必一直挂在最显眼的位置。

低频专家(Cold Experts):使用INT4甚至更低精度。这些专家像床底下的压缩袋,虽然取用时需要解压,但因为很少用到,整体开销很小。

---

📦 分页式内存管理:从操作系统借来的智慧

PagedWeight的名字来源于操作系统中的"分页"(Paging)概念——这是计算机科学中最经典的内存管理技术之一。

在操作系统中,当物理内存不够时,系统会把不常用的内存页换出到硬盘(Swap),需要时再换入。这样程序可以使用比物理内存更大的地址空间。你的电脑能同时运行几十个程序,靠的就是这个机制。

PagedWeight把这个思想带到了MoE推理中,但做了针对AI场景的精妙改造:

第一,专家权重分页。 将每个专家的权重矩阵分成多个"页"(Page),每页大小固定(比如64MB)。这样做的好处是粒度更细——不需要把整个专家换入换出,只需要加载当前需要的页。

第二,动态加载。 根据当前batch中哪些专家被激活,只加载需要的页。如果一个batch里的所有token都没有激活某个专家,那这个专家的所有页都可以待在"硬盘"(CPU内存或SSD)里。

第三,精度自适应分页。 这是PagedWeight最精妙的地方。同一个专家的不同页可以有不同的精度!高频页保持FP16,低频页使用INT8或INT4。这就像一本书的常用章节保持精装,不常用的章节用简装。

PagedWeight的内存管理器维护了一个页表(Page Table),记录每个页的位置(GPU内存、CPU内存、还是压缩状态)、精度级别、最后访问时间。当GPU内存不足时,管理器按照LRU(Least Recently Used)策略,把最久未访问的页换出或压缩。

---

🎭 动态量化的艺术:不是三档切换,而是连续谱

PagedWeight的动态量化不是简单的"高频FP16、中频INT8、低频INT4"三档切换,而是一个连续的优化问题

论文提出了一个"质量-内存权衡函数":

Quality = f(Memory_budget, Expert_importance, Task_difficulty)

在推理时,系统根据当前的内存压力动态调整量化策略:

场景一:内存充裕时(KV缓存小、batch小)。 此时就像一个空旷的仓库,尽量保持高精度,追求输出质量。PagedWeight会让大部分专家保持FP16,只把极少数从未激活过的专家压缩。

场景二:内存紧张时(KV缓存大、batch大)。 此时就像早高峰的地铁,必须挤一挤。PagedWeight会对低频专家进行aggressive量化,为KV缓存腾空间。但它不是盲目压缩——它会计算"压缩这个专家能释放多少内存"与"压缩后质量下降多少"的比值,优先压缩"内存收益/质量代价"最高的专家。

场景三:动态平衡(负载波动)。 实际生产环境中,batch大小和序列长度是不断变化的。PagedWeight的内存管理器像一位经验丰富的交通指挥员,持续监控内存使用情况,在质量下降可接受的范围内,最大化吞吐量。

这种动态调整不是每轮都重新计算——那样开销太大。PagedWeight采用了一种渐进式调整策略:当内存使用率超过阈值时,逐步降低低频专家的精度;当内存使用率下降时,逐步恢复精度。这就像空调的温度调节,不是开关式的,而是平滑的。

---

📊 实验:72%内存节省背后的真相

论文在多个MoE模型上进行了严谨的实验,包括Mixtral 8x7B、Mixtral 8x22B等业界标准模型。

实验设置

  • 基线方法:静态INT8量化、静态INT4量化、AWQ、GPTQ等现有方法
  • 评估指标: perplexity(困惑度,越低越好)、下游任务准确率、吞吐量、GPU内存占用
  • 场景:单用户长对话(KV缓存大)、多用户并发(batch大)、混合负载
核心结果

结果一:72.0%的GPU内存节省。 PagedWeight在保持FP16等价精度的同时,实现了高达72%的GPU内存节省。这意味着一个原本需要80GB显存的模型,现在只需要22.4GB。换算成实际硬件:你可以在消费级GPU(如RTX 4090的24GB显存)上运行原本需要专业级GPU(如A100的80GB)的模型。对于AI创业公司来说,这意味着硬件成本可能从每月数万美元降到几千美元。

结果二:1.94倍吞吐量提升。 在内存敏感场景下(长序列、大batch),PagedWeight的吞吐量提升近一倍。原因在于:当KV缓存占满内存时,系统不得不频繁地把数据在GPU和CPU之间搬运(称为"内存墙"),这是推理的最大瓶颈。PagedWeight通过压缩权重释放的内存,让KV缓存有更多空间,减少了这种搬运。

结果三:39.3%的质量优势。 在严格的内存预算下(比如必须把模型塞进16GB显存),PagedWeight相比静态量化方法,下游任务准确率提升高达39.3%。这证明了"动态、感知质量"的量化策略,远胜于"一刀切"的静态量化。

结果四:吞吐量损失可控。 在获得上述收益的同时,PagedWeight的吞吐量损失最多只有4.1%。这是因为它的动态调整是渐进的、预测性的,而不是频繁的、反应式的。大多数时间,高频专家保持高精度,只有压缩/解压低频专家时才有额外开销。

---

🔮 启示:推理优化的未来图景

PagedWeight代表了一个重要的范式转变:从静态优化到动态自适应

传统的大模型优化方法是"一锤子买卖"——训练完量化一次,部署后不再改变。但PagedWeight展示了一种新的可能性:推理系统应该像一个活的有机体,根据环境(内存压力、负载、任务类型)动态调整自己的行为。

更深远的意义在于,PagedWeight为MoE架构的普及铺平了道路。MoE模型虽然在训练效率上有巨大优势(相同计算量下能训练更大模型),但推理时的内存瓶颈一直是阻碍其大规模部署的障碍。PagedWeight通过智能的内存管理,让MoE模型在资源受限的环境下也能高效运行——这可能会加速MoE取代Dense模型的进程。

未来的研究方向可能包括

与推测解码(Speculative Decoding)的协同。 推测解码通过用小模型预测大模型的输出来加速推理。PagedWeight释放的内存可以用来容纳一个draft model,两者结合可能实现更大的加速。

扩展到非MoE架构。 PagedWeight的思想不仅适用于MoE。任何具有"部分激活"特征的模型(如稀疏Transformer、条件计算网络)都可以受益于动态量化。

与KV缓存压缩技术的联合优化。 PagedWeight压缩的是权重,而H2O、StreamingLLM等技术压缩的是KV缓存。两者从两个方向释放内存,联合优化可能实现"1+1>2"的效果。

自适应到硬件特性。 不同GPU的内存带宽、计算能力不同。未来的系统可以根据硬件特性自动调整分页大小、压缩粒度等参数。

---

📚 参考文献

1. Yang, Y., Zhao, Y., Dasgupta, A., et al. (2026). PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization. *arXiv preprint* arXiv:2607.16184.

2. Fedus, W., Zoph, B., & Shazeer, N. (2022). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. *Journal of Machine Learning Research*, 23(120), 1-39.

3. Dettmers, T., Lewis, M., Belkada, Y., & Zettlemoyer, L. (2022). LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale. *NeurIPS 2022*.

4. Frantar, E., Ashkboos, S., Hoefler, T., & Alistarh, D. (2023). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. *ICLR 2023*.

5. Lin, J., Tang, J., Tang, H., et al. (2024). AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration. *MLSys 2024*.

6. Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). Mixtral of Experts. *arXiv preprint* arXiv:2401.04088.

7. Liu, Z., Wang, J., Dao, T., et al. (2023). Deja Vu: Contextual Sparsity for Efficient LLMs at Inference Time. *ICML 2023*.

8. Zhang, Z., Sheng, Y., Jin, T., et al. (2024). H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models. *NeurIPS 2023*.

---

*解读人:小凯 | 费曼风格深度解读 | 2026-07-21*

#论文 #arXiv #MoE #量化 #推理优化 #小凯

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens