KVMem 发布:16G 显存跑满 27B/256K 上下文——KV 缓存的历史部分,搬进内存
KVMem(kvmem/kvmem-llama.cpp)是一个基于 llama.cpp 的新方案:16GB 显存的卡跑 Qwen3.8-27B,256K 上下文拉满,decode 稳在 30-40 tok/s(5060 Ti 实测)。思路一句话:已完结的历史 KV 缓存放进系统内存当池子,GPU 只保留一个有限的激活…
KVMem(kvmem/kvmem-llama.cpp)是一个基于 llama.cpp 的新方案:16GB 显存的卡跑 Qwen3.8-27B,256K 上下文拉满,decode 稳在 30-40 tok/s(5060 Ti 实测)。思路一句话:已完结的历史 KV 缓存放进系统内存当池子,GPU 只保留一个有限的激活窗口,每次只把当前问题最相关的部分捞回显存——256K 的工作区,显存里只常驻 32K。项目 9 月 14 日开源,已有 arXiv 论文(2609.04852,*Virtualizing Million-Token Agent Workspaces on a Consumer GPU*),24GB 5090 Laptop 上工作区可扩到 1M token。精度账:LongMemEval-S / AgentLongBench 上,32K GPU 窗口对全 256K 历史,85.6% vs 86.6% 准确率、60.9% vs 59.5% 任务成功率——几乎无损。OpenAI 兼容接口,chat/tools/vision 都支持,现有本地客户端直接指过去。
以下是发布说明:
仓库:https://github.com/kvmem/kvmem-llama.cpp
推荐下 melis up 主的评测视频,有实际跑出来任务的例子:https://www.bilibili.com/video/BV11deu6xEdD/
Windows CUDA 13/12 预编译版本:https://github.com/kvmem/kvmem-llama.cpp/releases/tag/v0.16.0-rc3 Windows ROCm 预编译版本:https://github.com/kvmem/kvmem-llama.cpp/releases/tag/rc3-rocm-beta
Win CUDA 13 版本理论可适配 NVIDIA RTX 20/30/40/50 系显卡,Quadro RTX、RTX A、RTX Ada、RTX PRO Blackwell 系列专业卡,以及 T10、T4、A10、A30、A40、A100、L4、L40/L40S、H100/H200 等服务器显卡。CUDA 12 版本可支持 V100。
ROCm HIP 含 gfx1100/gfx1200/gfx1201,理论支持 RX 7900 系列 / 9060 XT / 9070 系列。
若有安装使用问题请反馈,谢谢。
注:Mac 适配版本正在开发中(Mac 将把 kv 卸载到磁盘,释放统一内存空间,如让 48G MacBook Pro 跑大上下文更省内存)。
欢迎提 issue 和交流试用体验!
本号补充核对(海关视角,发布前逐项验证过):
仓库与 release 均已核实存在:v0.16.0-rc3(09-20,含 Windows CUDA 13/12 包)与 rc3-rocm-beta(09-23,Windows/Linux 包)都在,之后还有 rc3-rocm-beta2(09-24)和 v0.16.0-rc3-prism.3(09-24,附 CODING-MTP-RESULTS.md)——迭代很快,装之前看一眼最新 tag。仓库 09-14 创建,一周 700+ star。
两件事原文里没展开,但对决定「要不要装」很关键:
一,有损性是明牌的。社区有质疑(引 CacheBlend 论文,认为标准注意力的 KV 不能这样分块),作者的回应原话是:「我知道我们在计算上是不等价于原始 kv 的,我们也没有尝试证明这一点。但是这种有损的恢复在实际中效果非常好,其实也是超过我们预期的。」上面那组 85.6% vs 86.6% 就是实测边界,不是无损承诺。UP 主补了条经验公式:激活窗口大约能撑 6 倍长度的逻辑上下文,默认 32K 激活下把逻辑长度拉到 200K 以上容易出现幻觉——想稳就别拉满。
二,显卡适配是「理论」口径。说明里写的是「已包含对应架构代码,具体型号需结合驱动与实机验证」——社区三天里跑出来的实测表(5060 Ti 16G 30-40 t/s、5070 Ti 16G 50-65、4070 TiS 40-70、5050 笔记本 prefill 100+/decode 10、8G 卡配三值模型 128K 下 22 t/s)覆盖的主要是 40/50 系消费卡,20 系和服务器卡的反馈还少,买前先翻 issue 区。
Windows 部署若遇到显著降速,排查显存占用是否 100%:(1) 把多模态头卸载到 CPU(最新 rc3 已默认);(2) 不行就把 budget 降到 32K、gen reserve 降到 10K。