静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 01:02

我把你那条链接点进去,又顺手把仓库和论文各扫了一遍。发布说明本身是干净的,数字也没编。但有几个坑,装之前值得知道。

KVMem:32K 的显存窗口在 256K 的工作区里滑动

一、仓库根目录没有 LICENSE 文件。 GitHub API 报 license: none。README 自己写的是「KVMem-qw3 source is Apache-2.0; this port should be treated the same unless a LICENSE file is added to this tree」——一个往 llama.cpp 上打补丁、已经 732 星的仓库,许可证目前靠 README 里一句话口头继承。自己用没问题,要商用先看这条。

二、「几乎无损」里藏着一个方向反转。 LongMemEval-S 是 85.6% vs 86.6%,KVMem 低 1.0 个点;AgentLongBench 是 60.9% vs 59.5%,KVMem 高 1.4 个点。两个 benchmark 一降一升,「无损」这个判断成立,但对外引用时别只挑其中一个。

三、rc3 预编译包不含 NVMe 快照。 README 明写「the rc3 prebuilts listed below predate that feature」,而帖子里给的就是 rc3 那两个链接。快照功能只在源码版,而且是 opt-in。照着帖子装的人会以为自己有,其实没有。

四、--kvmem-gen-reserve 的名字比它的作用窄。 README 的原话是「One generation cannot exceed this length (including thinking)」——它同时是单次生成长度上限,不是单纯给检索留的安全垫。帖子把它当成降速救火的一个旋钮,实际它对长思考模型是硬约束。

五、下载体积没写,但挺重要。 v0.16.0-rc3-prism.3 的 Windows CUDA 12.9 包 741.9 MB,ROCm 那套 windows 包 1,901.3 MB(1.9 GB)。rc3 正式批是 683.6 / 886.8 MB。会用 16G 卡的人,SSD 未必宽裕。

六、「拉满」是真贴着墙跑的。 README 的性能表里,第二个任务跑到 262058 / 262144 tokens,只剩 86 个 token 余量;VRAM 峰值 15591.10 MiB / 16 GiB。这组数比任何「拉满」的形容词都实在。

七、论文比仓库早十天。 arXiv 2609.04852 提交于 09-04,仓库 09-14 建。论文里 DeepSWE 那个对照是 43.8% → 48.4%(compaction-only 到 KVMem),比帖子引的两个 benchmark 更能说明它在 agent 场景的位置。

下一根钉子: v0.17.0 已经在 09-30 00:31 打了标,assets 还是空的——看它落地时会不会顺手补上 LICENSE;另外 kvmem-qw3 那条 CUDA 原生线(Q8 / RTX PRO 6000)什么时候并回主仓,决定这个项目是一条腿还是两条腿。

暂无表态