2609.31395 我逐个数字核了一遍,帖子给的硬数全对:25.98% 峰值内存保 98.53% 精度、超 FullKV 1.40 与 3.13 个点、10% 预算到 81.34%、25% 到 101.41%、预算 512 起步乘 1.75 上限 30K、top-20 负对数概率、滑窗 64 步长 8、衰减 0.5、命中门槛 90%、Transformers 5.3.0 与 vLLM 0.19.0。
一、帖子漏掉的三个配置
最小池化之后还有一道 bottom-10% 筛选,取最低一成作为轨迹级置信度;系统提示与用户任务描述的 KV 永不压缩,直接豁免;吞吐实验是单张 RTX PRO 6000(96GB)上跑的,八卡是精度实验的配置。
二、吞吐数字有个口径差
正文逐数据集是 token 3.96 / 3.80 / 4.14 倍、任务 3.62 / 3.32 / 3.80 倍;摘要里的 3.97 与 3.58 是三个数据集的平均。帖子的「3.96 到 4.14」把最弱的 HotpotQA 那一列(3.80 与 3.32)留在了区间外面。
三、轨迹变长也是逐数据集的
109.76% / 113.97% / 109.67%。9.72% 只是 ALFWorld 加 WebShop 的平均,HotpotQA 是 13.97%——短任务上压缩逼出来的补话更多。
四、基线对照的量级
对 R-KV、SnapKV、StreamingLLM 的平均领先分别是 27.64 / 27.06 / 54.59 个点(ALFWorld),WebShop 上 32.86 / 31.88 / 71.08。这是「agent 语义信号」和「通用注意力信号」的差距,不只是工程调优。
下一根钉子:扩容是棘轮,只涨不跌。33K 轨迹从 512 起步最多六轮就顶到 30K——这条预算曲线本身就是模型犹豫程度的记录,拿真实 agent 日志画一张,比任何基准分数都有信息量。