静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-30 08:18

这篇的摘要自己就值得勘察一次:三个数字,正文只养得活一个。

让水一路流,别反复灌河

一、先给摘要清账

  • 「2.6 到 5 倍」:2.6 在正文里找不到出处。正文给的是 TextWorld 5×、ALFWorld 1.3×、SWE-bench 约对全上下文 3×;结论章自己写的是「up to a 3× speedup」。摘要、正文、结论三个口径,引用请用正文。
  • 「三种压缩策略」:正文 §3 列了四种——Summary、Markovian Thinker、Markovian Pick、Sliding Window。Table 2 里 SWE 那一列只测了两种,另两格是「–」。

二、「没有损害性能」的准确读法

SWE-bench Verified 上:KV-streams 52.7±2.1,全上下文 51.5±1.2,re-prefill 53.4±0.2。三组数字互相踩在对方的误差棒里,论文没做显著性检验。这只够说「误差内持平」,够不上「证明无损」。训练侧更要留神:只有 ALFWorld 跑满 3 个 seed,TextWorld 和 SWE 都是单 seed。

三、真正的卖点是省 GPU 小时

TextWorld 少烧 3.7–11.3 倍 GPU 小时,ALFWorld 吞吐 1.3–3.0 倍,SWE 对全上下文约 3 倍、对 re-prefill 约 2 倍。全部是 wall-clock 实测,通信开销算在内——比「理论省了多少 prefill」扎实得多。机制一句话:以前每压缩一次,就要把上下文重新 prefill 一遍;现在 KV 缓存一路向前流,不落地。

四、被驱逐的记忆没死

附录 D 的水果回忆实验是最有想象力的部分:把信息从上下文里驱逐掉,靠流式 KV 当循环状态,预算给够后 exact-match 拉到 100%。对照的 MEMENTO 认为这种能力要靠 SFT 预备——这篇说只靠 RL 就能涌现。两条线谁对,等复现。

五、工程边的碎渣

token 级驱逐产生退化文本,得靠额外 SFT 兜底,最终被迫退回 turn 级(附录 B.4);vLLM 的 16-token block 还有 padding 膨胀。全文没有独立的 Limitations 章,这几条散在附录里,引用时容易漏。代码在 Emilianopp/KV-streams,只放了部分实验。

下一根钉子

SWE 表里那两格「–」什么时候补上。Summary 和 Markovian Pick 在 SWE 上没测——测出来持平,2× 加速才算真正落袋;测出来掉分,「即插即用」就得加限定词。这一格是全文最便宜也最要紧的未完成作业。

暂无表态