Prefix Sliding 海关:「想得越久越贵」真的被治了,但「边想边忘」的直觉其实对应论文里输掉的那个方案

周六素材:视频讲斯坦福 Prefix Sliding(arXiv 2608.26070v1,08-26),说它治好了慢思考模型的显存爆炸。溯源:论文 HTML 全文实抓 + GitHub 仓库(Muennighoff/prefix-sliding,22 星,08-27 最后 push)。海关结论先给:视频大节全部属实…

Prefix Sliding 海关:「想得越久越贵」真的被治了,但注意——「边想边忘」的直觉其实对应论文里输掉的那个方案

周六素材:视频讲斯坦福 Prefix Sliding(arXiv 2608.26070v1,08-26),说它治好了慢思考模型的显存爆炸。溯源:论文 HTML 全文实抓 + GitHub 仓库(Muennighoff/prefix-sliding,22 星,08-27 最后 push)。海关结论先给:视频大节全部属实——常数成本是原文原句,「鬼打墙无限复读」有引用支撑,数学题草稿纸类比逐句忠实。但有一个高级错位值得展开:视频用「边想边忘」解释这个方法,而「边想边忘」(把中间步骤总结后丢掉)恰好是论文里被 Prefix Sliding 击败的 Summary 对照组——真正的方案更激进:中间推理 token 不总结,直接丢。丢掉的东西里没有任何压缩替身。

一、海关裁决表

视频声明论文原文裁决
「o1、DeepSeek-R1 这类慢思考模型必须 Full Attention」"keep the entire reasoning trace in memory via full attention, as used in most language models"(Sadhukhan et al. 2025)合理举例:论文说的是「大多数模型」,没点名这两家,但举例方向无误
鬼打墙、无限复读、OOM原文列举长上下文四害:distraction / context poisoning / repetitive loops(Pipis et al. 2025)/ lost knowledge + 成本线性增长属实,列举忠实
「斯坦福等顶尖团队」Muennighoff、Ludwig Schmidt、Percy Liang、吴恩达(Stanford)+ UW(Zettlemoyer/Yejin Choi/Mike Lewis)+ UCSB + Prime Intellect,17 人属实,全明星阵容(一作 Muennighoff 是 s1/simple-evals 老人)
数学题类比(题目=prefix 牢记 / 草稿纸=丢 / 当前行=窗口)原文例子 ((42+84)×4)−5:42+84 算完后推理过程不再需要,只有结果重要忠实,类比逐句对应
「成本直接变成常数」"The cost of generating an additional token is the same regardless of whether the model has already generated millions or billions of tokens"属实,原句直取——但有 warm-up 前提(见边界①)
「显存占用稳如老狗」Table 1:Full 速度 32K→128K 掉 1477→448 tok/s(3.3 倍衰减),window 4096 稳在 5479→5224属实且有工程实证(自写 Hopper/FlashAttention kernel)
3 倍提速"3x faster while maintaining performance"(无训练版);32K 处 5479 vs 1477 ≈ 3.7x属实,长生成时差距更大

二、「边想边忘」的错位:Summary 输给了「直接丢」

论文的对照组设计比方法本身更有信息量。三个常数显存方案同台:

  • Last k:生成到阈值 n,删到只剩最后 k 个 token(k=256)。agent 圈已在广泛使用(多轮对话删旧轮次;理论版叫 Markovian Thinking/Delethink)。死因:上下文窗口变化导致 last k 被处理两次,k 大则重算贵、k 小则丢正在用的信息,且显存波动剧烈
  • Summary:生成到阈值,把全部中间内容总结后带着摘要重启窗口——这就是「边想边忘」的严格实现。死因:模型多轮摘要保不住重要信息(Wang et al. 2026a),且新增一堆超参数(摘要长度/摘要器/触发阈值)
  • Prefix Sliding:前缀全保 + 最近 4096 token 滑窗,中间的无替身直接丢
结果:Prefix Sliding 在 AIME25 上胜出。这个排序本身就是个认知更新——压缩中间思考的收益低于直接扔掉它,前提是前缀和当前窗口还在。机制上有个视频完全没讲的细节:prefix 必须保留的第二个理由是 attention sink——前缀充当注意力洼地吸收多余概率质量,丢了前缀模型连「现在」都读不稳。所以这方法的配方是「锚 + 窗口」二元结构,缺一不可。

而性能持平的机制,论文自己说得诚实:"Prefix Sliding performs better as it can generate more tokens in the same thinking time than full attention, not because each token it generates is better"——提速来自吞吐不是智商,3 倍思考预算买回来的是搜索广度。

三、AIME 数字与「窗口是配方不是开关」

Table 1(Qwen3-1.7B,avg@64):

窗口AIME25平均长度速度(32K→128K)
204827.7(掉 6.5 分)476438973→8737
409633.9299435479→5224
819235.8(反超 Full)193733291→2788
Full34.2191581477→448
三个观察:①窗口太小是有损的(2048 掉 6.5 分),「maintaining performance」的前提是窗口≥4096;②窗口 8192 反超 Full——因为同等墙钟时间生成了更多 token;③窗口越大越稳但越慢,这是一条配比曲线不是开关——跟 CometVLA 四层数据金字塔同构:不是选哪层的问题,是多少的问题。

四、主线回接:草稿纸问题的三种扔法

「CoT 废话文学本质=工作记忆外包给离散 token 过窄门」这个账本(Mobius 篇)如今凑齐了三层解,全部在过去两周出现:

1. 隐空间级(Mobius):草稿纸换 RAM——推理搬进隐空间,token 都不用写 2. 符号级(Prime Agent context-as-variables):草稿纸从 token 流搬进变量——什么进 token 流成为显式编程决策 3. 丢弃级(Prefix Sliding):承认推理走 token 流,但给流装垃圾回收器——中间 token 按时效丢弃

三层解共享同一物理:token 流是贵接口,草稿必须想办法不占它。而 Prefix Sliding 给这个账本补了事中记账维度——Prime Agent 篇讲的是「什么进 token 流」(事前),这篇讲的是「进了之后何时失效」(事中):大部分中间推理 token 会失去重要性,失效时间尺度约等于窗口大小。

第二个回接:token 流内部分层 = Wayfinder 票据/fog 判据的推理版。prefix=任务定义(能精确陈述的持久结构,对应票据),中间思考=工作过程(不可预陈述、可丢,对应 fog),滑动窗口=正在执行的当下。判据同构:题目要求「能否现在精确陈述」决定它进 prefix 还是进丢弃区。

第三个回接:Prime Intellect 第三次出现——prime-agent、RLM 血缘之后,这次是 prime-rl 作为本论文 RL 实验的异步框架(GRPO via trl 同步 / prime-rl 异步)。去中心化 RL 实验室的基建正在成为前沿学术组的默认选项,这个趋势本身值得单独立档。

第四个回接:训练侧的增量视频没讲——RL 训练中「超长生成被截断丢弃」是行业惯例(Yu et al. 2025),Prefix Sliding 让 >100k token 的完整 rollout 可负担,截断回传只需最后一个滑窗(传 4×窗口 token 保证梯度准确,KL 验证过)。这跟 RLM-Qwen3-8B「为结构训练模型」同向:缓存策略从 harness 决策下沉为可训练结构。

五、诚实边界(视频全没讲)

LiveCodeBench 掉分=草稿是半成品的反例:模型在推理中写函数实现,然后用注释思考几千 token,回头继续写时函数开头已滑出窗口——「中间 token 失去重要性」在代码任务上有结构性例外(草稿不是废纸是未完成的成品)。解药论文给了两个:RL 训练让模型学会写短注释,或者「模型把 token 追加进 prefix」的机制(后者是个值得盯的架构方向) ② 短任务零收益:生成长度 < 窗口时就是 full attention(warm-up 阶段),HealthBench 平均 2086 token 的任务基本无加速 ③ agentic 洪水风险:读网页/文件可能灌满窗口——窗口比内容小时严格读不完,且新输出会冲掉正在用的内容。多轮对话的后续用户指令怎么处理也未解决 ④ 实验底座是 Qwen3-1.7B:小模型先行,前沿大模型上的验证还没做(附 8192/16384 窗口图,未见 >7B 结果) ⑤ 对照方案自认有限:只比「开箱即用+常数显存」的方案,H₂O 等 cache eviction 只进附录 ⑥ 星量 22、发布一周——传播刚起步,还没有第三方复现

六、可打脸预测

12 个月内 vLLM/SGLang 把 prefix+sliding KV 模式做成一等公民开关(Hopper kernel 论文已自写,工程距离很近),某前沿实验室发布「Prefix Sliding 训练、百万 token 推理」的旗舰模型(推理时 scaling 的新卖点)。两者任一发生即验证;如果一年后主流推理框架仍只有朴素滑窗,说明 LiveCodeBench 类反例在大模型上普遍成立,草稿纸 GC 的适用域比论文宣称的窄。


*核查备注:arXiv 2608.26070v1(2026-09-05 实抓 HTML 全文 92K 字符);github.com/Muennighoff/prefix-sliding(22★,08-27 push);Table 1/四条 Limitations 逐段核对。视频七条声明:五属实、一合理举例、一「边想边忘」直觉与实际机制的错位标注(错位本身比错误更有信息量——直觉方案 Summary 实测更差)。*


下一步选项: 1. 「草稿纸三解」收官专帖:Mobius 隐空间级 + Prime Agent 变量级 + Prefix Sliding 丢弃级合成一篇「推理时上下文经济学」——三层解同一物理,凑齐时间窗口刚好两周; 2. Prime Intellect 基建帝国立档:prime-agent、RLM、prime-rl 三线归一,去中心化 RL 实验室如何变成前沿学术组的默认底座——主角是基础设施不是论文; 3. 等等再发:今天首帖,看看这篇的讨论热度再定。

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens