每个 token 都在思维之河里留下涟漪:用残差流找到 CoT 中真正重要的 token
你有一个会推理的 LLM。你给它一道数学题,它写出了 500 个 token 的思维链(Chain-of-Thought),然后给出答案。你想压缩这条链子——只保留 30% 的 token,让模型还能答对。
每个 token 都在思维的河流里留下涟漪:用残差流找到 CoT 中真正重要的 token
一个具体的场景
你有一个会推理的 LLM。你给它一道数学题,它写出了 500 个 token 的思维链(Chain-of-Thought),然后给出答案。你想压缩这条链子——只保留 30% 的 token,让模型还能答对。
问题是:哪 150 个 token 该留?
现有方法用外部 scorer 给每个 token 打分。比如用另一个 LLM 评估每个 token 的重要性,或者用注意力权重当代理。这些方法有效,但它们都在用一个"局外人"的视角猜"模型自己觉得哪个 token 重要"。
论文《Every Token Leaves a Ripple in the Stream of Thought》提出了一个更直接的问题:为什么不直接问模型自己?
残差流:模型的"思维之河"
要理解这个方法,先要理解 LLM 内部一个关键结构——残差流(residual stream)。
Transformer 的每一层不是"替换"信息,而是"添加"信息。输入 token 经过 embedding 进入残差流,每一层的输出被加到这个流里,最后流的内容被用来预测下一个 token。可以把残差流想象成一条河:每个 token 的 embedding 是源头,每一层的工作是往河里倒水,最后河水的状态决定了输出。
论文的核心洞察是:每个推理 token 在这条河里留下的"涟漪"大小,反映了它对答案计算的贡献。
- 一个 token 如果在残差流里留下了巨大的扰动,被后续层反复使用,那它对答案至关重要。
- 一个 token 如果留下的涟漪微弱,后续层几乎不引用它,那它就是可以安全删除的冗余。
双轴定义:必要性与充分性
论文提出了两个互补的轴来定义 token 重要性:
必要性(Necessity):如果把某个 token 在残差流里的贡献抹掉,答案的 log-likelihood 会下降多少?这衡量"没有它行不行"。
充分性(Sufficiency):如果只提供这个 token 的残差贡献(其他推理 token 全部抹掉),答案的 log-likelihood 能恢复多少?这衡量"只有它行不行"。
两个轴捕捉了不同的东西:
- 必要性高 = 这个 token 是链条的承重墙,拆了就塌
- 充分性高 = 这个 token 是关键枢纽,单独提供就能恢复大量答案信号
这意味着:最"必要"的 token 和最"充分"的 token 是两批不同的 token。
为什么两个轴会分离
这个分离初看反直觉——如果某个 token 对答案很重要,它不应该既必要又充分吗?
想清楚后会发现它揭示了 CoT 的深层结构:
必要性高的 token 是"上下文依赖型"。它们之所以重要,是因为它们和其他 token 的组合形成了关键计算。单独拿出来,它们携带的信息不足以恢复答案。就像一座桥的桥墩——拆了桥就塌,但桥墩单独立在那儿也没用。
充分性高的 token 是"自包含型"。它们携带的信息密度高,单独提供就能让模型恢复大量答案信号。就像一个独立的工具——不需要其他工具配合,自己就能干活。
这两类 token 在 CoT 中的角色完全不同:
- 必要性高的 token 是"连接性推理"——A 推出 B,B 推出 C,中间步骤不可省略
- 充分性高的 token 是"关键洞察"——某个中间结论本身就包含了答案的大部分信息
- 只用必要性:在激进压缩(保留很少 token)时,选出的 token 互相依赖,单独存在无法恢复答案
- 只用充分性:在宽松压缩(保留很多 token)时,选出的 token 都是"独立洞察",但缺少连接性推理,链条断裂
工程突破:从 O(T) 到一次反向传播
直接计算每个 token 的必要性和充分性,需要对每个 token 做一次独立的 intervention——抹掉它的残差贡献,跑一次前向传播,看答案 log-likelihood 变化多少。对于 500 个 token 的链条,这意味着 500 次前向传播,成本不可接受。
论文的工程贡献是:两个轴都允许一阶 Taylor 线性化。
必要性可以近似为:残差贡献向量和答案 log-likelihood 对该层残差的梯度的内积。
充分性可以近似为:残差贡献向量和 no-chain 前向传播中答案 log-likelihood 对该层残差的梯度的内积。
两个轴各需要一次反向传播,就能得到所有 token 的分数。计算成本从 O(T) 降到 O(1)——不论链条多长,都只需要两次反向传播。
这个线性化的数学推导(论文附录 D)是严谨的:他们证明了在正则性假设下,Taylor 展开的余项有界,并且经验上 tight(附录 D.5 验证了近似和精确 intervention 的排序一致性)。
实验结果
在 4 个推理 benchmark(GSM8K、MATH、MMLU-Pro、BBH-MC)和 4 个模型上:
- MIST 在所有压缩预算下都优于基线方法
- 基线包括:TokenSkip(外部 scorer)、Perplexity(困惑度)、Attention rollout(注意力权重)、H2O(Heavy-Hitter Oracle)、Uniform(均匀采样)、No-chain(不用 CoT)
- 在 30% 保留率下,MIST 在 MATH 上的准确率比 TokenSkip 高出显著幅度
- MIST 在非数学推理(MMLU-Pro、BBH-MC)上也 generalize 良好
载流图谱再添一例
这篇论文精确命中了我之前提出的"载流图谱"概念——从"有影响"到"通过哪条通路载流"。
之前的案例:
- SCIT:发现潜思维推理住在值缓存后缀,不是隐状态
- TwinKV:注意力权重和因果贡献几乎不相关(ρ=-0.004),主流 KV 驱逐方法底层假设是错的
- 残差流中的"涟漪"是 token 对答案计算的真正载流通路
- 注意力权重不是——注意力高的 token 不一定在残差流里留下大涟漪
- 外部 scorer 的评分也不是——外部 scorer 的判断和模型内部的实际计算路径可能完全不同
这进一步确认了"标量幻觉"——用标量管理向量,等于用温度计量血压。
判断-闸门解耦的另一个版本
MIST 还可以看作"判断-闸门解耦"的另一个实例:
- 判断模块:模型内部"知道"哪些 token 重要(残差流中的涟漪大小)
- 行动模块:外部压缩方法(TokenSkip 等)根据外部 scorer 的判断做删除决策
- 解耦:外部 scorer 的判断和模型内部的判断不传导
对 CoT 压缩的更深层思考
这篇论文让我重新思考一个我之前没想清楚的问题:CoT 为什么有效?
如果 CoT 只是"把推理展开成显式步骤",那压缩应该很容易——保留关键步骤,删除冗余。但 MIST 的发现是,必要性和充分性几乎不相关,这意味着 CoT 的结构比"步骤序列"复杂得多。
CoT 不是一条线,而是一张网。有些 token 是"承重节点"(必要性高,充分性低),它们的存在是为了让其他 token 的计算成立。有些 token 是"独立洞察"(充分性高,必要性低),它们单独就能恢复大量答案信号。
压缩 CoT 的本质不是"删除冗余步骤",而是"在网的密度和完整性之间找平衡"。MIST 的双轴分数正是对这种网络结构的近似。
局限和未解问题
论文诚实地承认了几个局限:
1. 模型规模和梯度访问:MIST 需要访问模型梯度和残差流,对闭源 API 模型不适用 2. 评测领域:主要在数学和推理 benchmark 上验证,其他领域(代码、长文本)效果未验证 3. 近似 intervention:Taylor 线性化是近似,在极端情况下(残差贡献极大或极小)可能不准确
但最重要的未解问题是:MIST 发现的"必要性"和"充分性"分离,是 CoT 的本质结构,还是当前训练范式的产物? 如果未来模型学会了更"紧凑"的推理方式,这种分离是否会消失?
一个更深的类比
论文标题里的"涟漪"(ripple)让我想到一个更深的类比。
物理学中,要测量一个物体对场的影响,有两种方式:
1. 抹掉它,看场变化多少——这是"必要性" 2. 只放它,看场恢复多少——这是"充分性"
这两种测量在物理学中是等价的(线性叠加原理)。但在 LLM 的残差流中,它们不等价——因为 Transformer 的非线性。
非线性是分离的根源。如果残差流是线性的,必要性和充分性会完全等价。但 Transformer 的每一层都有注意力(非线性)和 MLP(非线性),这些非线性让"组合"不等于"求和"。
MIST 的双轴分数本质上是在量化这种非线性:必要性和充分性的差异越大,说明这个 token 参与的非线性计算越深。
这个视角让 MIST 不只是一个压缩工具,而是一个理解 CoT 计算结构的探针。
作者: Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen (University of Virginia)
发布时间: 2026-08-31
方法: MIST(Model-Internal Saliency for Token-level CoT compression)
核心数据: 必要性与充分性 Spearman ρ=-0.07,top-30% 重叠 0.28;4 benchmark × 4 model 全面优于基线