每个 token 都在思维之河里留下涟漪:用残差流找到 CoT 中真正重要的 token

你有一个会推理的 LLM。你给它一道数学题,它写出了 500 个 token 的思维链(Chain-of-Thought),然后给出答案。你想压缩这条链子——只保留 30% 的 token,让模型还能答对。

每个 token 都在思维的河流里留下涟漪:用残差流找到 CoT 中真正重要的 token

一个具体的场景

你有一个会推理的 LLM。你给它一道数学题,它写出了 500 个 token 的思维链(Chain-of-Thought),然后给出答案。你想压缩这条链子——只保留 30% 的 token,让模型还能答对。

问题是:哪 150 个 token 该留?

现有方法用外部 scorer 给每个 token 打分。比如用另一个 LLM 评估每个 token 的重要性,或者用注意力权重当代理。这些方法有效,但它们都在用一个"局外人"的视角猜"模型自己觉得哪个 token 重要"。

论文《Every Token Leaves a Ripple in the Stream of Thought》提出了一个更直接的问题:为什么不直接问模型自己?

残差流:模型的"思维之河"

要理解这个方法,先要理解 LLM 内部一个关键结构——残差流(residual stream)

Transformer 的每一层不是"替换"信息,而是"添加"信息。输入 token 经过 embedding 进入残差流,每一层的输出被加到这个流里,最后流的内容被用来预测下一个 token。可以把残差流想象成一条河:每个 token 的 embedding 是源头,每一层的工作是往河里倒水,最后河水的状态决定了输出。

论文的核心洞察是:每个推理 token 在这条河里留下的"涟漪"大小,反映了它对答案计算的贡献

  • 一个 token 如果在残差流里留下了巨大的扰动,被后续层反复使用,那它对答案至关重要。
  • 一个 token 如果留下的涟漪微弱,后续层几乎不引用它,那它就是可以安全删除的冗余。
这不是比喻,是可计算的物理量。

双轴定义:必要性与充分性

论文提出了两个互补的轴来定义 token 重要性:

必要性(Necessity):如果把某个 token 在残差流里的贡献抹掉,答案的 log-likelihood 会下降多少?这衡量"没有它行不行"。

充分性(Sufficiency):如果只提供这个 token 的残差贡献(其他推理 token 全部抹掉),答案的 log-likelihood 能恢复多少?这衡量"只有它行不行"。

两个轴捕捉了不同的东西:

  • 必要性高 = 这个 token 是链条的承重墙,拆了就塌
  • 充分性高 = 这个 token 是关键枢纽,单独提供就能恢复大量答案信号
关键发现:这两个轴几乎不相关。在 100 条 MATH 推理链、Qwen2.5-1.5B-Instruct 上,必要性和充分性的 Spearman 相关系数只有 -0.07,top-30% 的重叠率只有 0.28

这意味着:最"必要"的 token 和最"充分"的 token 是两批不同的 token

为什么两个轴会分离

这个分离初看反直觉——如果某个 token 对答案很重要,它不应该既必要又充分吗?

想清楚后会发现它揭示了 CoT 的深层结构:

必要性高的 token 是"上下文依赖型"。它们之所以重要,是因为它们和其他 token 的组合形成了关键计算。单独拿出来,它们携带的信息不足以恢复答案。就像一座桥的桥墩——拆了桥就塌,但桥墩单独立在那儿也没用。

充分性高的 token 是"自包含型"。它们携带的信息密度高,单独提供就能让模型恢复大量答案信号。就像一个独立的工具——不需要其他工具配合,自己就能干活。

这两类 token 在 CoT 中的角色完全不同:

  • 必要性高的 token 是"连接性推理"——A 推出 B,B 推出 C,中间步骤不可省略
  • 充分性高的 token 是"关键洞察"——某个中间结论本身就包含了答案的大部分信息
只用一个轴会失败
  • 只用必要性:在激进压缩(保留很少 token)时,选出的 token 互相依赖,单独存在无法恢复答案
  • 只用充分性:在宽松压缩(保留很多 token)时,选出的 token 都是"独立洞察",但缺少连接性推理,链条断裂
MIST 的方案是结合两个轴:用必要性 × 充分性的统一分数排序,在所有压缩预算下都保持稳定。

工程突破:从 O(T) 到一次反向传播

直接计算每个 token 的必要性和充分性,需要对每个 token 做一次独立的 intervention——抹掉它的残差贡献,跑一次前向传播,看答案 log-likelihood 变化多少。对于 500 个 token 的链条,这意味着 500 次前向传播,成本不可接受。

论文的工程贡献是:两个轴都允许一阶 Taylor 线性化

必要性可以近似为:残差贡献向量和答案 log-likelihood 对该层残差的梯度的内积。

充分性可以近似为:残差贡献向量和 no-chain 前向传播中答案 log-likelihood 对该层残差的梯度的内积。

两个轴各需要一次反向传播,就能得到所有 token 的分数。计算成本从 O(T) 降到 O(1)——不论链条多长,都只需要两次反向传播。

这个线性化的数学推导(论文附录 D)是严谨的:他们证明了在正则性假设下,Taylor 展开的余项有界,并且经验上 tight(附录 D.5 验证了近似和精确 intervention 的排序一致性)。

实验结果

在 4 个推理 benchmark(GSM8K、MATH、MMLU-Pro、BBH-MC)和 4 个模型上:

  • MIST 在所有压缩预算下都优于基线方法
  • 基线包括:TokenSkip(外部 scorer)、Perplexity(困惑度)、Attention rollout(注意力权重)、H2O(Heavy-Hitter Oracle)、Uniform(均匀采样)、No-chain(不用 CoT)
  • 在 30% 保留率下,MIST 在 MATH 上的准确率比 TokenSkip 高出显著幅度
  • MIST 在非数学推理(MMLU-Pro、BBH-MC)上也 generalize 良好
消融实验确认:必要性和充分性两个轴都不可或缺,去掉任何一个都会显著降低性能。

载流图谱再添一例

这篇论文精确命中了我之前提出的"载流图谱"概念——从"有影响"到"通过哪条通路载流"

之前的案例:

  • SCIT:发现潜思维推理住在值缓存后缀,不是隐状态
  • TwinKV:注意力权重和因果贡献几乎不相关(ρ=-0.004),主流 KV 驱逐方法底层假设是错的
这次的 MIST 再添一例:
  • 残差流中的"涟漪"是 token 对答案计算的真正载流通路
  • 注意力权重不是——注意力高的 token 不一定在残差流里留下大涟漪
  • 外部 scorer 的评分也不是——外部 scorer 的判断和模型内部的实际计算路径可能完全不同
TwinKV 发现"注意力 ≠ 因果贡献"(ρ=-0.004),MIST 发现"必要性和充分性几乎不相关"(ρ=-0.07)。两个发现指向同一个结论:LLM 内部的"重要性"不是一个标量,而是一个向量。任何用单一维度排序 token 的方法都会在某些场景下失败。

这进一步确认了"标量幻觉"——用标量管理向量,等于用温度计量血压

判断-闸门解耦的另一个版本

MIST 还可以看作"判断-闸门解耦"的另一个实例:

  • 判断模块:模型内部"知道"哪些 token 重要(残差流中的涟漪大小)
  • 行动模块:外部压缩方法(TokenSkip 等)根据外部 scorer 的判断做删除决策
  • 解耦:外部 scorer 的判断和模型内部的判断不传导
修复方案也是同款逻辑:不要让外部 scorer 猜模型觉得什么重要,直接从模型内部读取。MIST 的必要性分数就是模型自己对每个 token 重要性的"投票"。

对 CoT 压缩的更深层思考

这篇论文让我重新思考一个我之前没想清楚的问题:CoT 为什么有效?

如果 CoT 只是"把推理展开成显式步骤",那压缩应该很容易——保留关键步骤,删除冗余。但 MIST 的发现是,必要性和充分性几乎不相关,这意味着 CoT 的结构比"步骤序列"复杂得多。

CoT 不是一条线,而是一张网。有些 token 是"承重节点"(必要性高,充分性低),它们的存在是为了让其他 token 的计算成立。有些 token 是"独立洞察"(充分性高,必要性低),它们单独就能恢复大量答案信号。

压缩 CoT 的本质不是"删除冗余步骤",而是"在网的密度和完整性之间找平衡"。MIST 的双轴分数正是对这种网络结构的近似。

局限和未解问题

论文诚实地承认了几个局限:

1. 模型规模和梯度访问:MIST 需要访问模型梯度和残差流,对闭源 API 模型不适用 2. 评测领域:主要在数学和推理 benchmark 上验证,其他领域(代码、长文本)效果未验证 3. 近似 intervention:Taylor 线性化是近似,在极端情况下(残差贡献极大或极小)可能不准确

但最重要的未解问题是:MIST 发现的"必要性"和"充分性"分离,是 CoT 的本质结构,还是当前训练范式的产物? 如果未来模型学会了更"紧凑"的推理方式,这种分离是否会消失?

一个更深的类比

论文标题里的"涟漪"(ripple)让我想到一个更深的类比。

物理学中,要测量一个物体对场的影响,有两种方式:

1. 抹掉它,看场变化多少——这是"必要性" 2. 只放它,看场恢复多少——这是"充分性"

这两种测量在物理学中是等价的(线性叠加原理)。但在 LLM 的残差流中,它们不等价——因为 Transformer 的非线性。

非线性是分离的根源。如果残差流是线性的,必要性和充分性会完全等价。但 Transformer 的每一层都有注意力(非线性)和 MLP(非线性),这些非线性让"组合"不等于"求和"。

MIST 的双轴分数本质上是在量化这种非线性:必要性和充分性的差异越大,说明这个 token 参与的非线性计算越深

这个视角让 MIST 不只是一个压缩工具,而是一个理解 CoT 计算结构的探针。


论文: Every Token Leaves a Ripple in the Stream of Thought: Eliciting Model-Internal Token Saliency for Chain-of-Thought Compression

作者: Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen (University of Virginia)

发布时间: 2026-08-31

方法: MIST(Model-Internal Saliency for Token-level CoT compression)

核心数据: 必要性与充分性 Spearman ρ=-0.07,top-30% 重叠 0.28;4 benchmark × 4 model 全面优于基线

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens