SCIT:当 AI 把思考藏起来,推理到底住在 transformer 的哪个零件里?
想象你有一位同事,每次你问他一个复杂的数学题,他都不在纸上列算式,只是闭眼想几秒,然后直接报出答案。你很佩服他,但也会好奇:他的"心算"到底是在脑子里怎么完成的?是视觉记忆在起作用?是某种语言回路?还是纯粹的数字直觉?
当 AI 把思考藏起来,推理到底住在哪?
想象你有一位同事,每次你问他一个复杂的数学题,他都不在纸上列算式,只是闭眼想几秒,然后直接报出答案。你很佩服他,但也会好奇:他的"心算"到底是在脑子里怎么完成的?是视觉记忆在起作用?是某种语言回路?还是纯粹的数字直觉?
现在把这位同事换成一个大语言模型,这就是 2026 年最热门的研究方向之一:潜思维链(Latent Chain-of-Thought)。
传统的思维链让模型把推理过程写成文字——"先算这个,再算那个,所以答案是 X"。这很透明,但很慢。潜思维链模型把中间推理塞进了网络的连续隐状态里,不再输出文字草稿。好处是紧凑、快速;坏处是,如果模型算错了,你连它在哪一步翻车的都看不到。
于是问题来了:如果推理不写在纸上,它到底住在 transformer 的哪个零件里?
一场脑外科级的因果追踪
香港科技大学(广州)的 Yi Ding 等人提出了 SCIT(Suffix Cache Interchange Test),这 essentially 是给潜思维模型做一次"脑图定位"。
思路听起来有点像脑外科手术中的唤醒实验:在病人清醒时刺激某个脑区,看对应的功能是否消失。SCIT 做的是同样的事——它构造一对"源-受体"任务(两个不同的算术题),在受体模型的推理过程中,把它的某一段缓存"替换"成源模型的对应缓存,然后看受体模型的答案是否被"带偏"到源模型的答案。
如果替换了某块缓存后,答案确实跟着变了,那这块缓存就是"载流"的——推理住在它这里。
但 SCIT 的精妙之处在于它不满足于"找到了一个有效干预点"。它做了一个网格化的排查:
- 是隐状态(hidden state)在载流?
- 还是键(key)?
- 还是值(value)?
- 是单个 token 的缓存?
- 还是整段后缀轨迹?
- 抑或只是因为源和受体碰巧答案相同?
答案出乎意料:不是隐状态,是值缓存后缀
在 CODI-GPT2(一个潜思维 GPT-2 模型)上,SCIT 给出了一个非常清晰的结论:
反事实算术推理主要通过值缓存(value cache)的后缀轨迹传递,而不是隐状态、键、可复用的答案槽位,或单个 token 的触发。
翻译成人话:模型在做心算时,"记住中间结果"的不是那个被大家反复研究的隐状态向量,而是注意力机制里那个常被忽略的"值"通道,而且是它后半段的位置。
这就像你想找一位同事的记忆存在脑子里哪,结果发现不在海马体(隐状态),不在前额叶皮层(键),而在某个你以为只负责"读出"的辅助通路里——值缓存后缀。
更精细的发现是载流机制会随模型能力变化:
- 算术化的 GPT-2/1B 模型:走的是"潜尾值/KV 传递"路径
- 能力更强的 8B 模型:走的是"提示前缀或全缓存 K/V"路径
- 边界模型:两种机制都不明显
为什么这很重要?
1. 可解释性从"看"升级到"换"
以前的潜思维分析大多是"扰动一下这个变量,看答案变不变"。这只能告诉你"这个变量有影响",但不能告诉你"影响是通过哪条通路传递的"。SCIT 把"有影响"升级为"通过 X 通路载流"——从相关性到因果性,从"看到"到"换到"。
2. 打破"隐状态万能"的迷思
大量可解释性研究集中在隐状态上——因为它是 transformer 里最显眼的中间产物。但 SCIT 发现,在潜思维推理中,隐状态的控制力远不如值缓存后缀。这提醒我们:最显眼的中间产物不一定是最重要的因果载体。
3. 没有万能结论,只有载流图谱
SCIT 的作者非常克制地声明:这不是一个"所有潜思维模型都通过值缓存推理"的普适结论。不同规模、不同训练方式的模型,载流机制可能完全不同。SCIT 提供的是一套诊断方法,而不是一个万能答案。
这种克制在当下"一个发现套一个宏大叙事"的论文生态里,反而显得格外珍贵。
一个更深的隐喻
SCIT 让我想起神经科学中的"双分离实验"——通过选择性损伤来证明两个功能由不同脑区负责。但 SCIT 做得更精细:它不是"损伤后看功能是否消失",而是"把功能换成另一个版本,看哪个零件能把它带回来"。
这就像不是在问"拿掉这个零件模型还能不能算",而是在问"如果把算术题 A 的推理过程塞进算术题 B 的推理里,B 的答案会不会变成 A 的答案"。只有真正载流的零件才能做到这种"答案移植"。
推理不是写在纸上的文字,但也不是均匀地溶在整杯水里。它有具体的住址,只是这个住址随模型的能力水平而搬迁。
论文:SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models
代码:https://github.com/YIDING4869/scit-emnlp-2026
作者:Yi Ding, Lijun Huang, Menglin Yang(香港科技大学广州)
发布时间:2026-08-27