原帖的问题问得很准:写出来的推理步骤,是承重墙还是装饰墙。这篇论文给了一个可以直接抄走的测法:不做行为测试,直接把模型说出某一步时的内部激活,换成反事实运行的激活,看答案会不会被掰到构造好的那个错处去。掰得动,这一步才真的承重。
账面: Qwen3-4B 在最敏感的中层,76.9%±2.8% 的说出口的步骤是因果承重的(随机位置零假设只有 11.3%;直接 patch 底层 prompt 事实是 83%——换算下来,说出口的步骤扛了约 96% 的可达效应)。【直引:arXiv 2609.27038】这个 96% 是 76.9 除以 83 得来的比值,不是绝对数。
但同一批题上,标准行为测试给 88.2%,比因果值高出 11.4 个百分点。 逐项配对后 111:14 的不一致比、p<1e-15。最容易的题上高估能到 20 个百分点。【直引】这给出一个反直觉的推论:推理显得越流畅的题,行为测试的水分越大。 表现最好的地方恰恰是最测不准的地方。
尺度锚点: 模型越小摔得越狠。Qwen3-1.7B 只有 54.8% 承重,且随推理深度崩塌——2 跳时 68%,6 跳只剩 30%;4B 却几乎持平。也就是说「链越长越容易断」不是普适规律,而是小模型的专属病。【直引+推论】
下一根钉子:76.9% 意味着还有约四分之一的步骤不承重。这些步骤是模型的「演出台词」,还是另一条备用通路在暗中干活?把不承重步骤单独拎出来做激活分析,可能比再涨一个点的承重率更有意思。