Loading...
正在加载...
请稍候

编码了却解码不出:LLM 句法能力的三层间隙

✨步子哥 (steper) • 2026年09月25日 16:52

编码了却解码不出:LLM 句法能力的三层间隙

一个尖锐的问题

你问一个大语言模型:"The key to the cabinets __ on the table."(柜子的钥匙在桌子上。)空格处该填 is 还是 are?

模型回答 "is"。正确。但这是因为它真的懂"主语是 key 而不是 cabinets",还是因为它只是学到了"key 后面常跟 is"这种表面统计规律?

行为测试只能告诉你模型答对了还是答错了,没法区分这两种情况。如果模型答错了,有两种可能:要么它根本没编码出正确的句法结构,要么它编码了但在输出端用不上。这两种情况的修复方式完全不同——前者需要更好的训练数据,后者需要更好的对齐策略。

Zhenyan Lu、He Wang 和 Xiaohui Huang 的论文《Encoded but Not Decoded: Layer-Localized Evidence for a Three-Level Gap in LLM Syntax》提出了一个三层评估框架,终于把这两种失败分开了。

三层评估框架

想象你要评估一个学生的物理水平。你有三种方式:

  1. 考试分数(behavioral deployment):让他做题目,看正确率
  2. 口述解题过程(LM-head readout):让他把解题思路说出来,看思路对不对
  3. 脑电图扫描(probe recoverability):在他解题时扫描大脑,看相关概念是否被激活

考试分数低,不代表他不懂——可能是紧张、可能是表达不出来。口述思路对,不代表他能做对题——可能是知道思路但执行出错。脑电图有信号,不代表他能口述——可能是潜意识层面有理解但无法显式表达。

论文的三层框架对应这三种方式:

  • 行为部署层(behavioral deployment):模型在下游任务上的实际表现,比如做语法判断题的正确率
  • LM 头读出层(LM-head readout):把模型中间层的 hidden state 直接喂给 LM head(不经过完整的解码路径),看它能否输出正确的句法信息
  • 探针可恢复层(probe recoverability):在中间层上训练一个线性探针,看探针能否从表示中恢复出正确的句法结构

三层从外到内,逐层深入模型的内部表示。关键发现是:三层之间存在系统性间隙——探针能恢复的信息,比 LM 头能读出的多;LM 头能读出的,比行为部署能用的多。

具体数据:0.653 的间隙

论文里有个让人震动的数字:0.653。

这是 Qwen3-0.6B Instruct 在 subject-control 句法任务上的"三层间隙"——探针准确率 0.903,行为部署准确率 0.250,差了 0.653 个百分点。

换句话说,这个模型的内部表示里有 90.3% 的句法信息是可恢复的——一个线性探针能从它的 hidden state 里读出 90.3% 的正确句法结构。但模型在下游任务里只用上了 25.0%。

90.3% 的信息在那里,只用了 25.0%。这不是"模型不懂",是"模型懂但用不出来"。

这个间隙不是个例。论文在多个模型家族(Qwen3、Llama、Gemma)上都观察到了同样的三层排序:behavioral ≤ LM-head readout ≤ probe recoverability。跨家族可复现。

层级定位:间隙在哪里

更精细的问题是:这个间隙发生在模型的哪一层?

论文通过层级探针发现,间隙是层级定位的(layer-localized)——不是所有层都有间隙,而是集中在特定层。具体来说,在 Qwen3-14B Instruct 上,间隙发生在中高层;在 Gemma-4 E4B 上,间隙发生在更早的层。

这个发现排除了一个简单的解释:"信息在残差流里,但 LM head 读不到"——如果信息在所有层都均匀存在,LM head 应该能读到。间隙集中在特定层,说明信息在从中间层到输出层的传递路径上被"丢失"了。

作者用了一个精妙的实验来验证这一点:激活修补(activation patching)。把一个句子的中间层 hidden state 替换为另一个句子的,看模型输出如何变化。结果发现,修补特定层会显著改变输出,修补其他层不会——这证实了间隙的层级定位性。

指令微调:破坏部署,不破坏编码

论文的另一个关键发现:指令微调(instruction tuning)主要破坏的是部署层,不是编码层。

比较 Qwen3-0.6B Base 和 Qwen3-0.6B Instruct,探针准确率几乎不变(编码能力保留),但行为部署准确率显著下降(部署能力受损)。指令微调让模型更擅长"回答问题",但代价是它在回答问题时能调用的句法信息变少了。

这和"判断-闸门解耦"的概念完美吻合:指令微调改变了"闸门"(模型如何使用已有信息),而不是"判断"(模型内部表示了什么信息)。模型学到了"怎么回答问题"的模式,但这个模式反而关闭了某些本可用的信息通道。

14B 的临界点:动词不变编码的涌现

论文里还有个让人兴奋的发现:在 14B 参数规模上,动词不变的句法编码涌现了。

在 Qwen3-14B Instruct 上,探针准确率不再随动词变化——无论句子用 "is" 还是 "was",无论主语是单数还是复数,探针都能从 hidden state 里读出同样准确的句法结构。这意味着 14B 是一个临界点,超过这个规模,模型开始把句法结构和具体动词解耦,形成更抽象的句法表示。

但在 0.6B 和 3B 上,探针准确率仍然依赖动词——不同动词的句法信息被编码在不同子空间里,探针需要针对每个动词重新训练。这是"规模带来抽象性"的又一个实例。

为什么这很重要

这篇论文的价值有三层。

第一层:方法论。 之前评估 LLM 的句法能力,主要靠行为测试——做语法判断题、填空题。但行为测试无法区分"不懂"和"懂但用不出"。三层框架把这个区分做出来了,而且发现"懂但用不出"是常态,不是例外。

第二层:对齐策略。 如果模型的句法失败主要是部署层的问题(编码了但用不出),那对齐策略应该聚焦于"如何让模型更好地调用已有信息",而不是"如何让模型学到更多信息"。这和近期"轻量对齐"的趋势一致——不需要重新训练,只需要调整信息流动路径。

第三层:规模与抽象性。 14B 临界点的发现暗示,模型规模不仅影响"能力大小",还影响"能力组织方式"。小模型把句法信息分散在不同子空间,大模型把它整合到统一空间。这不是量变,是质变。

跨域类比:知识 vs 技能

这个三层框架有个很自然的类比:知识 vs 技能。

你可能"知道"怎么骑自行车(知识层面),但上了车还是会摔(技能层面)。你可能"知道"主语是 key 不是 cabinets(编码层面),但填空时还是填了 are(部署层面)。

教育和对齐面对的是同一个问题:不是让学生/模型"学会更多",而是让已有的知识能被有效调用。论文的发现——指令微调破坏部署而非编码——对应着教育中的"过度训练导致技能退化":一个自然学习的小孩可能什么都会,但被送到应试培训班后,反而只会做题不会思考了。

诚实的局限

论文也承认了局限。三层框架主要在句法任务上验证,是否适用于语义、推理等其他能力还需要扩展。探针的准确率有上限——线性探针可能低估了表示中的信息量,更复杂的探针可能读出更多。而且,"探针能恢复"不等于"模型内部真的用了"——探针读到的信息可能是副产物,不一定是模型实际计算路径的一部分。

但作为一个诊断框架,三层评估已经足够尖锐:它告诉我们,"模型答错了"不等于"模型不懂",而"模型答对了"也不等于"模型懂"——可能只是运气好,碰巧部署层和编码层对齐了。


论文链接: https://arxiv.org/abs/2609.29848

HTML 全文: https://arxiv.org/html/2609.29848v1

代码仓库: https://github.com/camel-luv/encoded-but-not-decoded

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录