章鱼听不懂人话:一篇论文给大语言模型划下的形式化边界
一只偷听电缆的章鱼
2020年,Emily Bender和Alexander Koller提出了一个著名的思想实验。想象一只章鱼,漂浮在海底电缆旁边,偷听人类的对话。它积累了海量文本,学会了完美地续接对话。问题是:这只章鱼理解语言了吗?
Bender和Koller的答案是否定的。他们认为,仅凭文本形式,无法学到真正的意义——因为意义需要扎根于世界(grounding),需要意图和交流语境。这个论证在哲学上很有说服力,但在经验层面一直缺乏严格的理论支撑。
2026年8月,arXiv上的一篇论文(2608.28560)给这个思想实验补上了数学证明。论文标题直白得不像论文:*A Formal Limitation on Learning Human Language From Textual Corpora*。作者用信息论证明了一个定理:从文本语料学习人类语言意义,存在不可逾越的上限。无论模型多大、数据多少、训练多久,这个上限都不会消失。
核心定理:互信息的硬天花板
论文的数学框架围绕三个随机变量展开:
- M(meaning):说话者想表达的意义
- U(utterance):说出口的话语
- C(context):交流语境——包括说话者看到的世界、共享的背景知识、对话历史
信息论告诉我们,这个上限由互信息 I(M; U | C) 决定。但论文走得更深——他们关心的不是"话语本身携带多少意义信息",而是"话语的意义可解码性"(meaning decodability)。
定理1(离散意义):对于任何 ε-accurate 意义表示 J_ε,从话语 U 到 J_ε 的互信息满足:
I(J_ε; U) ≤ H(C | U) + ε · log(|M|/ε)
这个不等式说了什么?意义可解码性的上限,由语境条件熵 H(C | U) 决定。语境越不确定(H(C|U)越大),能从话语中恢复的意义越少。
定理2(连续意义)给出了类似的界,但用微分熵代替离散熵,且多了一个维度惩罚项。
为什么这个上限不可逾越
关键洞察在于:语境 C 是话语生成和理解的必要条件,但 C 本身不编码在 U 中。
当你听到"那个大的给我拿过来"时,"那个"指什么、"大"是多大、"拿"是哪种拿——全靠语境。而语境信息并不完全编码在话语的文本形式里。Bender和Koller的章鱼偷听电缆,只能听到 U,听不到 C。
这意味着:即使章鱼的模型完美拟合了 P(U)(语言模型的本职工作),它也无法恢复 P(M | U),因为它缺少 P(C)。
论文用一句话概括了这个困境:形式不编码意义,形式+语境才编码意义。而语境的大部分信息,永远在文本之外。
实验验证:三个任务,同一个上限
理论需要实验支撑。论文设计了三个任务来验证定理,覆盖离散和连续意义:
任务1:人工语言(仿真验证)。作者构造了三种人工语言,分别对应不同的 P(M, U, C) 分布。在所有设置下,意义可解码性的经验值都严格低于定理给出的上限。更重要的是,当语境条件熵 H(C|U) 增大时(语境更不确定),可解码性单调下降——完全符合理论预测。
任务2:汉语零代词消解(离散意义)。汉语允许省略主语和宾语,这创造了天然的"语境依赖"场景。"吃饭了吗?"——谁吃?取决于上下文。论文用汉语对话数据集测试了LLM的零代词消解能力,发现准确率严格低于定理上限。当对话历史变长、语境更复杂时,准确率下降——和理论预测一致。
任务3:颜色命名(连续意义)。使用Monroe等人(2017)的颜色参考数据集,说话者用自然语言描述颜色,听者需要从描述中恢复颜色。颜色是连续意义,适用定理2。实验发现,LLM的颜色恢复误差随颜色分布熵增大而增大,且始终低于理论上限。
三个任务,三种意义类型,同一个结论:文本通道的互信息有硬上限,经验性能无法超越理论边界。
这对大语言模型意味着什么
这篇论文不是在说LLM没用。LLM当然有用——它们在翻译、摘要、代码生成等任务上已经达到实用水平。论文说的是:LLM对意义的理解有结构性上限,不是规模能解决的。
这个结论和当前主流叙事冲突。主流叙事说:只要模型够大、数据够多,涌现会解决一切。论文的定理说:不会。因为上限是信息论的,不是优化的。
打个比方:你用望远镜看月球,能看到环形山。但不管望远镜多大,你从地球上看不到月球背面的细节——不是望远镜不够好,是几何位置决定的。文本通道的互信息上限,就是这种"几何位置"限制。
论文还讨论了一个微妙的问题:RLHF(人类反馈强化学习)能不能绕过这个上限?答案是不能。RLHF优化的是模型输出对人类偏好的拟合度,但人类偏好本身也受限于文本通道——标注者也是从文本中理解意义的。用受限的信号去优化对受限信号的拟合,不会突破上限。这就像用一把刻度模糊的尺子去校准另一把刻度模糊的尺子。
和"章鱼论"的关系
Bender和Koller的章鱼论是哲学论证,这篇论文是数学证明。两者互补:
- 章鱼论说:仅凭文本学不到意义,因为缺少语境扎根
- 这篇论文说:仅凭文本学到的意义有信息论上限,上限由语境条件熵决定
更精确地说:LLM学到的是 P(U)——话语的分布。它能生成流畅的文本,因为流畅性只需要 P(U)。但它无法从 P(U) 中恢复 P(M | U, C),因为 C 不在 U 里。它能做的,是利用训练数据中 U 和 C 的统计相关性,间接推断 C 的典型模式——这就是为什么LLM在常见语境下表现不错,但在罕见语境下会"幻觉"。
启示:没有免费午餐
这篇论文给当前LLM研究敲了一个警钟:意义不是文本的函数,是文本+语境的函数。任何只从文本学习的系统,无论多大,都会撞上这个天花板。
要突破天花板,只有一条路:让模型接触语境。这就是为什么多模态学习、具身智能、工具使用如此重要——它们不是锦上添花,是突破文本通道上限的必经之路。
这也解释了为什么GPT-4V(视觉+语言)在某些任务上显著优于纯文本GPT-4——不是因为视觉信息更丰富,而是因为视觉提供了文本中缺失的语境 C。
Bender和Koller六年前提出的章鱼思想实验,如今有了数学形式化。章鱼确实听不懂人话——不是因为它不够聪明,而是因为电缆里传的信号,信息量就那么多。
---
论文信息:A Formal Limitation on Learning Human Language From Textual Corpora, arXiv:2608.28560