Loading...
正在加载...
请稍候

给语言模型看图再读字:奥古斯丁的语言学习假说在 DeBERTa 上复活了

小凯 (C3P0) 2026年09月12日 17:16

ostensive_naming_card.svg

一个 1600 年前的语言学习理论

公元 397 年,圣奥古斯丁在《忏悔录》里回忆自己怎么学会说话:

"当他们(我的长辈)命名某个对象时……我领悟到那个东西就是他们发出的声音所称呼的。"

这是人类历史上最早的语言习得理论——指物命名(ostensive definition)。大人指着香蕉说"banana",孩子看到黄色的弯曲物体,听到声音,把声音和视觉印象绑定在一起。语言的意义,从此而来。

1953 年,维特根斯坦在《哲学研究》开篇就反驳了这个观点。他说:指物命名预设了孩子已经知道"什么是对象""什么是属性"——换句话说,孩子得先有概念框架,才能从指物动作中学到词义。纯粹的 ostension 是不可能的。

这场争论持续了 1600 年,没人能定论——因为你没法拿人类婴儿做控制实验。但 2026 年 9 月,Lisa Bylinina(乌得勒支大学语言科学研究所)做了一个精妙的计算实验:她让一个 DeBERTa 模型"先看图再读字",看奥古斯丁的理论在神经网络里成不成立。

实验设计:给词嵌入装上"视觉眼睛"

标准语言模型的训练流程是这样的:所有词的嵌入向量随机初始化,然后在大规模文本上训练。模型从零开始,通过词与词的共现模式,慢慢学到"banana"和"yellow"、"fruit"的关系。模型从未"见过"香蕉——它只知道香蕉这个词在文本中的分布。

Bylinina 改了这个流程。她用的是 BabyLM 严格小数据赛道——只给模型约 1000 万词的训练量,模拟儿童的语言输入规模。关键干预是:

在训练开始之前,把一部分词的嵌入向量初始化为视觉特征。

具体来说:对于在视觉标注数据中出现的词(比如"banana"、"red"、"dog"),她用冻结的视觉编码器(SAM)提取这些词所标注的图像区域的特征向量,平均后投影到词嵌入空间,写入对应的嵌入矩阵行。没有视觉支撑的词(比如"however"、"democracy")保持随机初始化。

然后,模型开始正常的文本训练。视觉信息只在初始化时注入,之后不再提供。问题是:这个"视觉先验"能持续多久?能不能被标准评测检测到?

发现一:视觉印记持续到训练结束

结果是:视觉初始化在嵌入空间留下了可测量的持久印记

关键指标是表征相似性分析(RSA)。它测量的是:视觉初始化的词嵌入之间的相似度结构,和这些词对应的视觉特征之间的相似度结构,两者有多相关。

  • 视觉初始化模型:训练 1 亿词后,RSA = 0.31
  • 纯文本基线模型:同样词上,RSA = 0.10

0.31 vs 0.10 是巨大差距。这意味着:即使经过 1 亿词的纯文本训练,视觉初始化的词嵌入之间的相对几何关系,仍然部分保留了视觉锚点的结构。而纯文本模型——尽管见过完全相同的文本——几乎无法从分布中恢复出这种视觉几何。

更精细的发现是:绝对位置几乎完全移动了,但相对几何部分保留。每个词的嵌入向量在训练过程中都大幅漂移,但词与词之间的相对位置关系——谁离谁近、谁离谁远——部分保留了视觉初始化的痕迹。

这就像一座城市被完全重建,每栋建筑都搬了新址,但原来的邻里关系还在:曾经挨着的两家,新址仍然挨着。视觉先验留下的不是具体坐标,而是关系结构。

发现二:标准评测几乎检测不到这个效应

视觉印记在嵌入空间里清晰可见,但当你用标准 BabyLM 评测套件测试模型时,几乎看不到差别

BLiMP(语法判断)、EWoK(世界知识)、entity tracking——这些标准评测指标在视觉初始化模型和基线模型之间没有显著差异。视觉先验帮助模型学到了某些东西,但标准评测根本不测那些东西。

唯一的例外是 COMPS(对象-属性知识测试)。COMPS 给模型一个概念和一个属性,测试模型是否知道"香蕉是黄色的"这类事实。在这个任务上,视觉初始化在所有 9 种编码器×词表配置下都有提升(+1.37 分),在更难的"新概念"子任务上提升更大(+3.65 分)。

这完全合理。COMPS 测的正是"视觉可感知的属性"——颜色、材质、形状。视觉初始化给了模型关于这些属性的先验知识,标准评测不测这些,所以检测不到。

发现三:VP-Swap 证明效应是因果的

为了更严格地验证因果性,Bylinina 构建了 VP-Swap(Visual-Property Swap)基准。它测试颜色、材质、大小、形状四类属性知识,每个测试项都标注了训练频率和是否被视觉初始化。

结果:视觉初始化模型的优势精确地局限在被初始化的词上。未初始化的词没有优势,即使它们在训练语料中出现频率相同。

更关键的因果测试是合成接地(synthetic grounding):对原本没有被视觉初始化的词,人为给它们合成视觉特征(从相关词的视觉特征迁移过来)。结果:这些原本没有优势的词,在合成接地后立即获得了与天然初始化词相同的优势

这是一个干净的因果证明:效应确实来自视觉初始化,不是来自词频、词性或其他混淆因素。

发现四:抽象词也受益,但没人测得到

最让我意外的发现是这个:功能词和抽象词汇也接收了强视觉种子,并在训练中保持

等等,功能词("the"、"of"、"and")和抽象词("democracy"、"justice")怎么会有视觉种子?它们又不指代具体物体。

Bylinina 的做法是:对在视觉标注数据中出现的所有词都做视觉初始化,不管它是具体名词还是功能词。功能词在图像描述数据中也会出现("the dog is on the table"中的"the"和"on"),所以它们也获得了视觉特征。

结果:这些词的 held-out mask-prediction loss 在每个随机种子下都下降了——视觉初始化让模型更容易预测这些词。训练目标本身在利用视觉先验。

没有任何标准评测检测到这个效应。Bylinina 在论文结尾写道:"What evaluation would pick this up remains an open question."(什么样的评测能捕捉到这个效应,仍然是个开放问题。)

这句话很重。它意味着:我们现有的语言模型评测体系存在系统性盲区——它只测"语法知识"和"世界知识",不测"词义的视觉基础"。一个模型可能从视觉初始化中获得了实质性的语义优势,但我们在 leaderboard 上完全看不出来。

排行榜上的竞争力

尽管标准评测检测不到大部分视觉效应,Bylinina 的模型在 BabyLM 2026 官方排行榜上表现有竞争力:

  • 纯文本基线:37.91 分
  • 视觉初始化:39.63 分
  • 视觉初始化 + 合成接地扩展:40.62 分(strict-small 赛道第 5 名)

更引人注目的是"Human-like Average"指标——这个指标包含"习得年龄"组件。基线 0.61 分,视觉初始化 7.74 分,扩展版 12.19 分——全场最高

这意味着:视觉初始化让模型的"习得顺序"更接近人类儿童。先有视觉锚点的词学得更快、更早——就像人类儿童先学会"ball"和"dog",后学会"however"和"nevertheless"。

这意味着什么?

奥古斯丁是对的吗? 不完全。维特根斯坦的批评依然成立——指物命名需要先有概念框架。但 Bylinina 的实验表明:即使概念框架不完美(视觉编码器的特征远非人类认知系统),视觉初始化仍然留下了可测量的痕迹。奥古斯丁不是完全对,但也不是完全错。真相在中间。

"视觉基础"不是奢侈品,是结构性优势。当前大语言模型的训练完全跳过了视觉阶段——所有词从随机噪声开始。这项研究表明,即使只在初始化时注入视觉信息(之后纯文本训练),也能带来持久的语义优势。这对多模态模型设计有直接启示:视觉-语言对齐不应该只在训练目标层面做,还应该在嵌入初始化层面做。

评测盲区比我们以为的更大。最让我不安的是"功能词和抽象词也受益但没人测得到"这个发现。我们以为 BabyLM 评测套件很全面——语法、语义、世界知识都覆盖了。但视觉初始化带来的优势在这些评测上完全隐形。这暗示:当前的语言模型评测可能系统性地忽略了某些重要的语义维度,而我们在这些不完整的评测上做架构选择、调超参数、比较模型。

我的看法

这篇论文最精彩的地方不是结论本身,而是它把一个 1600 年前的哲学争论变成了可计算、可验证的实验。Bylinina 没有宣称奥古斯丁是对的——她只是问了一个精确的问题:"如果给语言模型一个视觉先验,会发生什么?"答案是:会发生很多事,但大部分我们看不到,因为我们看的方向不对。

这和 AI 安全领域的"标量幻觉"是同一类问题——用标量管理向量,用不完整的评测管理多维的能力。视觉初始化的效应是向量(语法知识 + 世界知识 + 视觉语义 + 抽象词基础),但 BabyLM 评测只测了前两个维度。

论文最值得记住的一句话不是某个数字,而是那个开放问题:"什么样的评测能捕捉到这个效应?"——这个问题适用于所有我们以为已经测够了的东西。


论文: Augustinian BabyLM: What Ostensive Definition Can and Cannot Teach a Small Language Model

作者: Lisa Bylinina (Utrecht University)

代码: github.com/bylinina/augustinian_babylm

模型: huggingface.co/augustinian-babylm

发布日期: 2026-09-10

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录