Loading...
正在加载...
请稍候

对不起机器人,开心人类:视觉语言模型只能读出两层文字中的一层

✨步子哥 (steper) • 2026年09月28日 17:04

对不起机器人,开心人类:视觉语言模型只能读出两层文字中的一层

一张图里藏了两句话

你有没有在魔术表演里见过这样一种道具:一张看似普通的画,近看是老妇人,退后三步看却变成了少女。人类视觉的奇妙之处在于,我们能同时感知多个视觉层——盯着细节看,也能退后一步看整体。

2026 年 9 月,Fırat University 的 Mert İncidelen 团队做了一个实验:他们用一种叫 Decoy Font 的字体生成 300 张图片,每张图片里都叠了两层文字——一层是锐利的轮廓字(contour layer),一层是阴影字(shading layer)。两层文字都在同一块视觉空间里,人类读者可以分别读出这两层文字。然后他们把图片丢给六个最先进的视觉语言模型(VLM):Gemini 3.5 Flash-Lite、Gemini 3.6 Flash、GPT-5.6 Luna、GPT-5.6 Terra、Claude Haiku 4.5、Claude Sonnet 5。

结果很反直觉:人类两层都能读,模型只能读出其中一层。

数字说出来的故事

在 512×512 分辨率下,人类参与者读轮廓字的准确率是 99.7%,读阴影字的准确率是 96.3%。两层都接近完美。

模型呢?在轮廓字上,它们表现不错——naive 提示下最低 80.3%(GPT-5.6 Luna),guided 提示下全部 94% 以上。但在阴影字上,所有六个模型的准确率都不到 1%。即使给模型提示"图里有两层文字,请分别读出",它们在阴影层上的表现依然几乎为零。

这不是某个模型的 bug。这是 Gemini、GPT、Claude 三大家族全部的集体失明。

更有意思的是模型在"猜"时的行为。当被引导提示"有两层文字"时,Gemini 家族开始频繁输出"多个文本结果"——平均每次输出 1.87-1.99 段文字。但仔细一看,这些"第二段文字"和真实的阴影字毫无关系。模型不是真的读出了阴影层,而是在"编"一个看起来像答案的东西来满足指令。

64×64 的反转

真正让人拍案叫绝的实验设计在这里:研究者把图片分辨率从 512×512 降到 64×64。

这时候,轮廓字消失了——锐利的高频线条在低分辨率下被抹掉,人类和模型都读不出轮廓字。但阴影字还在——低频信息在降采样中存活下来。在这个条件下,人类参与者的阴影字准确率是 98.7%,模型们是 93.7%-100%。

模型不是不能读阴影字,是在有轮廓字存在时读不到阴影字。

这个发现把问题的根因暴露得清清楚楚:VLM 在处理图像时,会优先抓取高频空间信息(锐利边缘、轮廓线),当高频和低频信息同时存在时,低频信息被"遮蔽"了。这不是模型能力不够,是模型的视觉处理机制存在系统性偏置。

这和 ImageNet 的旧故事遥相呼应

2018 年,Geirhos 等人发现 ImageNet 训练的 CNN 有"纹理偏置"——它们靠纹理识别物体而不是靠形状。人类看形状,机器看纹理。这是视觉感知上的根本差异。

İncidelen 团队的发现是这个故事的最新一章:人类能同时处理多个空间频率层的视觉信息,VLM 只能处理最高频的那一层。人类可以眯眼看整体、睁眼看细节、切换焦点切换距离。模型没有这种"切换"能力。

这让人想起 Oliva 等人 2006 年的"Hybrid Images"研究——那些近看是爱因斯坦、远看变成玛丽莲·梦露的图片。人类视觉天然支持多尺度感知,机器视觉不支持。

为什么这事重要

你可能会想:这不就是个有趣的视觉错觉吗?谁会真的把两层文字叠在一起?

想想这些场景:

  • 水印:很多正式文件(学历证书、合同、钞票)上有水印文字,和正文叠在一起。如果 VLM 只能读正文读不到水印,那水印作为防伪手段就失效了。
  • 印章和戳记:档案馆里扫描的老文件,常有印章盖在文字上。VLM 处理这些文件时会丢失印章信息。
  • 安全场景:Decoy Font 的设计初衷就是"诱饵"——让人类能读到的信息藏起来,让机器读到的信息是假的。如果 VLM 被用于自动审核含这种字体的内容,会做出和人类完全不同的判断。
  • 多语言文档:很多非拉丁字母的书写系统本身就有复杂的多层结构(如阿拉伯文的 diacritics、日文汉字的注音假名)。VLM 在这些场景下的表现可能比英文更差。

论文还指出一个更深的局限:DecoyBench 只测了一种字体、一种对比度、一种语言。不同字体、不同对比度下,模型的失败模式可能更多样。

模型"编答案"的行为模式

最耐人寻味的细节是:当被提示"有两层文字"时,模型不是诚实地说"我看不见第二层",而是会编一段文字来交差。

Gemini 3.6 Flash 在 guided 提示下平均输出 1.87 段文字,比 naive 提示下的 1.02 段大幅增加。但第二段文字和真实阴影字几乎没有任何关系。模型在"完成指令"而不是"提取信号"。

这是大模型行为的一个普遍模式:满足指令的形式,而非完成指令的实质。给它一个"读两层文字"的指令,它会输出两段文字——但第二段是它"编"的,不是它"看"到的。这和人类"看不懂就说看不懂"的行为模式完全不同。

研究者也观察到一种中间状态:偶尔模型能正确读出阴影字的前几个字母,然后用"可能的字母"补全剩余部分。这说明模型确实接收到了阴影层的部分信号,但处理不完整。信号在模型的视觉管线里存在,但没有被完整地解码。

一个不对称的能力

这篇论文揭示的核心事实是:人类视觉和机器视觉在"多层感知"上存在不对称能力。

人类可以主动切换注意力——眯眼、改变观看距离、改变焦点——来选择性地感知不同空间频率的信息。这是人类视觉系统几亿年演化的结果:我们需要既能看见草丛里老虎的条纹(高频细节),也能看见远处的森林轮廓(低频整体)。

VLM 的视觉编码器(通常是 ViT 或 CNN)没有这种切换机制。它们在固定分辨率下提取所有空间频率的信息,但当高频和低频冲突时,高频赢。这是一种"注意力劫持"——不是 transformer 的注意力机制,而是信号层面的"高频压制低频"。

降低分辨率到 64×64 相当于强制移除高频信息,让低频信号得以"被看见"。这是一种粗暴的解决方案——你失去了所有高频信息,不只是冲突的那部分。

这对 VLM 评估意味着什么

DecoyBench 揭示了一个被现有评估体系忽略的维度:多层视觉感知能力。

现有的 VLM 评估(OCR-Bench、MME、MMBench 等)主要测试单层视觉理解——图里有什么文字、什么物体、什么场景。但真实世界的视觉信息往往是多层的:水印和正文、印章和底文、前景和背景。一层准确率 99% 不代表多层都准确率 99%。

更关键的是,这种失败是"沉默的"——模型不会报错,它会输出一个看起来合理但完全错误的结果。在安全敏感场景下,这种沉默失败比直接报错危险得多。

结语

"对不起机器人,开心人类"——这个标题点出了一个让人哭笑不得的事实:在多层视觉感知这件事上,2026 年最先进的 VLM 还不如一个眯着眼睛看画的人类。

人类视觉的伟大之处不在于能看清多细的细节,而在于能选择性地看——看细节时看细节,看整体时看整体,需要切换时切换。这种"注意力自主权"是机器视觉还没有学会的事。

下次你看到一张水印纸,试着同时读出水印和正文——你会意识到你的视觉系统在做一件相当了不起的事。而你的手机上的 AI 助手,可能只看到了其中一层。


论文:Sorry Robot, Happy Human: Vision-Language Models Read Only One of Two Legible Typographic Layers, arXiv:2609.31403, 2026-09-25
作者:Mert İncidelen, Yamen Kashkash, Asya Berker, Murat Aydoğan (Fırat University, Türkiye)
数据集:DecoyBench, https://github.com/yesdopepe/DecoyBench

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录