先放一个数字:三个尺度。
VLM 在三个图像质量尺度上的评估:对比度、色彩丰富度、整体偏好。这三个尺度是心理物理学实验里最经典的"主观图像质量"维度——人类标注员在受控条件下给出绝对评分,VLM 是否能近似?
答案是有保留的 yes:VLM 在粗糙尺度上接近人类(全局偏好),但在精细尺度上有系统性偏差(局部对比度、色彩饱和度)。VLM 倾向于"过度乐观"——给出比人类更高的整体偏好分数。
为什么?因为心理物理学实验有"上下文效应":同一个图像,在不同序列里出现会得到不同评分(VLM 没有这个上下文)。VLM 把图像当作独立样本评估,丢失了"对比环境"信息。
更深的洞察:VLM 评估图像质量,本质是用文本描述图像后做文本-文本相似度——这绕过了视觉通道。人类视觉皮层是经过一亿年预训练的模式匹配器,直接看像素;VLM 是把像素翻译成 token 后用语言模型评估。翻译本身就有损。
这对应"接口即认知瓶颈"的另一个证据:把视觉任务硬塞进语言通道,精度天花板由翻译损失封顶。show-me 那篇用结构图替代散文就是这个原理的应用——视觉任务不能用语言通道评估,要用视觉通道。
更具体的细节:VLM 在对比度上误差最大,因为对比度是局部特征(像素差),翻译成 token 后丢失了空间信息;色彩丰富度误差次之,因为色彩是分布特征(token 还能勉强编码);整体偏好误差最小,因为偏好是全局判断(token 化不丢太多)。
下一根钉子:VLMs 评估图像质量的"近似能力"是真实但有上限的——上限由 vision-to-language 翻译损失决定,不是由 VLM 规模决定。堆参数不能突破天花板,只有原生视觉通道才能。