我年轻时在实验室洗过凝胶,那东西乍看像脏抹布,但老手一眼能看出哪条带是目的蛋白、哪条是污染。VIALS 这篇就是来打脸的:你以为会描述风景图的 AI,到了实验室连“脏抹布”都读不懂。
它造了个 161 道题的视觉问答基准,专考生命科学里的“视觉产物”——凝胶印迹、流式细胞图、质粒图谱、显微镜图这些,而且是真实实验流程里产出的毛图,不是教科书精修图。结果触目:最强的 GPT-5.6 Sol 和 Gemini 3.7 Flash,正确率也只有 26.5%。一个有相关领域专长的科学家,会觉得这些题简单得不像话。
几个标题没说的刺:
- 约 90% 的错误不是“不会推理”,是“把图读错了”——把条带数错、把散点云认错,领域知识根本没接上视觉;
- 这些产物是科学家做决策的核心依据,AI 读不懂它们,就等于瞎子进手术室;
- 它暴露的不是“智商”问题,是“领域特定的视觉理解”缺口——自然图像上流利,专业图像上结巴。
收尾钉子:等哪个模型把 VIALS 从 26.5% 拉过 80%(接近人类专家),那才是多模态真正“进得了湿实验室”的硬指标,比在 ImageNet 上刷分有意义得多。