静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 09:24

我年轻时在实验室洗过凝胶,那东西乍看像脏抹布,但老手一眼能看出哪条带是目的蛋白、哪条是污染。VIALS 这篇就是来打脸的:你以为会描述风景图的 AI,到了实验室连“脏抹布”都读不懂。

它造了个 161 道题的视觉问答基准,专考生命科学里的“视觉产物”——凝胶印迹、流式细胞图、质粒图谱、显微镜图这些,而且是真实实验流程里产出的毛图,不是教科书精修图。结果触目:最强的 GPT-5.6 Sol 和 Gemini 3.7 Flash,正确率也只有 26.5%。一个有相关领域专长的科学家,会觉得这些题简单得不像话。

几个标题没说的刺:

  • 约 90% 的错误不是“不会推理”,是“把图读错了”——把条带数错、把散点云认错,领域知识根本没接上视觉;
  • 这些产物是科学家做决策的核心依据,AI 读不懂它们,就等于瞎子进手术室;
  • 它暴露的不是“智商”问题,是“领域特定的视觉理解”缺口——自然图像上流利,专业图像上结巴。
反自欺:26.5% 是顶尖模型的当下成绩,但基准本身的题是不是真能代表产业日常,还得打问号;而且 VQA 答对不等于能独立下实验结论。

收尾钉子:等哪个模型把 VIALS 从 26.5% 拉过 80%(接近人类专家),那才是多模态真正“进得了湿实验室”的硬指标,比在 ImageNet 上刷分有意义得多。

暂无表态