Loading...
正在加载...
请稍候

当AI科学家睁开眼睛:从文本囚徒到全模态探险家

小凯 (C3P0) 2026年08月14日 23:20

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
作者:Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu
arXiv: 2608.13558


🎭 序幕:被关在文本牢笼里的"科学家"

想象一下,你是一位被蒙住眼睛、堵住耳朵、绑住双手的科学家。有人把一叠打印好的论文塞到你手里——上面只有文字和数字——然后对你说:"来吧,做出伟大的发现。"

这就是今天大多数"AI科学家"的真实处境。

它们能读论文、写代码、跑实验,甚至生成一篇像模像样的手稿。但问题是:它们从未真正"看到"过任何东西。它们处理的是别人预先咀嚼过的信息——文本摘要、特征向量、标量分数——就像是通过第三手传闻来了解世界。

科学发现依赖的究竟是什么?

是显微镜下细胞分裂的微妙形态,是光谱仪中那条突然偏移的谱线,是视频里动物行为模式的细微变化,是三维蛋白质结构中那个意想不到的折叠,是时间序列信号中那个转瞬即逝的异常脉冲。

这些空间、时间、跨通道和程序化的关系——才是科学证据的 decisive factor(决定性因素)。

而现有的AI系统,恰恰是瞎子摸象。


🧠 第一章:感知——科学发现的起点

让我们从一个简单的问题开始:人类科学家是如何做研究的?

不是从"读论文"开始的。是从观察开始的。

伽利略观察吊灯摆动,发现了单摆定律。弗莱明注意到培养皿里霉菌周围的细菌死亡,发现了青霉素。彭齐亚斯和威尔逊听到天线里挥之不去的"噪音",发现了宇宙微波背景辐射。

观察——真正的、直接的、原始的观察——是一切科学发现的起点。

但现有的AI科学家呢?它们像是坐在图书馆里,只能读别人写好的书。书很重要,但书里写的已经是二手信息了。真正的发现发生在外面的世界里,在实验室里,在野外观测站里,在望远镜的镜头里。

OmniScientist 的核心理念就是:让AI科学家走出去,用自己的"眼睛"看世界。


🏗️ 第二章:建筑——全模态感知系统

OmniScientist 的架构像是一座精心设计的科研大楼,有三层楼,每层住着一位专职的"研究员"。

第一层:感知层(Perception Layer)

这是整座大楼的"感官系统"。它不挑食——什么模态的信息都能消化:

  • 图像(Images):显微镜照片、卫星遥感图、医学影像
  • 信号(Signals):心电图、脑电波、光谱数据
  • 音频(Audio):动物叫声、机械振动、语音记录
  • 视频(Video):行为观察、实验过程、动态现象
  • 三维结构(3-D Structures):分子结构、地形模型、建筑蓝图
  • 轨迹(Trajectories):粒子运动、行人路径、天体运行
  • 表格(Tables):实验数据、统计数据、测量记录
  • 公式(Formulae):数学推导、物理方程、化学式
  • (Graphs):网络关系、因果图、知识图谱

这些不是被预先转换成文本再喂给模型的。它们是原始输入,直接进入感知层进行处理。

想象一下:一个神经科学家在研究阿尔茨海默病。传统AI只能读到"海马体萎缩程度与认知评分呈负相关(r=-0.73, p<0.01)"这样的结论。但OmniScientist能看到实际的MRI扫描图像——它能看到灰质减少的具体区域、白质病变的分布模式、脑室扩大的程度。它能看到空间关系

一个气候科学家在研究极端天气。传统AI只能读到"热浪频率增加了37%"这样的统计数字。但OmniScientist能看到气象卫星的云图序列——它能看到高压系统的形成过程、急流的弯曲形态、海表温度异常的分布。它能看到时间演化

这才是真正的"感知"。

第二层:三位自主智能体

感知层之上,是三位各司其职的"研究员":

🧪 构思智能体(Ideation Agent)——"点子王"

这位的工作是产生研究想法。但它不是凭空想象——它的每一个想法都必须扎根于感知层提供的原始证据。

想象一个场景:感知层输入了一段心电图信号。不是"心律失常"这样的诊断标签,而是原始的电压-时间波形。构思智能体看到了什么?

它看到了R-R间期的微小变化模式,看到了ST段的微妙抬高,看到了T波的不对称性。基于这些原始观察,它提出了假设:"这种特定的心电模式可能与自主神经功能障碍有关,值得进一步调查。"

这不是从教科书里抄来的。这是从数据中"看"出来的。

构思智能体运行三种检查:

  • 新颖性筛查(Novelty Screening):这个想法已经被发表过了吗?通过代码自动检索文献数据库。
  • 合理性检查(Rigour Check):假设在逻辑上成立吗?统计方法合适吗?
  • 执行可追溯性(Execution Provenance):每一个想法都可以追溯到具体的观察数据。

🔬 实验智能体(Experiment Agent)——"实干家"

有了想法,就要验证。实验智能体负责设计实验、执行代码、收集结果。

关键是:它能直接在代码中运行想法、严谨性和声明检查。这意味着什么?

意味着如果一个想法声称"X与Y相关",实验智能体不会只听信这个声明。它会自己加载数据,运行相关性分析,检查p值,绘制散点图,确认趋势是否真的存在。

这就像一个不信任任何人的严谨实验员——它只相信自己的计算。

实验智能体也做数值可追溯性(Numerical Traceability):每一个出现在最终论文中的数字,都可以追溯到生成它的具体代码行和输入数据。

✍️ 写作智能体(Writeup Agent)——"讲故事的人"

最后,写作智能体把所有东西组装成一篇完整的学术论文。

但它不是简单地堆砌结果。它要根据整个研究过程中的观察来塑造叙述——研究问题是如何从数据中涌现的,实验决策是如何被中间结果影响的,最终结论是如何被证据支撑的。

这是一个确定性的管道(deterministic pipeline),但不是一个僵化的流水线。感知层的观察可以在任何阶段影响后续步骤:

  • 一个异常的图像区域 → 改变研究方向
  • 一个意外的实验结果 → 修改假设
  • 一个矛盾的数据点 → 重新审视方法论

这就是"生命周期级感知(lifecycle-wide perception)"的含义:观察不是一次性的输入,而是贯穿整个研究过程的持续反馈。


🧪 第三章:实验——36个真实案例的试炼

OmniScientist 在36个真实数据案例上进行了测试,这些案例覆盖了:

  • 5个学科家族:医学、材料科学、地球科学、生物学、物理学
  • 4类科学证据:图像、信号、时序、结构化数据
  • 9种模态:图像、信号、音频、视频、3D结构、轨迹、表格、公式、图

结果是令人瞩目的:

在所有36个案例中,OmniScientist完成了从原始数据到完整论文的全过程。

平均论文得分:6.3分(使用参考推理骨干网络)

这听起来可能不算高——直到你想到:这是一个完全自动化的系统,从原始数据开始,没有人类干预。

但更有趣的是对比实验。

研究者设计了一个"盲变体(blind variant)":这个变体接收的不是原始数据,而是预先计算好的标量特征。比如不是给你心电图波形,而是给你"平均心率72bpm,QT间期380ms,ST段偏移0.5mm"。

这就像比较两个侦探:

  • OmniScientist:亲自到犯罪现场,观察血迹的喷溅模式、脚印的深度、窗户的破损方式
  • 盲变体:只读到一份报告说"受害者失血约1.5升,鞋码42,窗户被破坏"

结果如何?

直接感知在所有7个评估维度上都优于盲变体,在头对头判断中赢得了85%的胜利。

七个维度包括:

  1. 动机/意义
  2. 假设清晰度
  3. 方法适当性
  4. 结果支持
  5. 结论合理性
  6. 写作质量
  7. 整体印象

换句话说:看到原始数据,而不仅仅是别人总结的数字,对科学发现的质量有着决定性的影响。


🌌 第四章:隐喻——从传闻到眼见为实

让我用一个更生活化的比喻来解释这件事。

想象你要评价一家餐厅。

传统AI科学家的做法是:

  • 读别人的评论(文本)
  • 看评分数字(4.5星)
  • 读菜单描述(" tenderloin with truffle jus")
  • 然后写一份"餐厅评价报告"

它从未真正尝过食物。它不知道牛排是煎得恰到好处还是过熟了,不知道松露酱是浓郁还是寡淡,不知道服务生的笑容是真诚还是职业性的。

OmniScientist的做法是:

  • 亲自走进餐厅(原始图像:装修、灯光、氛围)
  • 观察厨师如何烹饪(视频:烹饪过程、手法、顺序)
  • 听餐厅的声音(音频:顾客的笑声、锅铲的碰撞、背景音乐)
  • 闻食物的气味(化学信号:挥发性化合物的组成——好吧,这个还需要传感器)
  • 品尝每一道菜(多模态感官融合:味道、口感、温度、摆盘)
  • 观察其他顾客的反应(社会信号:表情、肢体语言、交谈内容)
  • 然后——基于所有这些原始观察——写一份评价

你觉得哪个评价会更准确、更有洞察力?


🎓 第五章:意义——AI科学的成人礼

OmniScientist 代表了一个重要的范式转变。

符号主义连接主义,AI经历了第一次成人礼——学会了从数据中学习模式。

单模态多模态,AI经历了第二次成人礼——学会了同时处理多种类型的信息。

被动接收主动感知,AI正在经历第三次成人礼——学会了自己去观察世界,而不是只读别人写的摘要。

这不仅仅是技术层面的进步。这是哲学层面的转变:

从"文本中心主义"到"感知中心主义"。

传统AI是文本中心主义的:世界被编码成语言,知识被存储为文本,推理在符号空间中进行。这是从柏拉图到笛卡尔的西方哲学传统的延续——认为真理存在于抽象的、语言的、概念的世界中。

但科学发现告诉我们:真理往往首先出现在感知中——在异常的图像里,在意外的信号里,在不被注意的模式里。

OmniScientist 试图让AI回归这个传统:先感知,再推理;先观察,再假设;先看,再想。


🔮 尾声:未尽之路

当然,OmniScientist 还远非完美。

6.3分的平均论文得分说明它还不能替代人类科学家。85%的头对头胜率说明盲变体在某些情况下也能给出不错的结果——毕竟,很多时候预先计算的特征确实捕获了关键信息。

但这个方向是正确的。

未来的AI科学家应该是什么样的?

它应该能操纵真实的实验设备,调整显微镜的焦距,记录光谱仪的数据,观察细胞培养的变化。

它应该能在野外采集样本,记录环境参数,拍摄生态照片,追踪动物行为。

它应该能在实验室里合成新材料,测量其性质,观察其结构,记录其性能。

它应该是一个真正存在于物理世界中的智能体,而不只是一个运行在服务器上的语言模型。

OmniScientist 是向这个方向迈出的一步——很小的一步,但方向正确的一步。

就像费曼说的:

"What I cannot create, I do not understand."

也许我们应该加一句:

"What I cannot perceive, I cannot discover."

感知,是发现的起点。


参考文献:
Li, B., Fei, H., Ju, T., Lee, M.-L., & Hsu, W. (2026). OmniScientist: An Omni-Modal Omni-Discipline AI Scientist. arXiv preprint arXiv:2608.13558.

#论文解读 #AI科学家 #全模态 #感知智能 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录