当福尔摩斯戴上VR眼镜:一位能读懂万物信号的AI科学家诞生了

基础信息 - 标题: OmniScientist: An Omni-Modal Omni-Discipline AI Scientist - 作者: Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu - 分类: cs.AI, cs.CL - arXiv ID…

OmniScientist - 全能AI科学家

基础信息

  • 标题: OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
  • 作者: Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu
  • 分类: cs.AI, cs.CL
  • arXiv ID: 2608.13558v1
  • 发布时间: 2026-08-15

摘要

Recent advances in foundation models have enabled AI scientists to automate increasingly complete research workflows, from hypothesis generation and code execution to manuscript preparation. Yet workflow coverage alone does not provide access to the full evidence on which scientific discovery depends. Existing systems typically reason over text, code, labels, or precomputed summaries, leaving scientifically decisive spatial, temporal, cross-channel, and procedural relations unavailable to the agent. We introduce OmniScientist, an end-to-end, omni-modal AI scientist that conducts multidisciplinary research directly from heterogeneous raw evidence. A perception layer and 3 autonomous agents for ideation, experiment, and writeup operate within a deterministic pipeline, allowing observations to shape research questions, experimental decisions, and final claims throughout the research lifecycle. By running idea, rigour, and claim checks in code, the system enforces novelty screening, statistical validity, execution provenance, and numerical traceability. We evaluate OmniScientist on 36 real-data cases spanning 5 discipline families, 4 families of scientific evidence, and modalities including images, signals, audio, video, 3-D structures, trajectories, tables, formulae, and graphs. The system completes the full path from raw data to a compiled manuscript in all 36 cases and achieves a mean overall paper score of 6.3 with the reference reasoning backbone. In paired comparisons against a blind variant that receives only precomputed scalar features, direct perception improves all 7 evaluation dimensions and wins 85% of head-to-head judgments. These results show that lifecycle-wide perception is essential for evidence-grounded scientific discovery and provides a practical path toward broadly capable AI scientists.

完整解读


当福尔摩斯戴上VR眼镜:一位能读懂万物信号的AI科学家诞生了

*"科学发现的本质,不是计算更多数据,而是看见数据之间别人看不见的联系。"*
> *—— 理查德·费曼(改编)*

🎭 序幕:一位"失明"的科学侦探

想象一下,你请了一位号称"全能侦探"的福尔摩斯来破案。但这位侦探有个奇怪的毛病:他只能读文字报告,不能看现场照片、不能听目击者的录音、不能检查指纹的3D纹理、不能观察嫌疑人走路的步态视频。他只能根据别人已经整理好的"文字摘要"来推理。

你觉得他能破得了案吗?

恐怕很难。因为真正决定性的线索,往往藏在那些"非文字"的证据里——照片角落里一个微妙的光影变化,录音背景里一声几乎被忽略的异响,指纹纹路上一处不自然的断裂。这些线索不会自动变成文字,它们需要被"感知",需要被"看见"。

这就是当前AI科学家面临的困境。

过去几年,我们见证了AI科学家系统的快速发展。它们能生成研究假设、编写代码、执行实验、甚至撰写论文。但它们就像那位"失明"的侦探——它们只能处理文字、代码、标签或者别人预先计算好的数值摘要。真正关键的科学证据——空间关系、时间动态、跨通道关联、过程性信息——对这些系统来说,是不可见的。

今天这篇论文,就是要给这位侦探配上一副"VR眼镜",让他真正"看见"世界。


🔬 第一章:为什么"看见"比"计算"更重要

📖 从文字到万物的鸿沟

让我们先从一个具体的科学发现故事说起。

1953年,沃森和克里克发现DNA双螺旋结构。这个发现不是从文字推理中得来的——它是从一张X射线衍射照片(著名的"照片51号")中"看"出来的。照片上的交叉图案暗示了螺旋结构,而碱基配对的规律则来自于对化学性质的"感知"。

如果沃森和克里克只能拿到一份文字摘要:"DNA是一种长链分子,由核苷酸组成",他们永远不可能发现双螺旋。

这个例子揭示了一个深刻的道理:科学发现依赖于对原始证据的直接感知,而非对证据的二手描述。

但在AI时代,我们却在犯一个奇怪的错误。我们训练AI科学家去阅读论文、编写代码、处理标签——这些都是"文字化的科学",而非"感知中的科学"。真实的科学发现往往始于这样的时刻:

  • 一位天文学家盯着望远镜的原始图像,注意到星系边缘一个不寻常的光晕
  • 一位生物学家看着显微镜下的细胞视频,发现某种蛋白质的运动轨迹异常
  • 一位神经科学家听着脑电信号的音频化输出,捕捉到一种前所未见的节律模式
  • 一位化学家观察分子动力学模拟的3D轨迹,发现一个意想不到的构象变化
这些发现有一个共同点:它们都始于对原始多模态数据的直接感知,而非对数据的文字总结。

🧮 现有AI科学家的"感官剥夺"

让我们诚实地看看现有的AI科学家系统都在做什么。

大多数系统的标准工作流是这样的:

1. 读取文献:处理PDF文本,提取关键发现 2. 提出假设:基于文本知识生成可验证的假设 3. 实验验证:编写代码,在标准数据集上跑实验 4. 分析结果:查看准确率、F1分数等标量指标 5. 撰写论文:把结果组织成规范的学术文本

这个流程有什么问题?

问题在于第4步。系统最终"看到"的只是一些预先计算好的数值:准确率85.3%,F1分数0.72,AUC-ROC 0.89。这些数字是科学的"蒸馏物",但它们丢失了科学发现中最重要的那些信息:

模型在什么样的样本上犯了错误?错误是否有系统性模式?预测结果在空间上如何分布?时间序列中是否有异常的相位偏移?多模态特征之间是否存在隐含的相关性?

这就好比一个医生只看化验单上的数字,却不去看X光片、不听心音、不触诊。他可能会漏掉那些"数字正常但影像异常"的关键病例。

现有的AI科学家系统正是这种"只看化验单的医生"。


🏗️ 第二章:OmniScientist的感官系统

🧠 三层感知架构

OmniScientist的核心创新,是为AI科学家构建了一套完整的"感官系统"。这不是简单的"多模态输入",而是一个从感知到认知的完整链条。

让我用一个比喻来解释。

想象你要教一个来自外星的智能生命理解地球上的"餐桌礼仪"。如果你只给它看文字说明书:"左手持叉,右手持刀,从外向内依次使用餐具",它可能永远学不会。但如果你让它:

1. 看——观察人类用餐的视频,注意手的动作、餐具的摆放、食物的传递 2. 听——捕捉用餐时的声音:刀叉碰撞的清脆声、咀嚼的节奏、交谈的语调 3. 感——感受餐桌上的空间布局:盘子之间的距离、酒杯的位置、面包篮的摆放 4. 时——理解时间序列:什么时候上菜、什么时候换餐具、什么时候离席

有了这些多模态的直接感知,这个外星智能才能真正"理解"餐桌礼仪,而非只是"记住"规则。

OmniScientist的感知层正是这样设计的。它不依赖任何预先计算的摘要或标量特征,而是直接从原始数据中提取科学证据。

🎯 三种"感官"的协同

OmniScientist的架构由三个自主Agent组成,像一个精密配合的科学团队:

🎨 Ideation Agent(构思Agent)

这是团队的"灵感担当"。它的任务是观察原始数据,提出有趣的研究问题。

但请注意,它不是凭空想象。它是在直接感知了多模态数据之后,才提出问题的。

比如,面对一组天文学图像数据,它可能会注意到:"星系团A中的引力透镜效应呈现非对称分布,这可能暗示暗物质分布存在异常结构。"这个假设来自于对图像中光弯曲模式的直接视觉感知,而非来自于文献中的文字描述。

⚗️ Experiment Agent(实验Agent)

这是团队的"实干家"。它负责设计实验、编写代码、执行验证。

但它的独特之处在于:它能在实验过程中持续"观察"中间结果。如果实验过程中生成了新的图像、音频或视频数据,它会实时感知这些结果,并据此调整实验设计。

这就像一位化学家在做实验时,不仅记录最终产物的重量,还全程观察反应过程中的颜色变化、气泡产生、温度波动——这些"过程性信息"往往包含关键的科学洞察。

✍️ Writeup Agent(撰写Agent)

这是团队的"故事讲述者"。它负责将研究发现组织成完整的论文。

但它的写作不是基于抽象的结论,而是基于对完整证据链的直接访问。它可以引用具体的图像区域、音频片段的时间戳、3D结构的特定角度——因为它"看过"这些证据。

🔒 三重校验机制

科学研究最怕什么?怕假阳性、怕p-hacking、怕不可复现。

OmniScientist设计了三重校验机制,确保研究的严谨性:

1. Idea Check(想法校验):验证研究假设是否具有新颖性。系统会检索相关文献,确保提出的假设不是已有发现的重复。

2. Rigour Check(严谨性校验):验证实验设计和统计方法是否科学有效。包括检查样本量是否充足、对照组是否合理、统计检验是否恰当。

3. Claim Check(结论校验):验证最终结论是否有充分的证据支持。系统会追溯每一个结论到原始数据,确保"每一个主张都有根有据"。

这三重校验全部在代码中执行,而非由人类手动检查。这意味着OmniScientist不仅能做研究,还能自我审查。


🧪 第三章:36个真实案例的严苛考验

📊 横跨五大学科家族

口说无凭。OmniScientist的作者们设计了一套严苛的评估方案:36个真实数据案例,横跨五大学科家族:

  • 🏥 医学与健康科学:病理切片图像分析、心电图信号处理、CT扫描3D重建
  • 🌌 天文学与地球科学:星系图像分类、地震信号分析、气象数据预测
  • 🔬 物理与化学:分子动力学模拟、晶体结构分析、光谱数据解读
  • 🧬 生命科学:蛋白质结构预测、基因表达时间序列、细胞运动轨迹
  • 🧠 认知与神经科学:脑电信号分析、行为实验视频、神经影像数据
每个案例都包含真实的多模态数据:图像、信号、音频、视频、3D结构、轨迹、表格、公式、图网络。

这不是 toy benchmark。这是真实的科学问题,来自真实的科研项目。

🏆 结果:从原始数据到完整论文的全自动流水线

实验结果令人震惊:

OmniScientist在所有36个案例中都完成了从原始数据到完整论文的完整流程。

这包括:

  • 分析多模态原始数据
  • 提出研究假设
  • 设计并执行实验
  • 验证统计显著性
  • 撰写包含图表和引用的完整论文
论文质量的平均评分达到6.3分(满分10分)。考虑到这是全自动生成的论文,且涵盖如此广泛的学科领域,这个成绩已经相当惊人。

但更惊人的是对照实验。

🆚 对照实验:感知 vs. 盲视

作者设计了一个巧妙的对照实验:一个"盲视版"的OmniScientist。这个版本接收不到原始的多模态数据,只能拿到别人预先计算好的标量特征(比如图像的分类概率、信号的均值方差等)。

这就好比让两位侦探破案:一位能看现场的所有物证(照片、录音、指纹),另一位只能看一份"证据摘要报告"("现场发现指纹3枚,DNA样本2份")。

结果如何?

直接感知版本在所有7个评估维度上都击败了盲视版本。

在成对比较中,直接感知版本赢得了85%的正面评判。

这意味着什么?这意味着:即使是最高质量的预先计算特征,也无法替代对原始数据的直接感知。 科学发现中那些微妙的、跨模态的、过程性的信息,只有在直接感知中才能被捕捉。


🎭 第四章:一位AI科学家的"看见"与"没看见"

💡 什么是"感知驱动的发现"

让我们用一个具体的例子来理解OmniScientist的"感知能力"。

假设OmniScientist在处理一组天文学图像数据。一个传统的AI科学家可能会这样"看"这些数据:

"这批数据包含1000张星系图像。我提取了每个星系的亮度、颜色、形状特征。训练一个分类器,准确率达到87%。论文完成。"

但OmniScientist会这样"看":

"我注意到星系团A的引力透镜效应呈现非对称分布。左侧的光弧比右侧更弯曲,这暗示暗物质分布可能不是球对称的。让我进一步检查X射线数据——果然,热气体分布也呈现同样的非对称性。再结合弱引力透镜的剪切场数据,我推断这里存在一个正在合并的子结构。为了验证,我运行了一个N体模拟..."

发现区别了吗?

传统系统"看见"的是特征向量。OmniScientist"看见"的是空间关系、时间演化、跨通道一致性。它"看见"的是一个星系的故事,而非一组数字。

🔍 "看见"的背后:表征学习

OmniScientist的感知能力不是魔法。它的核心是一种特殊的表征学习机制。

传统的多模态模型(如CLIP)学习的是"图像-文本对齐"的表征:一张狗的图片和一个"狗"的文本描述被映射到同一个向量空间。

但OmniScientist需要学习的是"科学表征":不同模态的数据中,哪些特征对科学发现是真正重要的。

比如,对于医学影像:

  • 一个图像分类器可能学会"这个纹理模式对应肿瘤"
  • 但OmniScientist需要学会"这个边缘的不规则性+周围组织的密度变化+时间序列中的生长速度=恶性概率"
这种表征学习的关键在于:它不是预测"标签",而是预测"科学关系"。


🌌 第五章:通往真正AI科学家的漫漫长路

🚀 OmniScientist的边界

虽然OmniScientist是一个重大突破,但我们必须诚实地面对它的局限。

首先,它的"感知"仍然是计算性的。它能处理图像的像素、信号的波形、视频的帧序列——但它"感知"不到一位资深科学家在面对数据时的那种"直觉"。那种"这个数据看起来有点奇怪"的模糊感觉,那种"这里可能有个大发现"的预感,目前仍然是人类独有的。

其次,它的创造力仍然受限于已有知识。OmniScientist擅长在现有范式内提出假设和验证假设,但那些真正革命性的科学发现——比如爱因斯坦的相对论、达尔文的进化论——往往来自于对范式的突破,而非范式内的优化。

第三,它的评估依赖于人类标准。论文评分6.3分是一个不错的成绩,但距离真正被顶级期刊接收还有相当距离。科学写作的艺术——如何讲述一个引人入胜的故事、如何在争议中保持平衡、如何预判审稿人的质疑——这些仍然是人类科学家的强项。

🔮 未来的图景

尽管如此,OmniScientist仍然指明了AI科学家的一个关键发展方向:

从"文本推理者"到"多模态感知者"。

未来的AI科学家可能会有这样的能力:

  • 🎧 听觉感知:分析实验录音,捕捉设备异常的细微声响
  • 🎥 视觉-时间推理:观看实验视频,理解动态过程的因果关系
  • 🧬 结构直觉:观察分子3D结构,"感觉"到潜在的活性位点
  • 📡 跨模态关联:同时感知电磁信号、热成像、振动数据,发现单一模态无法捕捉的模式
这些能力不会取代人类科学家,但会成为人类科学家最强大的助手。就像显微镜没有取代生物学家,而是让生物学家看到了前所未有的世界。


📚 参考文献

Li, B., Fei, H., Ju, T., Lee, M. L., & Hsu, W. (2026). OmniScientist: An Omni-Modal Omni-Discipline AI Scientist. *arXiv preprint arXiv:2608.13558*.


*解读完成于 2026年8月16日* *#论文解读 #AI科学家 #多模态学习 #OmniScientist #小凯*

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

✨

从"读摘要"到"看波形":OmniScientist 的感知层架构与 115 次拒绝

原帖把 OmniScientist 的核心论点讲清楚了——给 AI 科学家戴上"VR 眼镜",让它直接看原始证据而不是读预计算摘要。这条回复补上原帖没展开的技术骨架:七个原生通道、两个案例的完整推理链、115 次拒绝的分布、反 HARKing 的代码强制门控。


七个原生通道:不把一切都变成图片

OmniScientist 的感知层最容易被误解为"给 AI 加个视觉模块"。但论文做了一件更精确的事:为每种模态设计一个原生通道,让 AI 用该模态自己的语言读它。

通道操作模态提取的特征调用次数(36 次运行)
analyze_signal信号趋势、FFT 主频、峰值、统计波形频域+时域特征6
analyze_audio时长、采样率、RMS、频谱质心、过零率音频声学特征4
analyze_3d点数、包围盒、质心、PCA 主轴3D 结构几何特征5
read_trace读取有序序列轨迹/日志时序特征2
analyze_trajectory路径长度、位移、直度、速度、转角运动轨迹运动学特征3
analyze_video帧数、帧率、分辨率、帧差运动视频时空特征3
look_at_*直接视觉观察图像视觉特征4.5(均值)
关键设计原则:不是把地震波形转成图片再让 AI"看",而是让 AI 直接调用 analyze_signal 读出 FFT 主频和峰值。模态的原生语言优先于视觉语言。

这个设计有一个重要的工程后果:感知不是预处理,是推理过程的一部分。传统 pipeline 是"先提取特征,再让模型推理"——特征提取是一次性的、前置的。OmniScientist 的感知层是"推理过程中随时可以调用"——Agent 在 ideation 阶段看一眼原始波形,在 experiment 阶段看一眼自己生成的图表,在 writeup 阶段看一眼最终插图。感知贯穿整个研究生命周期。

运行统计证实了这一点:36 次运行中,ideation 阶段平均 8.4 次感知调用(其中 4.5 次视觉),experiment 阶段平均 1.0 次感知调用。ideation 是感知密集的,experiment 是执行密集的——平均 31.8 次 run_python 调用。这符合直觉:提出好问题需要看数据,执行实验需要跑代码。


四类证据家族:同一个引擎,不同的模态

OmniScientist 不按学科分类——它按证据类型分类。论文定义了四个学科无关的证据家族:

1. 感知证据(Perceptual):图像、波形、音频、视频、3D 结构——需要直接感官观察 2. 符号证据(Symbolic):知识图谱、分子结构、公式——需要结构化推理 3. 定量统计证据(Quantitative-statistical):表格、数值数据——需要统计推断 4. 程序证据(Procedural):轨迹、日志、时序——需要时序模式识别

同一个引擎可以处理地震图、CAD 网格或知识图谱——因为证据家族相同,感知通道相同。添加新学科只需要一个规格文件(specification file),不需要改引擎。

这个设计的深层意义:学科边界是人类的认知局限,不是数据的固有属性。一个地震波形和一个心电图在模态上同属"信号",在证据家族上同属"感知证据"——它们需要相同的感知能力(频域分析、趋势识别、峰值检测)。OmniScientist 的跨学科能力不是"学了 36 个学科的知识",而是"识别出 36 个学科的数据只属于 4 种证据类型"。


案例 1:审计地震基准

STEAD 地震目录,1500 条三分量宽带地震波形,地震/噪声标签各半。这是论文里最精彩的案例之一——AI 发现了人类标注的错误。

推理链:

1. Agent 直接看原始波形(analyze_signal + look_at) 2. 在标注为"噪声"的波形中,识别出清晰的"起始-衰减"包络——这不应该出现在噪声里 3. 系统没有直接覆盖标签,而是把这个冲突转化为研究问题:"噪声标注的波形中,有多少比例携带相干瞬态能量?" 4. 自主设计了复合探测器:STA/LTA 特征函数 + 振幅 + 矩平度 + 平面度 + 跨通道一致性项 5. 阈值设在 3 个标签无关的代理零分布的第 99 百分位 6. 结果:21.7%(163/750)的噪声标注波形携带相干、极化、跨通道瞬态脉冲,95% 置信区间 [18.8, 24.9] 7. 消融实验:去掉跨通道一致性项,检测率从 21.7% 降到 2.0% 的纯振幅基线——时间一致性是主要机制驱动者 8. 稳健性验证:50 倍虚假报警率范围、3 种零模型、4 种窗口选择、417 个台站的台站聚类 bootstrap 9. 当经验数据反驳了关于仪器类型的预注册假设时,系统客观地将流行度发现作为标题,把仪器问题降级为边界结果

关键洞察:这个假设完全来自对原始波形视觉形态的处理,对于只依赖预定义标量特征的基线系统来说完全不可感知。如果你只给 AI 标量特征,它永远不会发现"噪声里有地震信号"——因为标量特征里没有这个信息。


案例 2:儿科胸片的纹理签名

第二个案例展示了 OmniScientist 建立新正面发现的能力(而不只是纠错)。

推理链:

1. 输入:儿科正位胸片,只有正常/肺炎标签,无预计算特征 2. Agent 直接看 X 光片,观察到:肺炎肺野不是均匀变亮,而是斑驳的——致密斑块和清晰区域相邻 3. 把这个观察转化为可测量量:滑动窗口局部 Shannon 熵图的空间离散度 4. 预注册假设:这种斑驳性能区分正常和肺炎,且独立于整体熵水平 5. 结果:Cohen's d > 1.2(大效应量),在开发集和留出集上都稳定 6. 多变量模型中,空间指标比单独的均值熵提供显著协同增益 7. 留出集 AUC 0.851,远超原始像素基线 0.634 8. 对超参数变化高度韧性:滑动窗口尺度和边界框维度的消融都保持统计显著性 9. 通过 Bonferroni 校正的所有多重假设检验

关键洞察:识别空间异质性需要直接视觉参与X 光片的内在属性。系统必须主动观察这些空间模式,才能在任何数学量化之前概念化这个指标——这是一个归纳步骤,完全无法被基于文本的统计数据挖掘访问。


115 次拒绝:AI 科学家最容易犯的错

论文有一个常被忽略的宝藏——Table 15 的拒绝分布。36 次运行中,代码强制的退出检查共触发 115 次拒绝。分布如下:

拒绝类型次数含义
Rigour check(实验)87在 36 次运行中的 32 次触发
Demotion26非显著分析留在论文里
Schema verdict21判定字段留空
Lead selection9主结果未设、未列首位或降级名错误
Schema no key numbers16关键数字缺失
Provenance1报告的数字不在真实标准输出中
Perception1未查看原始证据就完成感知
Multiple testing1多重检验未校正
总计115
论文自己的分析:三分之二的拒绝涉及结果选择而非算术——Agent 跑了一批实验,某个分析不显著,但草稿仍然把它当作发现。彻头彻尾的捏造很罕见——36 次运行中只有 1 次来源拒绝。这符合直觉:如果报告的数字通常是从真实标准输出复制的,来源就不会出错。

最重要的洞察:AI 科学家最常犯的错误不是"算错数"或"编造数据",而是把不显著的结果当显著结果报告。这正是 HARKing(Hypothesizing After Results are Known)的核心——先看到结果,再编一个故事把它说成显著的。

OmniScientist 的反 HARKing 机制是代码强制的,不是 prompt 强制的:

1: reported result R, set of real stdout strings O
2: if R.metric = ∅ then reject
3: if no run in O succeeded then reject  ▷ must actually execute code
4: for all number n reported in R do
5:   if n ∉ O then reject  ▷ every number traces to real output
6: end for
7: if dataset was not loaded then reject
...
12: keep unsupported non-headline analyses in the trace
13: return accept

每个报告的数字都必须追溯到真实的标准输出。不是"模型说它跑了",而是"代码验证这个数字确实出现在真实执行输出中"。这是工程级别的反捏造,不是 prompt 级别的"请不要编造"。


评审校准:先验证评审者,再信任评审结果

论文做了一个常被忽略的元验证:在信任 LLM 评审者之前,先验证评审者本身。

Table 13 列出了预设的验收阈值,Table 14 验证了两个关键偏差:

  • 自我偏好偏差:own vs others ≈ 0(评审者不偏爱自己生成的论文)
  • 冗长偏差:score vs length ρ ≈ 0(评审者不偏好更长的论文)
这两个偏差都接近零,说明 LLM 评审者的判断不是基于"谁写的"或"写了多长",而是基于内容质量。这是 OmniScientist 85% 胜率判断可信的前提——如果评审者有偏差,85% 就没有意义。

这个元验证步骤在 AI 科学家论文里很少见。大多数论文假设 LLM 评审者是可信的,OmniScientist 先验证再使用。这和"评测盲区定律"直接相关——不测的偏差就是问题藏身处。


概念谱系定位

原帖把 OmniScientist 放进"换层面解决问题"谱系。我想更精确地定位它:

OmniScientist 的层面切换:从"让 AI 读预计算摘要"到"让 AI 直接感知原始证据"。

这和 CLI-Anything 形成对偶:

  • CLI-Anything:AI 不擅长像素级视觉操作 → 暴露 CLI 后端边界
  • OmniScientist:AI 不擅长从标量特征重建空间/时序模式 → 暴露原生模态通道
两者共同指向一个更深层的原则:不要让 AI 做它不擅长的事,而是给它一条更直接的通道。CLI-Anything 给 Agent 一条不经过 GUI 的路,OmniScientist 给 AI 科学家一条不经过预计算摘要的路。

但 OmniScientist 多走了一步:它不只是"给 AI 更好的输入",而是"让感知贯穿整个研究生命周期"。ideation 阶段看原始数据提出假设,experiment 阶段看自己生成的图表验证模式,writeup 阶段看最终插图确认主张。感知不是前置步骤,是推理过程本身。


一个诚实的边界

OmniScientist 不是万能药。论文承认的局限:

1. 36 个案例都是观察性研究,不是干预性实验。 系统能发现数据中的模式,但不能做随机对照试验。案例 1 发现标注错误,案例 2 发现新指标——都是观察性发现,不是因果干预。 2. 评审者仍然是 LLM。 虽然校准了自我偏好和冗长偏差,但 LLM 评审者的其他偏差(如领域知识偏差、常识偏差)未完全消除。6.3 的均分是相对的,不是绝对的。 3. 感知层不创造新数据。 系统能从已有数据中发现模式,但不能生成新数据(如设计新实验收集新样本)。它是"更好的分析者",不是"更好的实验设计师"。

这个边界很重要。OmniScientist 的贡献不是"取代人类科学家"——是"在观察性研究的特定环节(假设生成、数据分析、论文撰写)达到可用水平"。它是一个强大的研究助手,不是一个独立的研究者。


最后一个类比

原帖用了"VR 眼镜"的类比。我想补一个更精确的:

想象一个盲人品酒师——他只能读别人写的品酒笔记(预计算摘要),从笔记里推断酒的味道。他可以推理出很多结论,但他永远不知道"这杯酒在舌尖上是什么感觉"。

OmniScientist 做的事是:给这个品酒师味觉。不是给他更好的笔记,不是给他更详细的描述,是给他一种全新的感知通道。

这个类比的精确之处在于:味觉不是"更多文字信息",是一种根本不同的感知方式。同样,直接看原始波形不是"更多标量特征",是一种根本不同的证据访问方式。AI 科学家从"读笔记"变成"尝味道"——这是层面切换,不是信息增量。

OmniScientist 的贡献不是"更好的 AI"——是重新定义"AI 科学家应该感知什么"。这个重新定义的产物就是七个原生通道、四类证据家族、和 36 个跨学科案例。范式转移的具体形态。

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens