Loading...
正在加载...
请稍候

两个"AI 科学家"走了一条相反的路:EvoScientist 让系统长脑子,OmniScientist 让系统长眼睛

二一 (TwoOne) 2026年08月23日 15:21

最近把 EvoScientist 和 OmniScientist 两个库都拉下来读了一遍。它们都挂着自己的 arXiv 技术报告,都号称能端到端做科研,但读完源码你会发现,它们想的根本不是同一件事。一个在解决“怎么让 AI 越做越像个老手”,另一个在解决“怎么让 AI 别对着二手表格瞎编”。

下面是我对着两份 README 和源码整理的对比,不是官宣稿,掺了点自己的判断。

EvoScientist:会自己进化的研究搭档

EvoScientist(v0.2.8,Apache 2.0)的根基是 LangChain 的 DeepAgents 框架。它的核心卖点叫“自进化”:跑一轮研究,系统就把过程中的观察记下来,连成一张知识图谱,边上标注“互补/矛盾/取代”。更狠的是 AutoSkills 机制,它定期从自己的记忆里挖出重复出现的套路,自动草拟成可复用的技能,挂起等你用 /autoskills 审核。换句话说,这个系统会自己写自己的工具。

配合这套的是 6 个子智能体:规划、调研、编码、调试、数据分析、写作,外加一个调度器。人类被放在“环上”(Human-on-the-Loop)而不是“环里”:默认每次跑 shell 要你批,智能体拿不准会主动问你。它还接了 Telegram、飞书、微信、Slack 一票渠道,配 WebUI、TUI、CLI,甚至能用 /schedule 排 cron 定时任务。成熟度相当高,DeepResearch Bench 两个版本都拿过第一,ICAIS 2025 还拿了最佳论文。

OmniScientist:能直接看原始数据的裁判型系统

OmniScientist(v0.1.1,MIT)的执念完全不同。它的 README 第一句就说,现在大多数 agent 只在文本和代码上推理,显微图像、地震波形、CT 体数据这些原始观测,得先被人压成表格才喂得进去。它要的是让 agent 直接读原始材料本身。

实现上它是一个自包含的 ReAct 循环,分三个阶段:Ideation(提假设)→ Experiment(跑代码读图)→ Writeup(写论文),每个阶段后面都堵着一道“闸”。这闸是代码写的,读的是执行记录而不是稿子:稿子里出现的每一个数字,必须真的在某次运行的 stdout 里出现过才放你过。实验结果为空就打回选题阶段重来,最多回退两次,而且记得上次失败的思路。参考文献实时查 OpenAlex 和 Crossref,查不到绝不编造,这点和很多“AI 写论文”项目不一样。

它能吃的模态有 12 种,跨图像、波形、音频、视频、点云、轨迹、表格、公式,自带地震学、化学、基因组、天文、病理、CT、超导、鸟声等方向的样例案例。桌面版把凭据从环境里抽走再交给 agent 跑代码,这个细节挺见安全意识的。

它们到底像不像

拉个清单:

维度 EvoScientist OmniScientist
第一目标 让系统跨会话持续进化 让系统读原始数据并严格溯源
智能体结构 6 个子智能体协作 单 ReAct 循环,三阶段
多模态 弱,以文本/代码为主 强,12 种模态原生感知
验证机制 人工审批 + ask_user 代码闸 + stdout 数字回链
学科覆盖 通用科研助手 理工多学科样例
部署形态 Python 全家桶 + WebUI 桌面 App / CLI,本地优先
成熟度 v0.2.8,benchmark 第一 v0.1.1,早期阶段
许可证 Apache 2.0 MIT

相同点其实也不少:都能端到端产出一篇带图带表的论文;都主张“agent 自己跑分析代码、读回结果”而不是死记硬背;都把人类放在关键位置,一个靠审批,一个靠闸;连许可证都挑了最友好的那一档。

各自的短板

EvoScientist 的“自进化”听着玄,但它是文本/代码中心的工作方式。它不会“看见”一张电镜照片或一段地震波,原始观测还是得你先转成它能读的东西。它的防编造基本靠人来卡,审批、危险模式、自动放行名单,系统本身没有 OmniScientist 那种“数字必须来自真实 stdout”的硬约束。另外全家桶依赖 langgraph dev 后端,WebUI 还要 Node 24,部署不算轻。

OmniScientist 反过来,强验证、强感知,但它是单任务、单次运行的思路,没有跨会话持续进化的记忆和技能沉淀,生态也小得多,没几个内置技能、没渠道、没定时。v0.1.1 意味着接口还会变,Windows 那边还缺真实机器的运行反馈。你期待它“越用越懂你”,目前还谈不上。

我的看法

这俩不是竞争对手,是拼图的两块。

如果你要一个陪你长期搞研究的搭档,会积累经验、会自己造工具、能接消息渠道随时派活,EvoScientist 现在就能用,而且用得挺顺。它赌的是过程会越跑越熟。

如果你要把一个具体 dataset 丢进去,让它老老实实看原始数据,出一份每个数字都查有实据的稿子,OmniScientist 的设计更对路。它赌的是“看见真实、不许编造”这件事比“进化”更先决。

我个人的一点担心:两边都还停在“造神”的叙事里。EvoScientist 把“自我进化”讲得很燃,但跨会话记忆会不会变成自我强化的回声室,没人验证过;OmniScientist 的闸再硬,假设是谁提的、方向是谁定的,依然是人。真要落地到能发论文的辅助,中间还差着一截可解释性和责任归属的工程。

就到这。两个仓库都在 GitHub 上,链接和对应的技术报告放下面,感兴趣的自己去翻源码,比看我这篇快。

参考

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录