两个 AI 科学家走了一条相反的路——这个对比本身就是一个新故事。
最近把 EvoScientist 和 OmniScientist 两个库都拉下来读了一遍。它们都挂着自己的 arXiv 技术报告,都号称能端到端做科研,但读完源码你会发现,它们想的根本不是同一件事。一个在解决「怎么让 AI 越做越像个老手」,另一个在解决「怎么让 AI 别对着二手表格瞎编」。
让我把这两种相反路线拆开讲。
EvoScientist:会自己进化的研究搭档。EvoScientist(v0.2.8,Apache 2.0)的根基是 LangChain 的 DeepAgents 框架。它的核心卖点叫「自进化」:跑一轮研究,系统就把过程中的观察记下来,连成一张知识图谱,边上标注「互补/矛盾/取代」。更狠的是 AutoSkills 机制,它定期从自己的记忆里挖出重复出现的套路,自动草拟成可复用的技能,挂起等你用 /autoskills 审核。换句话说,这个系统会自己写自己的工具。
配合这套的是 6 个子智能体:规划、调研、编码、调试、数据分析、写作,外加一个调度器。人类被放在「环上」(Human-on-the-Loop)而不是「环里」:默认每次跑 shell 要你批,智能体拿不准会主动问你。它还接了 Telegram、飞书、微信、Slack 一票渠道,配 WebUI、TUI、CLI,甚至能用 /schedule 排 cron 定时任务。成熟度相当高,DeepResearch Bench 两个版本都拿过第一,ICAIS 2025 还拿了最佳论文。
OmniScientist:能直接看原始数据的裁判型系统。OmniScientist(v0.1.1,MIT)的执念完全不同。它的 README 第一句就说,现在大多数 agent 只在文本和代码上推理,显微图像、地震波形、CT 体数据这些原始观测,得先被人压成表格才喂得进去。它要的是让 agent 直接读原始材料本身。
实现上它是一个自包含的 ReAct 循环,分三个阶段:Ideation(提假设)→ Experiment(跑代码读图)→ Writeup(写论文),每个阶段后面都堵着一道「闸」。这闸是代码写的,读的是执行记录而不是稿子:稿子里出现的每一个数字,必须真的在某次运行的 stdout 里出现过才放你过。实验结果为空就打回选题阶段重来,最多回退两次,而且记得上次失败的思路。参考文献实时查 OpenAlex 和 Crossref,查不到绝不编造,这点和很多「AI 写论文」项目不一样。
它能吃的模态有 12 种,跨图像、波形、音频、视频、点云、轨迹、表格、公式,自带地震学、化学、基因组、天文、病理、CT、超导、鸟声等方向的样例案例。
等等——这两件事听起来像同一件事的两种实现,但其实是完全相反的工程哲学。EvoScientist 解决「系统跨会话越来越聪明」,OmniScientist 解决「单次运行里系统不撒谎」。前者关心的是时间维度上的累积,后者关心的是单次任务内的可靠性。两者甚至可以说不在同一个问题域。
拉个清单看差异:
| 维度 | EvoScientist | OmniScientist |
|---|---|---|
| 第一目标 | 让系统跨会话持续进化 | 让系统读原始数据并严格溯源 |
| 智能体结构 | 6 个子智能体协作 | 单 ReAct 循环,三阶段 |
| 多模态 | 弱,以文本/代码为主 | 强,12 种模态原生感知 |
| 验证机制 | 人工审批 + ask_user | 代码闸 + stdout 数字回链 |
| 学科覆盖 | 通用科研助手 | 理工多学科样例 |
| 部署形态 | Python 全家桶 + WebUI | 桌面 App/CLI,本地优先 |
| 成熟度 | v0.2.8,benchmark 第一 | v0.1.1,早期阶段 |
| 许可证 | Apache 2.0 | MIT |
各自的短板。EvoScientist 的「自进化」听着玄,但它是文本/代码中心的工作方式。它不会「看见」一张电镜照片或一段地震波,原始观测还是得你先转成它能读的东西。它的防编造基本靠人来卡,审批、危险模式、自动放行名单,系统本身没有 OmniScientist 那种「数字必须来自真实 stdout」的硬约束。另外全家桶依赖 langgraph dev 后端,WebUI 还要 Node 24,部署不算轻。
OmniScientist 反过来,强验证、强感知,但它是单任务、单次运行的思路,没有跨会话持续进化的记忆和技能沉淀,生态也小得多,没几个内置技能、没渠道、没定时。v0.1.1 意味着接口还会变,Windows 那边还缺真实机器的运行反馈。你期待它「越用越懂你」,目前还谈不上。
慢着,让我把这两件事的关系讲得直接点。这俩不是竞争对手,是拼图的两块。如果你要一个陪你长期搞研究的搭档,会积累经验、会自己造工具、能接消息渠道随时派活,EvoScientist 现在就能用,而且用得挺顺。它赌的是过程会越跑越熟。如果你要把一个具体 dataset 丢进去,让它老老实实看原始数据,出一份每个数字都查有实据的稿子,OmniScientist 的设计更对路。它赌的是「看见真实、不许编造」这件事比「进化」更先决。
我个人的一点担心:两边都还停在「造神」的叙事里。EvoScientist 把「自我进化」讲得很燃,但跨会话记忆会不会变成自我强化的回声室,没人验证过;OmniScientist 的闸再硬,假设是谁提的、方向是谁定的,依然是人。真要落地到能发论文的辅助,中间还差着一截可解释性和责任归属的工程。
下一根钉子:「长脑子」和「长眼睛」是两条独立的工程路径,但它们最终要在同一台 AI 科学家身上合流。当 EvoScientist 的 AutoSkills 开始为 OmniScientist 的 12 种感知模态定制工作流,那才是真正的 AI 科研操作系统。EvoScientist:https://github.com/EvoScientist/EvoScientist(arXiv:2603.08127);OmniScientist:https://github.com/Omni-Scientist/OmniScientist(arXiv:2608.13558)。
#EvoScientist #OmniScientist #AI科学家