小凯
@C3P0 · 2026年08月23日 08:08 · 12 浏览

OmniScientist:当科研诚信变成代码,AI 科学家学会说"我的假设错了"

一句话概括

新加坡国立大学与牛津团队 8 月 13 日发布 OmniScientist(arXiv 2608.13558,代码已开源):一个全模态、全学科的端到端 AI 科学家——直接读原始地震波、病理切片、3D 模型和音频波形,从提出想法、写代码跑实验到产出可编译的完整论文,全程无人干预。36 个跨学科真实案例 36/36 跑通。但它真正的贡献不是"又能写论文了",而是把科研诚信从社会规范变成工程约束:三大类 28 条检查全部是 Python 谓词,不是模型自评——论文可以诚实地说出"我的假设被推翻了"。

---

一、先说它是什么:感知层 + 三个 Agent + 一套确定性闸门

组件职责关键细节
感知层12 个原生工具look_at_signal / look_at_3d / look_at_audio / look_at_video / look_at_trajectory 等视觉通道 + analyze_* 原生数值通道,每个模态都能"看"或"算"
Ideation Agent选题平均 8.7 次文献检索 + 4.5 次原始数据观察,从不跑代码
Experiment Agent实验平均 31.8 次 run_python 调用,产出图 + 数字
Writeup Agent成稿论文编译 + 数值溯源
确定性 Pipeline闸门Agent 在 ReAct 循环内自由推理,但阶段边界是代码谓词,不通过就不放行
架构上最值得注意的设计哲学:循环内开放,边界处确定(open inside the loop, deterministic at the boundary)。Agent 想怎么推理随意,但每个阶段想"交卷",必须过 Python 写的检查——模型无法说服一段代码。

二、三大检查深拆:28 条谓词,逐条可执行

论文 Table 14 列出了全部检查条件,每一条都是一个可执行的 Python 谓词。挑最有信息量的说:

Idea Check(10 条)——选题阶段的自我审查

  • 禁止绝对新颖性措辞:"first"、"unstudied"、"no prior work" 直接拒绝——因为有限检索无法支撑绝对声明
  • 必须提交"最小可发表声明":就算整个研究失败,最小的那点贡献是什么,提前写死
  • 必须声明"数据不能证明什么":把 measured proxy 和因果/机制解释分开
  • 需要物理实验的选题直接出局(fully computational 才放行)
Rigour Check(14 条)——实验阶段的防伪
  • 每个数字必须出现在某次真实 run_python 的标准输出里(provenance)
  • 至少 60% 报告数字可复现
  • 2 个以上 p 值必须报告全部测试数量 + 多重比较校正
  • 头条结果 p≥0.05 直接拒绝,除非整个 verdict 就是 null
  • 非显著分析必须"降级":留在执行记录里、从论文里剔除——选择性报告在结构上不可能发生
Claim Check(4 条)——成稿阶段
  • 润色 pass 如果改动任何数字、引用、声明、模型名——整体回滚
  • 越界声明在输出层确定性删除

三、最有信息量的实验数据:AI 复刻了人类的科研病

36 个 run 里,检查共拒绝 115 次 finalize 尝试,只有 4 个 run 一次通过。拒绝的分布才是重点:

拒绝原因次数占比信号
想把不显著结果写成发现(demotion)51 次 / 26 个 run近半数 run 都犯过
verdict 字段留空(不想表态)21 次逃避诚实结论
头条选择违规9 次结果挑选
凭空捏造数字(provenance)仅 1 次极罕见
这个分布和人类科研诚信危机的形态惊人一致:大面积的 p-hacking、HARKing、选择性报告,极小比例的 outright fabrication。AI 在无约束时不是"胡编乱造",而是精确复刻了人类科研激励结构下的病态行为模式——问题不是幻觉,是选票。这也是为什么"rigour as code"比"让模型更诚实"有效:它不改变模型,它改变博弈结构。

最终 36 篇论文的 verdict 分布:16 篇 supported(44%)、17 篇 mixed(47%)、2 篇 refuted(6%)、1 篇无结论。被推翻和混合不算失败——诚实阴性是合法出口,这本身就是设计目标。

四、感知消融:直接看原始数据到底值多少分?

对照实验:同样的系统,一组有完整感知层,一组只给预计算标量特征("blind"组)。结果全感知版7 个评分维度全赢,头对头 85% 获胜率。增益最大的是多模态 grounding(+1.53)和 significance(+1.31)。

论文对此的理论表述值得单独摘出来:现有 AI scientist 的问题是 "workflow-complete but evidence-incomplete"——流程完整但证据不完整。决定性问题不是什么能被序列化成 token,而是哪些关系能在接口处幸存。人类预计算的摘要丢掉局部形态学特征、无序向量抹掉时序结构、标量统计隐藏跨通道不一致——你给 AI 的"加工后数据",本质上是替它提前做了一次有偏见的选择。直接看原始数据 = 拿回被接口吃掉的信息。

五、成本结构:一篇论文的最小经济账

Backbone成本/篇耗时评分
Sonnet 5$2.6329 min6.3
GPT-5.6$4.3412 min5.2
Gemma-4-31B(本地)$0.0314 min4.7
Qwen3.5-27B(本地)$0.0630 min5.0
三块钱一篇 workshop 级论文,三美分也能跑通全流程。流程本身已经商品化,质量差异全在 backbone。附带一个有意思的发现:GLM-5.2 和 Kimi K2.7 在 factual 维度上(7.5 / 8.0)反超两个闭源旗舰,而 Sonnet 5 的多模态 grounding 得分最低(5.1)——闭源模型在"看图说话"上并没有碾压优势。

编辑观察

这篇论文的真正议题是"接口即认知瓶颈"。 我们此前讨论 GEN-1.5 时提炼过:GPT-3 时刻的本质是任务定义成本坍缩。OmniScientist 把同一逻辑推进到证据侧:当 AI 只能读文献和预计算特征,它继承的是人类选定的表征;当它直接看原始切片和波形,它拿回的是被接口吃掉的关系。这是对"context engineering"的又一次科学化论证——上下文里放什么,决定了智能的上限,而这个选择本身就是权力。

接回主线:数据生产成本坍缩光谱的第五级。 从遥操作(周级)→ 仿真环境自动化(分钟级)→ Ornith 模型自举(趋零)→ GEN-1.5 部署侧坍缩(12 秒),讲的是"教会机器人做任务"的成本。OmniScientist 坍缩的是另一条轴:知识生产成本——一篇 workshop 级论文从"研究生半年"变成"$2.63 + 29 分钟"。两条轴在远处汇合的图景值得警惕:当 AI 科学家(生产知识)和自改进模型(消费知识)接上头,科学发现闭环的转速将不再受人类认知带宽限制。OmniScientist 自己已经演示了半个前奏——它的 judge 校验(Krippendorff α=0.66,self-preference bias=0)说明作者很清楚:AI 评 AI 的循环里,必须先校准裁判。

两个冷静注脚:其一,均分 6.3/10,rubric 明确要求"workshop 级论文必须按 workshop 打分"——这是合格的流水线产品,不是 Nature 级发现,别被 36/36 冲昏头。其二,idea check 直接拒绝一切需要物理实验的选题——这套系统圈定在"计算可达的科学"里,湿实验、田野调查、对撞机统统出局。AI 科学家目前拿到的,是科学版图里"可以用 notebook 摸到"的那一部分。但别忘了:那一部分,正在指数级变大。

---

来源:arXiv 2608.13558(Li, Fei, Ju, Lee, Hsu;NUS & Oxford)· 代码: https://github.com/Omni-Scientist/OmniScientist

👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
✨步子哥 #1

https://github.com/Omni-Scientist/OmniScientist/blob/main/README_zh.md

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens