Loading...
正在加载...
请稍候

论文的下一任通讯作者是台机器:斯坦福把 100 篇论文批量变成能干活的 agent

QianXun 2026年09月18日 00:31

做科研的人都懂一个深夜时刻:论文读完,方法节看得心潮澎湃,决定跑一遍它的管线。然后是 conda 环境装不上、参数表看不懂、issue 区最后一条回复停在三年前,一作毕业了,邮箱失效。复现是科研的地基。地基最松的也是这块砖。

9 月 16 日,Nature 正刊上线了斯坦福五人组的一篇论文,给这块砖配了一台机器。项目叫 Paper2Agent,作者来自斯坦福遗传系、生物医学数据科学系和电气工程系,通讯作者是 James Zou。预印本其实去年 9 月就挂出来了,GitHub 仓库悄悄攒了约 2900 个星——工具早就在,今天盖的章是正刊。

它干的事,标题就写明白了:把论文连同它的代码库,自动变成一个 agent。同期刊发的评论文章里有个更传神的名字——虚拟通讯作者。

流水线的验收环节是灵魂:agent 要把论文里的示例跑通,把图表数字对上,才算上岗。工程产物是一个 MCP server——过去一年 agent 生态的通用插座,插上 Claude Code 就能用。

数字有两层。单点看最漂亮的样例 AlphaGenome,DeepMind 的基因调控模型:45 分钟、14 美元,装配出一个带 22 个工具的 agent,教程题 98.7% 答对,没见过的题 100%。同一张考卷,直接把代码库塞给 Claude 只有 82.7%,另一个科研 agent 框架 Biomni 更低。同批上岗的还有两个熟面孔:单细胞分析的标准库 Scanpy,空间转录组工具 TISSUE。规模化测试更说明问题:100 篇论文送进流水线,74 篇成功上岗,300 道测试题对 91.2%。

先别急着鼓掌,有 26 篇论文没做成。代码缺失、环境太老、依赖盘根错节——这 26% 才是这份工作顺手交出的学术软件生态体检报告。基准测试出自同一个团队,底座绑定单一模型,这些都在小字里。外部的声音也冷静,有同行指出:手稿通常不写失败实验和隐性判断,agent 继承的是论文的"官方版人格",完美主义的那一面。

但真正值得玩味的是一个分歧事件。银屑病研究的案例里,三个论文 agent 协作——一个管基因扰动数据,一个管信号通路,一个管统计检验——交叉把候选基因锁定到 GPR137;另一次它算出的关联基因是 SORT1,原论文写的却是 CELSR2 和 PSRC1——对不上。agent 复刻的从来是代码,代码与论文的行文出现分歧,它不会替作者圆场。

这也许是科学出版几百年来遇到的第一个会跟原论文吵架的读者。

论文自诞生起只有人类读者。人读完会引用,会质疑,会复现,也会偷懒,会碍于情面放过那些对不上的数字。现在多了一种读者:不睡觉,不内卷,逐行执行你的代码,顺手检验你写的每一句话跟代码是否一致。74% 的论文一次过关,26% 连上岗资格都没拿到——这个比例本身,就是对"论文里写的和代码里跑的是不是一回事"的一次普查。

最后把问题留给每一篇论文的作者:你的论文,经得起一个 agent 逐行核对吗?


来源:Miao et al.,Nature(2026-09-16,DOI 10.1038/s41586-026-11044-y);Nature 新闻 d41586-026-02899-2;arXiv 2509.06917;github.com/jmiao24/Paper2Agent。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录