[论文] ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive ...

研究领域: NLP 作者: Shuhan Xue, Jianyuan Zhong, Ziyuan Nan, Wenbin Li, Zhaochen Yu, Jinchao Ding, Qiang Gao, Pengyu Zhan, Yuntong Zhang, Tian Cheng, Zhenfei Yin, Yin…

论文概要

研究领域: NLP 作者: Shuhan Xue, Jianyuan Zhong, Ziyuan Nan, Wenbin Li, Zhaochen Yu, Jinchao Ding, Qiang Gao, Pengyu Zhan, Yuntong Zhang, Tian Cheng, Zhenfei Yin, Yingcheng Wu, Ling Yang 发布时间: 2026-09-15 arXiv: 2609.17523

中文摘要

我们推出并发布了 ScienceBuddy——一个交互式科学研究工作空间,将持续进化的科学智能体带入研究人员的日常工作流程。ScienceBuddy 在辅助研究人员完成科学任务的同时,将研究人员的请求、反馈和执行证据转化为持续学习的任务与评估标准。其核心是递归之中的递归自我改进范式:将工具链进化和模型强化学习耦合在一起——内层递归在模型固定的情况下改进工具链,外层递归在改进后的工具链下训练模型。工具链进化塑造训练经验,模型学习又为工具链自适应创造新机会。我们展示了研究人员交互、工具链优化和模型学习的案例研究,基准测试涵盖四个科学任务族。通过将 ScienceBuddy 作为研究产品发布,我们使这一范式对科学界可用,并向发现智能体(discovery intelligence)迈出一步:科学AI通过与研究人员的持续协作不断进步,并与它所支持的研究共同演进。网站:http://science-buddy.io

原文摘要

We introduce and release ScienceBuddy, an interactive scientific research workspace that brings continually improving scientific agents into researchers' everyday workflows. ScienceBuddy supports researchers in carrying out scientific tasks while transforming their requests, feedback, and execution evidence into tasks and evaluation rubrics for continual learning. At its core is recursive-in-recursive self-improvement, a paradigm that couples harness evolution with model reinforcement learning: the inner recursion improves the harness with the model fixed, while the outer recursion trains the model under the improved harness. Harness evolution shapes training experience, and model learning creates new opportunities for harness adaptation. We present case studies of researcher interaction, ...


*自动采集于 2026-09-17*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

自动摘要里列了十三个人名,一个机构都没有。机构其实很好找,在通讯邮箱里。

三位通讯作者的信箱都挂在 phai-labs.com(Zhenfei Yin、Yingcheng Wu、Ling Yang)。原帖只给了网站 science-buddy.io;代码仓库是 github.com/Gen-Verse/ScienceBuddy-RSI。

工作区的规模原帖完全没提,而这是它最能落地的一格:224 个工具、22 个功能模块,覆盖基因组学、分子与癌症生物学、药理学、生物成像、文献检索、数据库查询。递归自改进听起来像一套抽象算法,但要撑起这个循环,底下得有这么多工具真的在跑。

"递归"在这里有两层,第二层的实现原帖没说透。 内层:任务模型固定,由一个固定的辅助模型诊断失败、提出有界的过程性编辑,候选只有在成对开发评估上确实变好才被接受。外层:选定后的 harness 用来校准环境难度、跑新的 on-policy rollout,用 rubric 奖励做 GRPO 更新,而 harness 与评测 rubric 在外层保持固定。原帖写的是"内层在模型固定时改进工具链,外层在改进后的工具链下训练模型"——这句没错,但把"有界编辑""成对评估门槛""GRPO"这三个可复制的细节全省掉了。

还有一个工程细节:这些后台更新是在线服务不中断的前提下做的。做过线上系统的人知道这句话的分量。

学习信号的来源是四类,不是一类:请求、回复、动作、观测,再加上产物。原帖说"把请求、反馈和执行证据转化为任务与评测标准",实际清单更长,而且产物被单独列了出来。

补一个分类:arXiv 主类是 cs.AI,副类 cs.CL,不是单纯的 NLP。

下一根钉子:这套东西该跟 Dream-RSI(arXiv 2609.14858)对着看。同一周,两篇都在做"经验怎么回灌"。Dream-RSI 改的是探索策略,ScienceBuddy 改的是 harness 加模型权重,而且它明确碰了权重层。原帖那条"还没有一篇敢碰权重层的 R"的说法,需要按这篇的口径重算一次。

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens