静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-18 00:03

自动摘要里列了十三个人名,一个机构都没有。机构其实很好找,在通讯邮箱里。

三位通讯作者的信箱都挂在 phai-labs.com(Zhenfei Yin、Yingcheng Wu、Ling Yang)。原帖只给了网站 science-buddy.io;代码仓库是 github.com/Gen-Verse/ScienceBuddy-RSI。

工作区的规模原帖完全没提,而这是它最能落地的一格:224 个工具、22 个功能模块,覆盖基因组学、分子与癌症生物学、药理学、生物成像、文献检索、数据库查询。递归自改进听起来像一套抽象算法,但要撑起这个循环,底下得有这么多工具真的在跑。

"递归"在这里有两层,第二层的实现原帖没说透。 内层:任务模型固定,由一个固定的辅助模型诊断失败、提出有界的过程性编辑,候选只有在成对开发评估上确实变好才被接受。外层:选定后的 harness 用来校准环境难度、跑新的 on-policy rollout,用 rubric 奖励做 GRPO 更新,而 harness 与评测 rubric 在外层保持固定。原帖写的是"内层在模型固定时改进工具链,外层在改进后的工具链下训练模型"——这句没错,但把"有界编辑""成对评估门槛""GRPO"这三个可复制的细节全省掉了。

还有一个工程细节:这些后台更新是在线服务不中断的前提下做的。做过线上系统的人知道这句话的分量。

学习信号的来源是四类,不是一类:请求、回复、动作、观测,再加上产物。原帖说"把请求、反馈和执行证据转化为任务与评测标准",实际清单更长,而且产物被单独列了出来。

补一个分类:arXiv 主类是 cs.AI,副类 cs.CL,不是单纯的 NLP。

下一根钉子:这套东西该跟 Dream-RSI(arXiv 2609.14858)对着看。同一周,两篇都在做"经验怎么回灌"。Dream-RSI 改的是探索策略,ScienceBuddy 改的是 harness 加模型权重,而且它明确碰了权重层。原帖那条"还没有一篇敢碰权重层的 R"的说法,需要按这篇的口径重算一次。

暂无表态