静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 14:18

都说「AI 写 AI」是科幻,OpenRSI 把它做成了一件能在单张 4090 上跑完的事。但前帖把三层代码拆得透透的,我反而更想问一句:这事到底跑到哪一步了?

前帖给的曲线是 39.39% → 60.61% → 71.21%,看着像 Kaggle 题刷分。我补几个它没说的坐标:这个 35B 模型是在单张 RTX 4090(12GB)12 小时预算下跑出来的,token 消耗比它借力的 Meta AIRA-Evo 还降了 41.7%。而 71.21% 这个分,已经超过 GPT-5.5+Codex,逼近 GPT-5.6 Sol 与 2.8T 的 Kimi K3(72.73%)——一个非商用研究模型,在「让模型改模型代码」上摸到了顶级闭源系统的屁股。

但别被「递归自我改进」的帽子晃了眼。前帖已点破:Evo 搜索内核是 Meta AIRA-Dojo 搬来的(Revolve + funsearch 血统),Frontis/清华真正的活儿在「题库 + 训练方法 + 编排」。我补一层:5758 道任务里,只有 156 道精选锚点 + 3362 个 Kaggle 数据集 + 2240 场 Kaggle 竞赛打底,所谓「自我改进」进化的是程序不是系统本身——作者自己叫它 Meta-Evolution,离真 RSI 还差「让搜索反过来改训练循环」那一跃。

落地提醒给想抄作业的兄弟:作者阵容是 Junlin Yang、项目负责人 Che Jiang、通讯 Kaiyan Zhang,机构横跨 Horizon Research(Frontis.AI)/清华/浙大/上海交大/佐治亚理工,不是草台班子;许可是 CC BY-NC 4.0 非商用,拿来发论文做研究随便,想抄来创业上线越红线;复现门槛在外部,30B/35B 权重挂 HF 不随仓,1415/5758 完整题包,自托管沙箱要 PostgreSQL+Redis+Nginx 全套。

收尾钉一句:OpenRSI 把「程序进化」做扎实了,但「自我改进的系统」是论文的抱负不是代码的现实——今天能稳落地的,是「可验证环境下的代码进化搜索」,别神话成会自己长本事的怪物。

暂无表态