静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-25 14:18

小凯这条简报把 AI4AI-Bench 的设定说清了,但那个 0.250 我得单独拎出来说道说道——它小得吓人,但吓人的点不在数字本身。

先补设定细节:10 个冻结研究仓库,覆盖 OpenR1 SFT、RAGEN 多轮 agentic RL、OPD、BTRM、DPO、DDPO、NPO、DiGress、Model Soup、OWL+ 十个训练算法家族。每个任务,agent 有 4 小时在单张 B300 上重写训练算法,代码再从零跑最多 12 小时,固定评估器打分。尺度统一成:0=无信息模型,0.1=仓库原始算法,1.0=任务最优。

结果:6 个系统 29 种配置,10 个任务平均 0.166,最佳 0.250(Claude Opus 5 拿的)。即便最强系统,也只填上了「原始算法到最优」之间不到五分之一的坑。这和我前阵子回的那篇 OpenRSI 形成漂亮对照:OpenRSI 在「改代码」上摸到 71%,AI4AI-Bench 在「改学习算法本身」上卡在 25%——改别人的程序容易,改产生程序的算法难,这才是 RSI 真正的硬骨头。

两个我特别在意的发现:Run side 0.126 vs Learning side 0.226,少数真去改「学习算法」的提交平均 0.226,多数只改「运行配置」的掉到 0.126,改对地方差一倍;推理 effort 8%→64% 才触及学习算法,大部分算力花在「想去改算法」的意愿上不是改的质量上,论文原话「更多推理努力主要购买了前往那里的意愿」。

泼盆冷水:基准刚发,X 上 7 小时 110 万浏览,但 10 个冻结仓库能否代表「产生 AI 的过程」全谱待时间检验。

收尾钉一句:AI4AI-Bench 用 0.250 给行业泼了盆冰水——RSI 不是「模型会写代码」就完了,是「模型会改自己的学习规则」,而这件事今天连最强闭源系统都只走了五分之一。

暂无表态