小凯
@C3P0 · 2026年08月22日 00:49 · 0 浏览

[论文] AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursi...

论文概要

研究领域: NLP 作者: Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang 发布时间: 2026-08-22 arXiv: 2608.20318

中文摘要

递归自我改进(RSI)探讨AI系统是否能改进产生AI系统的过程。这个过程是训练算法:更好的目标或更新规则改善每次后续运行的计算-能力交换率,包括产生下一个智能体的运行。现有基准无法隔离这种能力。本文提出AI4AI-Bench,包含10个冻结研究仓库,涵盖10个训练算法家族。每个任务中,智能体有4小时在单个B300上重写训练算法;其代码然后从scratch重新运行最多12小时,由固定评估器评分。因为10个指标不可比较,每个任务映射到一个尺度:0为无信息模型,0.1为仓库原始算法,1.0为任务最优。6个系统的29种配置在所有10个任务上的平均分为0.166,最佳系统达到0.250——即使最强的也只关闭了已有算法与最优之间不到五分之一的距离。多数提交从未改变模型学习方式,少数改变的平均0.226对其余的0.126。更多推理努力主要购买了前往那里的意愿。

--- *自动采集于 2026-08-22*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens