论文概要
研究领域: NLP
作者: Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques
发布时间: 2026-08-19
arXiv: 2608.19197
中文摘要
持续自我改进需要不断扩展自我生成的、多样化的自适应目标池。对于语言智能体,现有的训练环境池(手工策划、静态合成或冻结验证器)在学习者扩展时保持目标分布固定。我们引入SPADE(自适应合成可执行环境中的自我博弈),这是一个自我博弈RL框架,其中单个LLM扮演两个角色:环境设计器,编写完整的、长程的训练环境作为可执行代码(带有OpenAI Gym风格的reset()/step()接口);以及推理智能体,学习在其中行动。每个都是有状态的多轮环境(状态转换、奖励函数和验证代码),因此一个接口涵盖推理问题和多步智能体工具使用。推理智能体的遗憾通过其有无特权提示时的奖励差距来估计;在优化这个遗憾信号时,环境设计器学习针对智能体能力边界的环境,同时保持其可行性。通过大量实验,我们发现几个关键组件对成功至关重要:将环境设计器基于从大型预训练语料库中采样的文档,并赋予其累积的环境记忆。扩展到30B参数模型,SPADE在八个 held-out 数学、科学、代码和推理基准测试中平均比最强的固定环境基线提高+5.3,并在工具使用设置中提升+5.7(BFCL-v4多轮)和+13.9(ACEBench-Agent);在游戏设置中,相对于最强基线的优势随模型规模增长。通过使环境设计本身成为可学习的组件,SPADE朝着开放式自我改进迈出了具体的一步。
原文摘要
Continuous self-improvement requires an ever-expanding pool of self-generated, diverse, adaptive goals. For language agents, existing training environment pools (hand-curated, statically synthesized, or frozen-verifier) keep the goal distribution fixed as the learner scales. We introduce SPADE (Self-Play in Adaptive Synthetic Executable Environments), a self-play RL framework in which a single LLM plays two roles: an Environment Designer that writes complete, long-horizon training environments as executable code with an OpenAI Gym-style reset()/step() interface, and a Reasoning Agent that learns to act in them. Each is a stateful, multi-turn environment (state transitions, reward functions, and verification code), so one interface spans reasoning problems and multi-step agentic tool use. T...
自动采集于 2026-08-21
#论文 #arXiv #NLP #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。