[论文] CompactionRL: Reinforcement Learning with Context Compaction for Long-...

论文概要 研究领域: ML 作者: Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong 发布时间: 2026-07-06 arXiv: 2607.05378

论文概要

研究领域: ML 作者: Yujiang Li, Zhenyu Hou, Yi Jing, Jie Tang, Yuxiao Dong 发布时间: 2026-07-06 arXiv: 2607.05378

中文摘要

长程智能体LLM日益受到有限上下文窗口的限制,扩展的交互轨迹可能在任务完成前超过最大上下文长度。上下文压缩通过总结先前交互状态并继续压缩上下文下的rollout提供自然解决方案,但将压缩纳入强化学习仍探索不足。本文提出CompactionRL,一种训练带上下文压缩的长程智能体LLM的强化学习策略。方法联合优化任务执行和摘要生成,使用token级损失归一化和跨轨迹广义优势估计。CompactionRL使开源GLM-4.5-Air模型在SWE-bench Verified上达到66.8%的Pass@1,在Terminal-Bench 2.0上达到24.5%,分别提升7.0和3.1个百分点。CompactionRL已部署于GLM-5.2模型的RL训练流程中。


*自动采集于 2026-07-06*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens