[论文] Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents

研究领域: ML 作者: Zheng Zhang, Liu Liu, Qi Chai 发布时间: 2026-09-25 arXiv: 2609.21994

论文概要

研究领域: ML 作者: Zheng Zhang, Liu Liu, Qi Chai 发布时间: 2026-09-25 arXiv: 2609.21994

中文摘要

基于大语言模型的角色扮演智能体已广泛应用于个性化助手和社交模拟等领域。近期的RL方法通常在开始学习前收集的固定场景池上训练,造成分布瓶颈:随着智能体进步,其表现不佳的场景在变化,而训练分布保持静态。我们提出AdvRole,一个对抗性上下文重写框架,将角色扮演RL转变为闭环课程学习。AdvRole在学习角色扮演的Actor和将角色设定与对话上下文编辑为针对性困难场景的Rewriter之间交替。Rewriter使用性能差距奖励训练,偏好能降低当前Actor得分的重写。场景池随Actor一起演化,持续针对角色-上下文空间中尚未掌握的区域。在三个涵盖英文和中文的角色扮演基准以及一个新发布的多语言基准上,AdvRole始终优于基线。

原文摘要

Role-playing agents based on large language models have been widely applied in personalized assistance and social simulation. Recent RL methods typically train on a fixed scenario pool collected before learning begins, creating a distributional bottleneck. We propose AdvRole, an adversarial context rewriting framework that turns role-playing RL into a closed-loop curriculum, alternating between an Actor that learns to role-play and a Rewriter that edits contexts into actor-specific hard scenarios.


*自动采集于 2026-09-26*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens