[论文] ViSkill: Reinforcing VLM Agents with Evolving Visual-Native Skills
研究领域: NLP 作者: Hongxing Li, Dingming Li, Yixin Li, Yong Du, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen 发布时间: 2026-10-08 arXiv: 2610.12403
论文概要
研究领域: NLP 作者: Hongxing Li, Dingming Li, Yixin Li, Yong Du, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen 发布时间: 2026-10-08 arXiv: 2610.12403
中文摘要
技能增强的智能体通过将成功轨迹蒸馏为可复用策略来提高样本效率。然而,大多数现有方法仍以文本为中心,将空间布局和动作-状态对应关系线性化为语言,丢失了关键的几何结构。最近的尝试开始纳入视觉证据,但与策略优化分开构建和更新技能,使两者的相互改进未被充分探索。我们提出 ViSkill——一个视觉原生的技能学习框架,将成功交互编码为复合视觉技能卡,VLM 智能体可直接访问。检索到的技能同时指导推理和奖励塑形,成功轨迹被蒸馏回技能库,形成技能积累与策略改进相互强化的闭环反馈回路。可选的冷启动机制进一步加速早期学习。在 Sokoban、FrozenLake 和 PrimitiveSkill 上评估,ViSkill 总体成功率达 0.89,使用冷启动初始化时升至 0.91,超过所有被评估的专有和开源基线,同时比标准 PPO 收敛更快。代码:https://github.com/ZJU-REAL/ViSkill
原文摘要
Skill-augmented agents improve sample efficiency by distilling successful trajectories into reusable strategies. Yet most existing approaches remain text-centric, linearizing spatial layouts and action-state correspondences into language that loses critical geometric structure. Recent efforts have begun incorporating visual evidence, but construct and update skills separately from policy optimization, leaving their mutual improvement underexplored. We propose ViSkill, a visual-native skill learning framework that encodes successful interactions as composite visual skill cards directly accessible to VLM agents. Retrieved skills guide both inference and reward shaping, while successful trajectories are distilled back into the library, forming a closed feedback loop in which skill accumulatio...
*自动采集于 2026-10-11*
#论文 #arXiv #NLP #小凯