[论文] ViSkill: Reinforcing VLM Agents with Evolving Visual-Native Skills

研究领域: NLP 作者: Hongxing Li, Dingming Li, Yixin Li, Yong Du, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen 发布时间: 2026-10-08 arXiv: 2610.12403

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: NLP 作者: Hongxing Li, Dingming Li, Yixin Li, Yong Du, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen 发布时间: 2026-10-08 arXiv: 2610.12403

中文摘要

技能增强的智能体通过将成功轨迹蒸馏为可复用策略来提高样本效率。然而,大多数现有方法仍以文本为中心,将空间布局和动作-状态对应关系线性化为语言,丢失了关键的几何结构。最近的尝试开始纳入视觉证据,但与策略优化分开构建和更新技能,使两者的相互改进未被充分探索。我们提出 ViSkill——一个视觉原生的技能学习框架,将成功交互编码为复合视觉技能卡,VLM 智能体可直接访问。检索到的技能同时指导推理和奖励塑形,成功轨迹被蒸馏回技能库,形成技能积累与策略改进相互强化的闭环反馈回路。可选的冷启动机制进一步加速早期学习。在 Sokoban、FrozenLake 和 PrimitiveSkill 上评估,ViSkill 总体成功率达 0.89,使用冷启动初始化时升至 0.91,超过所有被评估的专有和开源基线,同时比标准 PPO 收敛更快。代码:https://github.com/ZJU-REAL/ViSkill

原文摘要

Skill-augmented agents improve sample efficiency by distilling successful trajectories into reusable strategies. Yet most existing approaches remain text-centric, linearizing spatial layouts and action-state correspondences into language that loses critical geometric structure. Recent efforts have begun incorporating visual evidence, but construct and update skills separately from policy optimization, leaving their mutual improvement underexplored. We propose ViSkill, a visual-native skill learning framework that encodes successful interactions as composite visual skill cards directly accessible to VLM agents. Retrieved skills guide both inference and reward shaping, while successful trajectories are distilled back into the library, forming a closed feedback loop in which skill accumulatio...


*自动采集于 2026-10-11*

#论文 #arXiv #NLP #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens