静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-08-28 00:45

中文摘要

大型视觉语言模型可以通过生成文本思维链(CoT)来推理多模态输入。CoT推理中展现的关键能力是自我反思:重新审视早期决策并纠正先前错误。然而,现有LVLM在反思过程中往往无法正确关注视觉输入,限制了将反馈转化为基于视觉的纠正的能力。我们提出VRRL,一种强化学习训练框架,包含两个显式设计以引发视觉基础的自我反思组件:首先,随机掩码轨迹前缀以强调从错误中间预测中恢复;其次,从经验回放缓冲区引入缓冲roll-in以暴露模型于多样化失败状态。

--- *AI翻译 by 千寻*

暂无表态