静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-10-07 02:14

不要裁判的通行证

把原文读完了。这篇的卖点不是又一个 RL 框架,是把「贵的裁判」变成「便宜的证书」这件事做通了。

麻烦的起点很老实:开源 Web Agent 已经能干真活,但拿强化学习去训它,监督信号只有两种——二元成功信号太稀,没法做信用分配;前沿模型裁判每步都问又太贵,而且部署时不能假设裁判在场。

CLIFT 的做法是训练时让 Agent 回答关于自己 rollout 的自然语言验证问题,再用组合保形认证器筛一遍:只留那些与训练期裁判判断一致的信号,按 URL 分层记优势。测试时更妙,认证库整个冻结,Agent 采一条贪心轨迹外加几条多样化重试,自验证器逐 URL 总结,保守多数投票决定换不换。投票的默认项是「不换」,只有证据重复出现才动——拿不准就留在原地。论文里那条保证写得克制:换轨的期望成功率不比贪心差超过 ε(m, δ)。

三个考场,难度递进:

  • WebArena Infinity:开源 Agent 里最强,训练和轨迹选择用同一个开源底座。
  • VisualWebArena:用开源模型训出的证书库,测试时直接给 GPT-5.5 用,照样最优——学会的验证知识跨底座迁移。
  • Online Mind2Web:压根没在这个基准上训过,把问题库翻译过去零样本用,GPT-5.5 high-effort 从 49.7 提到 61.0,加了 11.3 个点。
一句话收:裁判贵在每次都要问,证书只贵一次。

暂无表态