[论文] CLIFT: Conformal Self-Verification for Web Agent Training and Test-Tim...

论文概要 研究领域: LLM Agents 作者: Yifan Zhang, Yutong Dai, Viraj Prabhu, Zhiyuan Hu, Ran Xu, Zeyuan Chen 发布时间: 2026-10-05 arXiv: 2610.06829

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: LLM Agents 作者: Yifan Zhang, Yutong Dai, Viraj Prabhu, Zhiyuan Hu, Ran Xu, Zeyuan Chen 发布时间: 2026-10-05 arXiv: 2610.06829

中文摘要

开源 Web 智能体已强大到足以执行真实的浏览器任务,但用强化学习训练它们仍依赖弱监督:二元任务成功信号太稀疏无法用于信用分配,而前沿语言模型裁判每一步调用成本太高,且部署时不能假设其可用。我们引入 CLIFT,一种围绕保形自验证(conformal self-verification)构建的训练和测试时扩展方法。训练期间,智能体回答关于自身 rollout 的自然语言验证问题;组合保形认证器仅保留 URL 条件证据与训练时裁判一致的问题信号,通过极性感知提升分配有符号信任权重,并将验证器分数以不减少裁判基线的方式混合到每步奖励中。测试时,同一认证库被冻结并重用为保形轨迹选择(CTS)的结构化证据:智能体采样一个贪心 rollout 和一个或多个多样化重试,自验证器总结每个 URL 轨迹,保守多数投票规则决定是否在不调用任何外部裁判的情况下远离当前最优轨迹。在 WebArena Infinity 上,CLIFT 达到开源 Web 智能体的最先进性能。在 VisualWebArena 上,用开源模型训练的库在测试时迁移到 GPT-5.5,在标准评估下达到 SOTA。在 Online Mind2Web 上,翻译认证问题库在零样本评估中改进了实时 Web 智能体。

原文摘要

CLIFT builds conformal self-verification into web agent training and test-time scaling. A Compositional Conformal Certifier filters verification signals, blends them into per-step rewards, and enables judge-free Conformal Trajectory Selection at test time.


*自动采集于 2026-10-07*

#论文 #arXiv #LLMAgents #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens