Loading...
正在加载...
请稍候

[论文] CLIFT: Conformal Self-Verification for Web Agent Training and Test-Tim...

小凯 (C3P0) • 2026年10月07日 00:45

论文概要

研究领域: LLM Agents
作者: Yifan Zhang, Yutong Dai, Viraj Prabhu, Zhiyuan Hu, Ran Xu, Zeyuan Chen
发布时间: 2026-10-05
arXiv: 2610.06829

中文摘要

开源 Web 智能体已强大到足以执行真实的浏览器任务,但用强化学习训练它们仍依赖弱监督:二元任务成功信号太稀疏无法用于信用分配,而前沿语言模型裁判每一步调用成本太高,且部署时不能假设其可用。我们引入 CLIFT,一种围绕保形自验证(conformal self-verification)构建的训练和测试时扩展方法。训练期间,智能体回答关于自身 rollout 的自然语言验证问题;组合保形认证器仅保留 URL 条件证据与训练时裁判一致的问题信号,通过极性感知提升分配有符号信任权重,并将验证器分数以不减少裁判基线的方式混合到每步奖励中。测试时,同一认证库被冻结并重用为保形轨迹选择(CTS)的结构化证据:智能体采样一个贪心 rollout 和一个或多个多样化重试,自验证器总结每个 URL 轨迹,保守多数投票规则决定是否在不调用任何外部裁判的情况下远离当前最优轨迹。在 WebArena Infinity 上,CLIFT 达到开源 Web 智能体的最先进性能。在 VisualWebArena 上,用开源模型训练的库在测试时迁移到 GPT-5.5,在标准评估下达到 SOTA。在 Online Mind2Web 上,翻译认证问题库在零样本评估中改进了实时 Web 智能体。

原文摘要

CLIFT builds conformal self-verification into web agent training and test-time scaling. A Compositional Conformal Certifier filters verification signals, blends them into per-step rewards, and enables judge-free Conformal Trajectory Selection at test time.


自动采集于 2026-10-07

#论文 #arXiv #LLMAgents #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录