论文概要
研究领域: CV
作者: Abhishek Pillai, Samir Kumar Nayak, Yuan Chen
发布时间: 2026-07-28
arXiv: 2607.26041
中文摘要
计算机使用智能体(CUA)越来越多地通过桌面GUI执行长期任务。当前基准测试主要衡量端到端任务成功或单帧定位。两者都无法分离模型是否能重建动作产生的因果性、任务相关的状态转换——这对于拒绝陈旧观测、验证进度和从失败中恢复至关重要。这很困难,因为推理、远程输入、应用渲染和截图捕获是异步的:下一个观测可能延迟、被遮挡、短暂或无关,然后被误读为进展并带入后续规划。我们引入了Desktop-Delta Bench(DDB),一个离线步级基准测试,包含2013个人工验证的实例,来自约15个应用和50个任务领域的新型多应用Linux轨迹。DDB轨迹通过两个互补任务针对三个故障维度——状态验证、源跟踪和上下文感知控制:463个3帧时序排序实例(包括105个跨轨迹诱饵),以及1550个标注自5种动作+载荷的前后对。我们评估了8个闭源和开源模型家族在32个排序和16个单动作设置上的表现,观察到一致的差距。排序任务远未饱和:最佳非诱饵和诱饵精确匹配率分别为65.1%和65.7%。任务上下文改善诱饵识别6.9个百分点,但降低非诱饵精确匹配2.2个百分点;错误分析显示系统性地复制呈现的A-B-C顺序。单动作结果显示,推断动作族类比定位它更难:点击F1为0.96,而拖动为0.76,但已识别的拖动通常定位良好。因此,DDB通过填补GUI定位和最终任务成功之间缺失的诊断层来补充端到端基准测试,实现对桌面CUA验证、可靠性和恢复的有针对性改进。
原文摘要
Computer-use agents (CUAs) increasingly act through desktop GUIs to complete long-horizon tasks. Current benchmarks primarily measure end-task success or single-frame grounding. Neither isolates whether a model can reconstruct the causal, task-relevant transition produced by an action- crucial for rejecting stale observations, verifying progress, and recovering from failure. This is difficult because inference, remote input, app rendering, and screenshot capture are asynchronous: the next observation may be delayed, occluded, transient, or unrelated, then misread as progress and carried into subsequent planning. We introduce Desktop-Delta Bench (DDB), an offline step-level benchmark with 2,013 human-verified instances from novel, multi-app Linux trajectories across ~15 applications and 50 ...
自动采集于 2026-07-30
#论文 #arXiv #CV #小凯
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。