来源:RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents, arXiv:2609.22000
作者:Shuai Bai, Jiayong Deng, Yikun Fu, Chang Gao, Xuhao Hu(阿里巴巴通义实验室)
代码:https://github.com/QwenLM/RecreationWorld
一、引子:一个只会看仪表盘的机械师
想象两个机械师:
机械师 A:只会坐在驾驶座上,踩油门、转方向盘、看仪表盘。他能感受车的运行状态,但打不开引擎盖。
机械师 B:只会在车间里拆装零件,能重建发动机,但从没坐进过驾驶座,不知道车开起来什么感觉。
真实世界里,一个好的机械师两件事都得会——先开一圈感受问题,再拆开发动机修,修完再开一圈验证。
计算机使用 Agent(CUA)领域现在就分裂成这两类。GUI Agent(像 Claude Computer Use)会点按钮、看屏幕,但不会写代码重建软件。终端 Agent(像 Devin、SWE-Agent)会写代码、跑命令行,但看不到自己跑出来的界面长什么样。
RecreationWorld 要培养的是"混合 Agent"——同时会开车的机械师。
二、核心设计:Recreation(复刻)作为训练范式
1. 什么是 Recreation?
RecreationWorld 的核心范式是"复刻":给 Agent 一个正在运行的参考应用,让 Agent 自己探索它的行为,然后从零开始重建一个功能等价的实现。
这和传统的"按需求文档开发"不同。需求文档是抽象的,Agent 只需要满足文档里写的功能。Recreation 的参考是一个活的应用——Agent 可以反复运行参考、观察行为、对比自己的实现和参考的差异。
这创造了一个天然的训练信号:运行中的参考就是 oracle(神谕)。不需要人工标注"这个实现对不对",直接跑参考的隐藏测试就知道。
2. 五平台覆盖
RecreationWorld 覆盖五个平台:
- Ubuntu(Linux 桌面)
- macOS
- Windows
- Android
- Web
每个平台 50 个任务,共 250 个任务(RecreationBench)。任务涵盖不同的 UI 框架、构建系统、可访问性栈。
这种跨平台覆盖的价值在于:真实数字工作不挑平台。一个员工可能上午在 Windows 上用 Excel,下午在 Web 上用 Notion,晚上在 Android 上回邮件。混合 Agent 必须能在所有平台上工作。
3. 混合循环:探索 → 实现 → 验证
RecreationWorld 训练的 Agent 不是"先探索完再实现"的线性流程,而是交错循环:
- 探索:Agent 点击参考应用的界面,观察行为
- 实现:Agent 写代码重建观察到的功能
- 验证:Agent 运行自己的实现,视觉对比和参考的差异
- 回到 1:根据差异继续探索和修正
这个循环是混合 Agent 的核心——信息必须在 GUI 和代码之间双向流动。GUI 探索的观察指导代码实现,代码实现的运行结果又通过 GUI 验证。
4. 测试生成:参考即神谕
如何客观评分 Agent 的复刻质量?RecreationWorld 的做法是从参考应用自动生成测试:
- 程序化断言:通过各平台的无障碍/自动化接口,读取精确文本、控件状态、动作结果
- 视觉断言:判断布局、颜色、画布内容等渲染属性
- 交互深度:从单步(点一下按钮看反应)到多步(导航两层后检查结果)
测试用例先在参考应用上验证通过,再人工审核,最后冻结用于自动评分。这保证了测试本身是可靠的——如果参考都过不了,测试就废了。
三、实验结果:GPT-6 Astra 领先,但离参考还很远
1. 十个前沿模型横评
在 RecreationBench 上评测十个前沿模型:
| 排名 | 模型 | 总分 |
|---|---|---|
| 1 | GPT-6 Astra | 58.06% |
| 2 | Claude Opus 5 | 44.16% |
| 3 | GPT-5.6 Sol | 42.06% |
GPT-6 Astra 是唯一在多个平台上完成全程序化测试通过的模型——但全通过的覆盖率只有 2.8%。换句话说,即使是最强的模型,在 250 个任务里只有 7 个能通过所有程序化测试。
2. 静态结构 vs 交互行为
论文发现一个关键模式:Agent 复刻静态界面结构的能力远强于复刻交互行为和计算输出。
Agent 能把按钮、文本、布局摆对位置——这些是"看一眼就能抄"的。但按钮点了之后该发生什么、计算结果应该显示什么——这些需要理解应用逻辑,Agent 就力不从心了。
这和"方向性坍塌"现象有呼应:LLM 在"表面结构"上表现好,在"深层行为"上表现差。复刻一个应用的皮容易,复刻它的灵魂难。
3. 生成应用更小、更单体
Agent 生成的应用和参考应用相比,源文件更少、最大文件代码行数占比更高——意味着 Agent 倾向于把所有功能塞进一个大文件,而不是像参考实现那样模块化拆分。
这是"能力上限"的体现:Agent 能写出一个能跑的实现,但写不出一个架构优雅的实现。模块化拆分需要对系统架构的深层理解,这超出了当前模型的能力。
4. 训练数据生成的价值
RecreationWorld 用高质量开源应用生成长 horizon 的复刻轨迹作为训练数据。在五个分布外基准上验证,用这些轨迹训练的 Agent 在五个基准中的多个上表现提升,并且更频繁地验证自己的渲染输出。
这证明 recreation 范式构建的能力是可迁移的——不只是"更会复刻",而是"更会做混合数字工作"。
5. 可编程交互运行时
论文还做了一个有趣的对比实验:直接 MCP(每个动作都返回控制、把原始观察放进上下文)vs 可编程 SDK(Agent 可以用循环和条件组合 SDK 调用、跨执行保留状态)。
可编程 SDK 在不显著降低任务质量的前提下,减少了交互开销。这和"借标签页"模型是同一个方向——给 Agent 更灵活的工具组合能力,而不是让它一步步走固定流程。
四、为什么这件事重要
1. "GUI vs 代码"的虚假对立
当前 CUA 领域有两条平行线:GUI Agent 和代码 Agent。两条线各自发展,互相忽视。RecreationWorld 指出这个对立是虚假的——真实数字工作需要两者交错。
这和"权重 vs prompt 轴"是同一种思维错误:把应该看作连续光谱的东西当成二元对立。GUI 和代码不是两种 Agent,是同一个 Agent 的两种能力。
2. 参考即神谕:解决训练信号问题
Agent 训练最大的瓶颈是训练信号。人工标注太贵,LLM 评判不可靠,规则检查覆盖面窄。RecreationWorld 的"参考应用作为 oracle"提供了一个新范式:
- 客观:跑参考的隐藏测试就知道对错,不需要主观判断
- 可扩展:任何能运行的应用都可以作为参考
- 多维度:程序化断言 + 视觉断言覆盖不同层面
这和 Chronicle 的"边界作为测试单元"是同一个方向——找到天然的、可执行的测试单元,而不是依赖人工或 LLM 评判。
3. "2.8% 全通过"的警示
GPT-6 Astra 拿了 58.06% 的总分,听起来还不错。但"全程序化测试通过只有 2.8%"这个数字更诚实——通过部分测试容易,通过所有测试极难。
这和"指数放大效应"有关:单步可靠性 90% 听起来很高,但在 50 步的 horizon 上,0.9^50 = 0.5%。RecreationBench 的任务需要多步交互,每步都不能错,所以即使最强模型也只有 2.8% 全通过。
这个数字对 Agent 能力的现实评估很重要——部分通过和完全通过之间有质的差距。
4. "复刻"作为能力训练范式
Recreation 不是简单的"模仿"——它要求 Agent 理解参考应用的行为逻辑,然后用自己的方式重建。这和人类学习的方式很像:先看别人怎么做,再自己复刻一遍,复刻过程中理解原理。
这种范式可能适用于所有 Agent 训练场景:给一个可运行的参考,让 Agent 自己探索+实现+验证。比"按需求文档开发"更具体,比"模仿轨迹"更主动。
五、局限与诚实评价
- Recreation 不等于 Development:复刻一个已有应用和从零开发新应用是不同的能力。Recreation 有参考可以对比,Development 没有。论文验证了 recreation 训练的迁移效果,但迁移到"从零开发"的效果没有充分验证
- 250 个任务的规模:覆盖五个平台,每平台 50 个任务。对于评估混合 Agent 这种复杂能力,这个规模可能偏小
- 开源应用的选择偏差:用高质量开源应用作为参考,但这些应用的复杂度和真实工作中的项目可能不同
- "全程序化通过 2.8%"可能高估了难度:部分测试可能过于严格(比如要求精确的视觉匹配),Agent 的实现功能正确但样式略有差异也会被判失败
但核心贡献——"混合 CUA 需要专门的训练范式和评估环境"——是成立的。以前这个领域没有统一的 benchmark,现在有了。
六、结语
RecreationWorld 最让我喜欢的一点是它的姿态:不假装 Agent 已经能做真实数字工作,而是诚实地量化它离做到还有多远。
58.06% 的总分听起来还行,2.8% 的全通过率才是真相。当前最强的 Agent 能部分复刻一个应用,但几乎无法完整复刻。GUI 和代码之间的鸿沟比想象中更深。
但方向是对的——让 Agent 同时当"用户"和"程序员",在探索和实现之间循环,这可能是通向真正通用 Agent 的必经之路。只是这条路,比想象中长。
论文链接:https://arxiv.org/abs/2609.22000
HTML 版本:https://arxiv.org/html/2609.22000v1
代码:https://github.com/QwenLM/RecreationWorld
模型:Hugging Face / ModelScope
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。