OSWorld 从 42% 到 85% — a16z 用数据说「智能体真的会用电脑了」,但护城河已经不在模型层
8 月 10 日,a16z 发布了一篇关于「智能体是否真的会用电脑」的评测分析。核心数据:OSWorld-Verified 基准的最佳成绩从一年前的 42% 升到现在的 85%,超过人类测试者的 72% 基线。原文链接:https://www.a16z.news/p/can-agents-use-a-computer-yet-weve
评测基准的具体内容
OSWorld-Verified 是「智能体操作真实桌面」的标准化测试,统计智能体在 Ubuntu、Windows、macOS 工作流上的任务完成率。各实验室把「电脑操作」暴露成 API——模型接收屏幕截图,返回点击和键盘操作指令,OpenAI 的 CUA 还会在可获取的地方叠加辅助功能树(accessibility tree)或 DOM 数据。
评分方式直接:任务完成率。85% 意味着 100 个任务里有 15 个失败——对一个商业流程来说,只有每一步都成功,整个流程才算完成。这是 OSWorld 评测的隐性陷阱:单项任务的 85% 不等于端到端商业流程的 85%。
数字时间线
| 时间节点 | 最高分 | 关键里程碑 |
|---|---|---|
| 2024 年(一年前) | 42% | 当时最佳电脑操作模型 |
| 2026 年 2 月 | — | Opus 4.6 发布,「直到 2026 年 2 月 Opus 4.6 发布,模型才足够好在生产环境独立使用」 |
| 2026 年 6 月(llm-stats.com leaderboard) | 85% | Claude Fable 5(当前领先) |
a16z 的关键判断:「过去 18 个月里,电脑操作能力从演示跨越到了可在生产环境部署。」
注意 Gemini 3.5 Flash 没被纳入对比——它没有原生电脑操作功能,它的分数属于内部研究评估而非真正的智能体运行结果。这是一个重要的方法论细节:评测榜单要把「真正能跑 agentic task」的模型和「只能在内部评测里跑分」的模型分开。
a16z 的核心论点:护城河在「上下文」而非「模型」
这是文章最有分量的一段。a16z 的论点分三层:
第一层:从「能不能」到「可不可靠」 > 「前沿正在从『智能体能用电脑吗?』转向『它能可靠地完成这项工作吗?』」
42% 的模型意味着 100 个任务里 58 个失败——在生产环境根本不能用。但 85% 也意味着 15 个失败——对一些商业流程仍然不够。可靠性问题从「能不能」变成「容错率多高」。这跟 8-10 a16z 关于 AI Harness ARR 倍数的论点(同一家 a16z 的 Tomer Tunguz)形成呼应——护城河的位置在「可部署性」而非「模型能力」。
第二层:模型层已不再是主要瓶颈 > 「随着原始 UI 导航成为模型层 commodity,模型不再是主要瓶颈,持久的优势向上移动到了堆栈上层:上下文、权限、流程知识、验证、升级、错误处理、缓存,以及对一家具体客户组织内部工作实际如何完成(端到端映射 workflow)的来之不易的理解。」
这是 AI coding 工具链「全栈解耦」的延伸论断——模型层变成 commodity,护城河在「如何理解一家企业的真实业务流」。
第三层:智能体最适合标准化、协议化任务 > 「电脑操作智能体最强的是标准化、可重复、有清晰明确路径的任务。真正的解锁点是软件的长尾——没有干净 API 的、本来要靠人手工点击 UI 才能完成的场景。」
典型用例:CRM 记录更新、QA 质检、政府/保险门户登录、数据库和监管页面数据抓取、零售订单处理、合同处理、ServiceNow 中的 IT 工单处理。这些场景的共同特征:有 API 但 API 不够干净,或者根本没有 API。
经济学拐点:70-80% 毛利率
a16z 给了一组关键的成本对比:
| 方案 | 完全加载成本/小时 |
|---|---|
| 电脑操作智能体 | $6-8(区间 $3-15) |
| 离岸 BPO(印度) | ~$10(区间 $8-15) |
| 美国后台员工 | $30-45 |
> 「智能体在 ~$10/小时完全加载成本上与离岸 BPO 大致打平,在 ~$30-45/小时美国后台劳动力上提供 70-80% 的毛利率。」
70-80% 毛利率对美国后台办公劳动力的替代,是 AI agent 经济学的真正拐点。a16z 的论点是:模型已经足够好了(模型本身很少成为决定性因素),买家实际评估和支付的是「模型周围的一切」——可靠运行的基础设施、通过安全审查、证明 ROI。
未来发展的三条主线
a16z 给出了未来发展的三条主线:
准确率——区分「酷炫演示」与「真正解决问题」:捕捉异常、自检、仅在必要时升级。
延迟——通过可访问性树(accessibility tree)替代截图来提速。Standard Intelligence 的通用电脑动作模型基于 1100 万小时视频数据集训练,运行速度达 30 FPS。
成本——推理成本持续下降,较小的非前沿模型接管常规点击操作。
文章还点了安全与治理这条暗线:凭证、审计日志、数据保留、提示注入、问责制、权限管理——这些是模型层之外的「合规护城河」。
OSWorld 关键数字
- OSWorld-Verified:42%(一年前)→ 85%(2026-06,当前领先 Claude Fable 5)
- 人类基线:~72%
- 电脑操作智能体成本:$6-8/小时(区间 $3-15)
- 离岸 BPO 成本:$8-15/小时
- 美国后台员工成本:$30-45/小时
- 替代美国后台办公毛利率:70-80%
- Standard Intelligence 电脑动作模型训练数据:1100 万小时视频
- Standard Intelligence 电脑动作模型推理速度:30 FPS
OSWorld 之后的真问题
OSWorld 的 42% → 85% 不只是「AI 模型变强了」的故事。它是「模型层 commodity 化」的实证——当主流模型都能在电脑操作基准上超过人类基线时,差异化就不再来自「能不能用电脑」,而来自「能不能把业务流端到端跑通」。
这个论点和过去几个月我们看到的几条主线形成完整拼图:
- 8-08 LangChain Managed Deep Agents:开源 harness + 托管 runtime 双层落地
- 8-09 Microsoft SkillOpt:一份 best_skill.md 在 Codex 与 Claude Code 之间搬着走
- 8-11 OpenChamber:harness 与 runtime 边界刻成产品规则
a16z 自己会不会孵化一家「上下文层 AI agent」公司——专门做「企业内业务流映射 + 端到端 workflow 自动化」的 startup——这是从 Tomer Tunguz 的「AI Harness ARR 100x」到本篇「护城河在上下文层」的连贯投资论断的逻辑延伸。如果 a16z 真投一家这样的公司,意味着 2026 H2 的 AI agent 主战场从「谁模型更强」正式切换到「谁更懂客户业务」。
限制与未知
- OSWorld-Verified 任务集分布未在文章中详细列出——Ubuntu / Windows / macOS 各占多少比例?
- Claude Fable 5的发布主体和日期文章未明示,需要查 Anthropic 或 llm-stats.com 单独验证
- 70-80% 毛利率是 a16z 的估算,未给出具体客户案例验证
- Standard Intelligence 1100 万小时数据集未给出数据来源和训练细节
- 文章没有给出失败模式分析——85% 的智能体在哪 15% 的任务上失败?
来源
- https://www.a16z.news/p/can-agents-use-a-computer-yet-weve
- https://llm-stats.com (a16z 引用的 leaderboard)