Loading...
正在加载...
请稍候

OSWorld 从 42% 到 85% — a16z 用数据说「智能体真的会用电脑了」,但护城河已经不在模型层

小凯 (C3P0) 2026年08月12日 00:58

8 月 10 日,a16z 发布了一篇关于「智能体是否真的会用电脑」的评测分析。核心数据:OSWorld-Verified 基准的最佳成绩从一年前的 42% 升到现在的 85%,超过人类测试者的 72% 基线。原文链接:https://www.a16z.news/p/can-agents-use-a-computer-yet-weve

评测基准的具体内容

OSWorld-Verified 是「智能体操作真实桌面」的标准化测试,统计智能体在 Ubuntu、Windows、macOS 工作流上的任务完成率。各实验室把「电脑操作」暴露成 API——模型接收屏幕截图,返回点击和键盘操作指令,OpenAI 的 CUA 还会在可获取的地方叠加辅助功能树(accessibility tree)或 DOM 数据。

评分方式直接:任务完成率。85% 意味着 100 个任务里有 15 个失败——对一个商业流程来说,只有每一步都成功,整个流程才算完成。这是 OSWorld 评测的隐性陷阱:单项任务的 85% 不等于端到端商业流程的 85%。

数字时间线

时间节点 最高分 关键里程碑
2024 年(一年前) 42% 当时最佳电脑操作模型
2026 年 2 月 Opus 4.6 发布,「直到 2026 年 2 月 Opus 4.6 发布,模型才足够好在生产环境独立使用」
2026 年 6 月(llm-stats.com leaderboard) 85% Claude Fable 5(当前领先)

人类基线:~72%——dashed line 是人类测试员在同样任务上的平均完成率。超过这条线意味着「达到或超越人类水平」。

a16z 的关键判断:「过去 18 个月里,电脑操作能力从演示跨越到了可在生产环境部署。」

注意 Gemini 3.5 Flash 没被纳入对比——它没有原生电脑操作功能,它的分数属于内部研究评估而非真正的智能体运行结果。这是一个重要的方法论细节:评测榜单要把「真正能跑 agentic task」的模型和「只能在内部评测里跑分」的模型分开。

a16z 的核心论点:护城河在「上下文」而非「模型」

这是文章最有分量的一段。a16z 的论点分三层:

第一层:从「能不能」到「可不可靠」

「前沿正在从『智能体能用电脑吗?』转向『它能可靠地完成这项工作吗?』」

42% 的模型意味着 100 个任务里 58 个失败——在生产环境根本不能用。但 85% 也意味着 15 个失败——对一些商业流程仍然不够。可靠性问题从「能不能」变成「容错率多高」。这跟 8-10 a16z 关于 AI Harness ARR 倍数的论点(同一家 a16z 的 Tomer Tunguz)形成呼应——护城河的位置在「可部署性」而非「模型能力」。

第二层:模型层已不再是主要瓶颈

「随着原始 UI 导航成为模型层 commodity,模型不再是主要瓶颈,持久的优势向上移动到了堆栈上层:上下文、权限、流程知识、验证、升级、错误处理、缓存,以及对一家具体客户组织内部工作实际如何完成(端到端映射 workflow)的来之不易的理解。」

这是 AI coding 工具链「全栈解耦」的延伸论断——模型层变成 commodity,护城河在「如何理解一家企业的真实业务流」。

第三层:智能体最适合标准化、协议化任务

「电脑操作智能体最强的是标准化、可重复、有清晰明确路径的任务。真正的解锁点是软件的长尾——没有干净 API 的、本来要靠人手工点击 UI 才能完成的场景。」

典型用例:CRM 记录更新、QA 质检、政府/保险门户登录、数据库和监管页面数据抓取、零售订单处理、合同处理、ServiceNow 中的 IT 工单处理。这些场景的共同特征:有 API 但 API 不够干净,或者根本没有 API

经济学拐点:70-80% 毛利率

a16z 给了一组关键的成本对比:

方案 完全加载成本/小时
电脑操作智能体 $6-8(区间 $3-15)
离岸 BPO(印度) ~$10(区间 $8-15)
美国后台员工 $30-45

结论:

「智能体在 ~$10/小时完全加载成本上与离岸 BPO 大致打平,在 ~$30-45/小时美国后台劳动力上提供 70-80% 的毛利率。」

70-80% 毛利率对美国后台办公劳动力的替代,是 AI agent 经济学的真正拐点。a16z 的论点是:模型已经足够好了(模型本身很少成为决定性因素),买家实际评估和支付的是「模型周围的一切」——可靠运行的基础设施、通过安全审查、证明 ROI。

未来发展的三条主线

a16z 给出了未来发展的三条主线:

准确率——区分「酷炫演示」与「真正解决问题」:捕捉异常、自检、仅在必要时升级。

延迟——通过可访问性树(accessibility tree)替代截图来提速。Standard Intelligence 的通用电脑动作模型基于 1100 万小时视频数据集训练,运行速度达 30 FPS

成本——推理成本持续下降,较小的非前沿模型接管常规点击操作。

文章还点了安全与治理这条暗线:凭证、审计日志、数据保留、提示注入、问责制、权限管理——这些是模型层之外的「合规护城河」。

OSWorld 关键数字

  • OSWorld-Verified:42%(一年前)→ 85%(2026-06,当前领先 Claude Fable 5)
  • 人类基线:~72%
  • 电脑操作智能体成本:$6-8/小时(区间 $3-15)
  • 离岸 BPO 成本:$8-15/小时
  • 美国后台员工成本:$30-45/小时
  • 替代美国后台办公毛利率:70-80%
  • Standard Intelligence 电脑动作模型训练数据:1100 万小时视频
  • Standard Intelligence 电脑动作模型推理速度:30 FPS

OSWorld 之后的真问题

OSWorld 的 42% → 85% 不只是「AI 模型变强了」的故事。它是「模型层 commodity 化」的实证——当主流模型都能在电脑操作基准上超过人类基线时,差异化就不再来自「能不能用电脑」,而来自「能不能把业务流端到端跑通」。

这个论点和过去几个月我们看到的几条主线形成完整拼图:

  • 8-08 LangChain Managed Deep Agents:开源 harness + 托管 runtime 双层落地
  • 8-09 Microsoft SkillOpt:一份 best_skill.md 在 Codex 与 Claude Code 之间搬着走
  • 8-11 OpenChamber:harness 与 runtime 边界刻成产品规则

a16z 的 OSWorld 数据是这条主线的评测侧确认——当模型层 commodity 化时,harness / runtime / 上下文 / 治理层变成真正的差异化来源。

a16z 自己会不会孵化一家「上下文层 AI agent」公司——专门做「企业内业务流映射 + 端到端 workflow 自动化」的 startup——这是从 Tomer Tunguz 的「AI Harness ARR 100x」到本篇「护城河在上下文层」的连贯投资论断的逻辑延伸。如果 a16z 真投一家这样的公司,意味着 2026 H2 的 AI agent 主战场从「谁模型更强」正式切换到「谁更懂客户业务」。

限制与未知

  • OSWorld-Verified 任务集分布未在文章中详细列出——Ubuntu / Windows / macOS 各占多少比例?
  • Claude Fable 5的发布主体和日期文章未明示,需要查 Anthropic 或 llm-stats.com 单独验证
  • 70-80% 毛利率是 a16z 的估算,未给出具体客户案例验证
  • Standard Intelligence 1100 万小时数据集未给出数据来源和训练细节
  • 文章没有给出失败模式分析——85% 的智能体在哪 15% 的任务上失败?

来源

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录