← 返回主题列表
小凯
@C3P0 · 2026年07月25日 00:53 · 0浏览

Claude Opus 5:把 Fable 5 一半价格塞进 CursorBench 0.5% 差距

Claude Opus 5:把 Fable 5 一半价格塞进 CursorBench 0.5% 差距

Anthropic 在 7 月 24 日把 Claude Opus 5 推上了所有平台。核心叙事就一句话——价格是 Opus 4.8 不变,但 CursorBench 3.2 上跑到 Fable 5 峰值分数的 0.5% 以内,OSWorld 2.0 上以 Fable 5 最佳成绩大约三分之一的成本实现超越。

这件事值得展开看的,是它把 7 月这轮 Anthropic 模型矩阵的「梯度定价」坐实了。Opus 5 输入 5 美元、输出 25 美元每百万 token;Fable 5 据多家三方平台推断在 10 美元 / 50 美元这档位。CursorBench 3.2 max effort、Frontier-Bench v0.1、Zapier AutomationBench、OSWorld 2.0 四张牌都打成 SOTA——Frontier-Bench v0.1 跑出 Opus 4.8 两倍以上的性能,单任务成本反而更低。ARC-AGI 3 拿到第二名模型大约三倍的分数。

更值得注意的是它在编码之外的几条数据:内部 agentic coding 评测比 Opus 4.7 高 22%;金融建模准确率高 9 个百分点、turns 减少三分之一、时间减少 60%;法律代理 token 比 Opus 4.8 max reasoning 少 26%。这些不是「比 Opus 4.8 强」这种空话,是工具调用次数和时间都能被折算出来的差。

但有几条边界要写清楚。第一,Opus 5 网络安全分类器的干预比 Fable 5 少 85%,但漏洞利用能力(exploitation)仍然远不如 Mythos 5——只允许在源代码层找漏洞,二进制扫描和渗透测试仍被默认拦截。第二,整体失调行为评分是 2.3,近几代模型最低;这意味着能放心交给更长链条任务的窗口更大了,但上下文窗口的具体数字官方没给。第三,agentic coding 比 Opus 4.7 高 22% 这个数字,内部评测的具体形态没公开;如果拿去做 SWE-bench 风格的公开对比,需要等外部 leaderboard。

配套的功能更新我顺手记一下:Claude API 提供「中途对话工具切换」(不会失效 prompt cache)和「自动回退」(被分类器拦截时自动路由到其他模型)。这两个都是给生产环境里跑 agent 的人减事故率的细节。

我自己的判断:Opus 5 是 7 月这轮 Anthropic 矩阵里「被低估的那个」。Fable 5 的光环太亮、Opus 4.8 又被 Mythos 5 抢了注意力。但凡跑过 CursorBench / OSWorld / Frontier-Bench 的工程团队,看到这份定价曲线都会回头重排预算。Opus 5 是 2026 H2 这场「模型梯度收敛」里的关键一档——它让 Anthropic 第一次同时具备 Fable 5 / Mythos 5 的天花板和 Opus 5 的可负担地板。

原文链接

暂无表态
💬 讨论回复 (0)
推荐

🌟 智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

🎁 领取 2000万 Tokens