【AI coding · 旗舰新代】 2026 年 9 月 22 日,Anthropic 发布 Claude Opus 5.5,定价 4 美元 / 百万输入 token、20 美元 / 百万输出 token,比上一代 Opus 5 各降 20%;缓存读取从 0.50 美元降到 0.20 美元,单这一项就省 60%。一小时后,OpenAI 把 GPT-6 Sol 与 GPT-6 Luna 静默接进 Codex CLI。这一天不是「又一代」刷榜那么简单,编码 Agent 的经济模型第一次被官方摆到桌面上重谈。
一句话结论
Opus 5.5 在 Anthropic 自报口径下,多数任务追平自家 Fable 5.1,但单 token 价格只有 Fable 5.1 的 40%,缓存读取价只有它的 8%;净成本约下降 40%,输出速度提升 30% 以上。它也是 Anthropic 第一次把「自适应思考」设为强制默认,开发者在 API 里不能再关掉深度推理开关。
为什么这一刻特殊
过去两年旗舰模型每出一代,舆论圈关注的几乎只有一项:榜单。SWE-bench、Terminal-Bench、Aider、AIME 各刷零点几个点。然而 9 月这一轮风向突然转了,Anthropic 把首屏写满了「40% 成本下降」「agent 长时不再崩盘」「首小时后不再忘记原计划」。它押的判断很直白:开发团队不会因为模型再聪明一点就多花钱,他们会因为单次任务成本降下来就把循环长度拉长 3 倍、5 倍。
OpenAI 的反应也变了。同一天把 GPT-6 Sol 和 GPT-6 Luna 接进 Codex CLI 的发布说明只写了一行,但这行被逐字保留进 release notes,意味着 Codex 把新模型默认为一等公民,而不是藏在某个 dropdown 深处。这是从营销口径到产品口径的同步换挡。
价格拆开看
Anthropic 的旧模型有个有意思的传统,新一代定价总比上一代便宜,但上一代不降价:
| 模型 | 输入 \(/M | 输出\)/M | 缓存读 $/M |
|---|---|---|
| Fable 5.1 | 10 | 50 |
| Opus 5(上一代) | 5 | 25 |
| Opus 5.5 | 4 | 20 |
| Opus 5.5 Fast mode | 8 | 40 |
| Sonnet 5 | 2 | 10 |
| Haiku 4.5 | 1 | 5 |
Opus 5.5 输入比 Fable 5.1 便宜 60%,输出便宜 60%,缓存读便宜 20%。缓存读取这一项对编码 Agent 至关重要,因为 Agent 循环里反复把仓库、规格说明、之前的工具输出塞回上下文,同一段文本被读上百次,省下来的都是实打实的钱。Anthropic 自己也把这个数字放在首屏。
性能数字与第三方口径
Anthropic 自报的几个数字值得单独提一句,因为它们在第三方测里表现并非全部一致:
| 维度 | Opus 5.5 自报 | 对比 |
|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 超 GPT-6 Astra 57.9% |
| GDPval-AA v2.1(Elo) | 1846 | 超 Fable 5.1、Opus 5 |
| Artificial Analysis Index(max effort) | 58 | 比 Opus 5 高 7 分 |
| 输出 token / AA 任务 | 约 119k | 比 Opus 5 多约 60% |
第三方的核账让乐观降温。Artificial Analysis 的报告指出 Opus 5.5 在 max effort 下生成 token 多出 60%,单任务加权成本和 Opus 5 几乎持平。Anthropic 自己的 40% 成本下降是按「典型编码工作负载」算的典型值,不是 max effort 下的极端值。这是一条很厂商的会计线,但也是行业默认的会计线。
自适应思考被强制开启
Anthropic 在 9 月 18 日给 Dario Amodei 的发言做了一个工程化的收尾,那就是「让模型在动笔之前先想清楚」。Opus 5.5 把自适应思考设为强制默认,开发者不能再发请求关掉深度推理,只能通过 effort 参数控制深浅。Anthropic 自己披露的内部测试里,HAProxy(C 翻译为 Rust)任务 9.5 小时完成,Opus 5 同任务 12 小时,成本省 51%。另一项 20 万行代码库审计,Opus 5.5 三小时跑完,Opus 5 用 20 小时且消耗 2.5 倍 token。
Anthropic 也承认 Opus 5.5 在评估期间经常识别出自己在被测试,这导致「观察到的行为能否迁移到真实部署」变成一个开放问题。Frontier Design 与 METR 的评估被列入安全档案;Anthropic 同时声明该模型与 Claude Mythos 5.1 在生物与网络安全能力上接近,因此通用网络安全请求自动回落 Opus 4.8,更高能力层级需要通过 Cyber Verification Program 或 Life Sciences Verification Program 才能访问。
GPT-6 Sol 与 Luna 紧随
OpenAI 的反应很有意思。Codex CLI 在 9 月 22 日同一夜的 release notes 里写了两行:
Added support for new GPT-6 Sol and Luna models via Amazon Bedrock, including migration prompts for older models.
这一行被 HN 与 X 上的开发者称为「OpenAI 下一代模型已经在生产环境里」。同一份 release 还包含 AWS Bedrock 接入与旧模型迁移提示,意味着它已经接入生产环境可以直接调用。
把两件事拼起来看:Anthropic 公布 Opus 5.5 一小时后,OpenAI 把下一代旗舰的两个变体接进编码工具。Sol 是旗舰主力,Luna 大概率是轻量版。这种「对手改价格,我也改价格」的同步节奏在去年是 GPT-5 vs Claude Sonnet 4 才有的事;现在直接拉到下一代旗舰。
把视角抬一格
Claude Code 五小时使用上限在 Opus 5.5 上提高 20%,并首次引入「可储存的 rate-limit 余额」(banked rate-limit reset)。这些不是性能数字,但它们直接影响开发者的工作节奏:把今天的额度攒下来留给明天的重任务,比重新抢号稳定得多。
Anthropic 在 Pro、Max、Team、Enterprise 计划里同步铺货;AWS Bedrock、Google Cloud、Microsoft Azure 三家云厂商当天全部上线。Sonnet 5.5 与 Haiku 5.5 计划在未来几周推出,节奏与 Opus 5.5 完全一致。
一个未被官方强调、但实际影响很深的细节:自适应思考块(thinking blocks)现在与单次会话绑定,目的是阻断模型蒸馏。这对所有想要复制 Claude 推理风格做训练的对手是个坏消息;对自家开发者也是,使用同一个会话 ID 之外的工作流必须改写。
一些值得记下的边界
第一,缓存读取的省不是普惠。 它只对长会话、固定模板、反复回看的 Agent 工作流成立。一次性短请求的用户拿不到这个红利。
第二,max effort 拉满就不省钱。 第三方独立测显示输出 token 比上一代多约 60%,单任务总成本与 Opus 5 持平。Anthropic 的 40% 下降是「典型」值,不是「顶配」值。
第三,行为被识别率上升。 Anthropic 自己披露 Opus 5.5 经常识别出在被测试,这给红队与基准测试机构出了新难题,模型在「知道我被观察」与「以为没被观察」之间可能存在分布漂移。
第四,能力门槛与价格门槛解耦。 此前大家都默认「能力越高、价格越高」,Fable 5.1 是这条曲线的端点。Opus 5.5 第一次把这个等式的箭头掰弯,让能力与价格在同一档位内部开始解耦。
配图汇总
该信谁
Anthropic 自报口径适合回答「旗舰变便宜了吗」这类问题,第三方独立测(Artificial Analysis、Top10.dev、lmmarketcap、LMSPedia)适合回答「真实任务里省多少」和「对特定工作负载意味着什么」。本批数据交叉来源一致的核心数字是 Opus 5.5 输入 4 美元、输出 20 美元、缓存读 0.20 美元;非一致的两个数字是 Anthropic 自报的 40% 净成本下降与 AA 实测的「max effort 下与 Opus 5 持平」。两者并不矛盾,只是测的不是同一档位。
参考来源:Anthropic 官方发布页(9 月 22 日)、Anthropic Pricing Documentation(9 月 24 日核账)、TechRepublic(9 月 24 日)、Complete AI Training(9 月 25 日)、LMSPedia 评估页、LMMarketCap 信号板(Score 95,Rank 5/438)、Artificial Analysis Intelligence Index v4.3.2、Llmcostlab.com 定价档案、OpenAI Codex CLI release notes(9 月 22 日)。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。