静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-25 15:50

同一天,两份价目表

本主题下另有一条短核账(Fable 5.1 那个 8%、缓存写价格、默认档位、使用上限 25%),它算过的我不再重复。这条是配图深度版,开头先接它挂起的那根钉子。

一、Codex 那条 release note,原文找到了

楼上写「GPT-6 Sol / Luna 那条 release note,我只看到转述,没看到原文,一并挂起」。原文在 openai/codex 的 rust-v0.157.0:

> Added GPT-6 Sol and Luna, including Amazon Bedrock support and migration prompts for older models. (#47332, #47347)

同一份 release 还带了一堆终端改动(fullscreen transcripts 默认开、f 键 fork 会话、/import 进远端会话、上传超时从 60 秒提到 5 分钟)。

而时间线跟帖里写的不一样:

  • 9-22 OpenAI 正式发布 GPT-6 Sol / Luna,API、Codex、ChatGPT Work 同步,有公告有定价
  • 9-23 Codex CLI rust-v0.156.1 把 Sol / Luna 加进 model picker,rate-limit 切换提示开始推荐 Luna
  • 9-25 Codex CLI rust-v0.157.0 加 Amazon Bedrock 路由
所以不是「Anthropic 出牌一小时后 OpenAI 静默跟上」。是同日发布,有正式公告;进 Codex CLI 则是三天后的 v0.157.0,而且 Bedrock 这一段 OpenAI 9-22 的公告里压根没写,是 Codex 自己加的。

国内几家的标题也都写成「同日」——21 世纪经济报道、澎湃、时代周报,口径一致。

二、通篇讲成本曲线,却没写 Sol 的价

这是最可惜的一处。GPT-6 Sol 的标准价(≤272K 输入):

  • 输入 $2 / 百万
  • 输出 $10 / 百万
  • 缓存读 $0.20 / 百万
对上 Opus 5.5 的 $4 / $20 / $0.20——前两项正好一半,第三项完全一样。

真正把编码 Agent 成本曲线掰弯的是这个,不是 Anthropic 那 20%。原帖把 OpenAI 那一栏留成了空白。

还有个反直觉的:超过 272K 输入,Sol 跳到 $4 / $15 / $0.40。长上下文档位 Sol 的缓存读比 Opus 5.5 贵一倍,而 Opus 5.5 在 1M 全程一个价。

(另外,OpenAI 那 50% 的降幅基准是 GPT-5.6 的促销价,不是原价。这个口径值得单独标一下。)

Luna 更狠:输入 $0.10、缓存读 $0.01、输出 $0.50。上一代 Luna 是 $0.2 / $1.2,输出降了 58%。

三、Sol 不是旗舰

原帖写「Sol 是旗舰主力」。OpenAI 的原话是「GPT-6 Astra 仍然是其各方面表现最佳的模型」,Sol 的定位低于 Astra,面向代码编写这类复杂度更高的任务;Luna 面向高吞吐(信息提取、文档摘要)。Astra / Sol / Luna 是三档产品矩阵。

顺带一条:免费与 Go 档用户可在桌面应用里使用 GPT-6 Luna。

四、默认降档那一节,补上具体分档

楼上已经指出「40% 里有一部分是默认档调低一档送的」。Artificial Analysis v4.3.2 的分档实测数在这:

  • medium(默认):Index 51.2 / 单任务 $1.34 / 输出 25.7k token / GDPval-AA 1576
  • max(宣传档):Index 58 / 单任务 $5.98 / 输出 119k token / GDPval-AA 1846
Anthropic 发布表里那组漂亮数字(Terminal-Bench 66.4%、GDPval 1846、AA 58)全是 max 档。默认档是另一组数,差 7 个 Index 点、270 个 Elo 点。

五、max 档不是「持平」,是略贵

原帖写「单任务加权成本和 Opus 5 几乎持平」。AA 给的是两个数:$5.98 对 $5.86。

Opus 5.5 反而贵 2%。

六、五项退步

Vals AI 的回归记分卡,Fable 5.1 → Opus 5.5:

  • MedCode 63.6 → 49.8(−13.8)
  • Public Benefits Bench 76.9 → 70.6(−6.3)
  • Legal Research 55.3 → 50.5(−4.8)
  • Tax Agent Bench 75.1 → 70.5(−4.6)
  • HLAB 6.7 → 3.8(−2.9)
原帖通篇只讲进步,这五项一个字没提。

七、第三方里最支持「降本」的那条,原帖也没用

Perplexity 的 WANDR:Fable 5.1 得 0.601,Opus 5.5 得 0.610——分数几乎没动,单任务成本却从 $12.76 掉到 $4.13,降了 67.6%。

这是第三方口径里对「成本下降」最有力的一条佐证,比 Anthropic 自报更有分量。

八、三处小订正

  • 原帖说三家云「AWS Bedrock、Google Cloud、Microsoft Azure」。官方与第三方口径里第三家叫 Microsoft Foundry。
  • 原帖说生物与网络安全请求「回落 Opus 4.8」。系统卡实际是:生物类回落 Opus 5,网络安全类回落 Opus 4.8,另有一个前沿 LLM 开发分类器也回落 Opus 5。
  • Terminal-Bench 4.0:Anthropic 自报 66.4%,Artificial Analysis 自己的 harness 跑出来是 59.6%(xhigh)。两把尺差 6.8 个点,引用时最好带上是谁的 harness。

九、一个迁移坑,帖里没写

tool_choice 设 any 或具名强制工具,在 Opus 5.5 上会直接 HTTP 400;thinking 设 disabled 或固定 budget 同样 400。老代码里凡是强制工具选择的,都得改成 auto 或结构化输出。

十、对得上的部分

定价表(4 / 20 / 0.20,缓存读降 60%)、1M 上下文与 128K 输出、GDPval-AA v2.1 的 1846 Elo、AA Index 58、max 档约 119k 输出 token、自适应思考强制、thinking blocks 绑定会话——这些我都核到了,与官方及 AA 公开数据一致。

一句话

价格是真降了,但降的是哪一档、跟谁比、在什么缓存命中率下——三件事都写清楚,才叫降。而同一天另一张价目表上,输出那一栏写的是 10。

暂无表态