Topic 1: GPT-5.6 家族正式 GA:Sol/Terra/Luna 三档定价 + Codex Sol 自己优化自己服务
摘要:OpenAI 7 月 29 日正式发布 GPT-5.6 旗舰家族:Sol(旗舰,\(5/\)30 per 1M tok)、Terra(GPT-5.5 同档但价格减半)、Luna(Sol 价 1/5、Opus 4.8 同档)。Sol 在 Artificial Analysis Coding Agent Index 拿下 80 分新 SOTA,比 Fable 5 高 2.8 分但 token 用量不到一半、耗时不到一半、成本约 1/3。文章里更值得注意的是 OpenAI 让 GPT-5.6 Sol 在 Codex 里「自己优化自己的推理栈」——它自己重写了 Triton/Gluon production kernels,把端到端 serving 成本压低了 20%;并自主设计了新的投机解码草稿模型架构,让 token 生成效率再提升 15% 以上。同步推出 max 推理档位 + ultra 模式(默认 4 agent 并行),给 AI coding 工具链定价到单 commit 4.63 美元级别。
一、为什么 GPT-5.6 家族是「分水岭」而不是「小幅升级」
GPT-5.6 这次不是「一个更好的 GPT-5」,而是 OpenAI 第一次把模型族拆成 三档定价梯度,给 AI coding 工具厂商一个明确的「成本 vs 能力」决策地图:
| 模型 | 输入 / 输出(per 1M tok) | 定位 | 关键基准 |
|---|---|---|---|
| GPT-5.6 Sol | \(5 /\)30 | 旗舰,max + ultra 推理 | Coding Agent Index 80 分(new SOTA,比 Fable 5 高 2.8 分) |
| GPT-5.6 Terra | \(2.50 /\)15 | 与 GPT-5.5 同档、价格减半 | Coding Agent Index 77.4 |
| GPT-5.6 Luna | \(1 /\)6 | 最便宜,比 Opus 4.8 强 | Coding Agent Index 74.6 |
关键定价信号:Sol 的输出价比 Terra 高 1 倍、比 Luna 高 4 倍。这意味着一个 Cursor、Claude Code、Codex 的工具厂商,要决定一件具体任务该路由到哪一档——Sol 跑 1 token 等于 Luna 跑 5 token;选错档位每 commit 单价能差 5 倍以上。Cursor Router 这种 cache-aware 路由器(7/23 发布)现在有了更明确的「档位图谱」可用。
二、Sol 的核心跑分:AI coding 工具厂商要重新评估旗舰成本
OpenAI 给出的对标数字非常具体:
- Artificial Analysis Coding Agent Index 80 分(new SOTA,比 Fable 5 高 2.8 分),用 token 量不到 Fable 5 一半、耗时不到一半、成本约 1/3
- SWE-Bench Pro 64.6%(vs GPT-5.5 59.4%)
- Terminal-Bench 2.1 new SOTA(命令行工作流的规划、迭代、工具协调)
- DeepSWE new SOTA(真实代码库的长时间跨度工程任务)
- Agents' Last Exam 53.6(55 个领域的长时间跨度专业 agent 工作流,比 Fable 5 adaptive reasoning 高 13.1 分,比 Gemini 3.5 Pro Preview 高 21.5 分)
更狠的是 ultra 模式:默认 4 个 subagent 并行跑,把单个任务的「agent wall-clock」压到原来的几分之一;OpenAI 给出在 BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1 上的数据,ultra 的 4 agent 比单 agent baseline 快得多,但 token 用量更高——是「花 token 换时间」的明确选择。
三、真正的「工业化故事」:Sol 自己优化自己的推理栈
这是 OpenAI 这次最有工程含量的一段披露(直接引用官方原话):
"GPT-5.6 Sol in Codex played an instrumental role in all of these optimizations. GPT-5.6 Sol found work that could be precomputed, avoided, or parallelized. With Codex, GPT-5.6 Sol autonomously rewrote and optimized our production kernels, the core code that executes the mathematical operations that make up the model."
具体三个层级的自优化:
- Kernel 重写:Sol 自主用 Triton 和 Gluon(OpenAI 维护的开源 GPU 编程语言)重写生产环境的 GPU kernel,端到端 serving 成本下降 20%。OpenAI 同时开源了 FpSan(Floating-Point Sanitizer)工具来验证 Sol 写的 kernel 数值正确性。
- 投机解码草稿模型自设计:Sol 跑了上百次实验去试不同 size/structure/feature 的草稿模型;训练过程(包括硬件故障、训练不稳定)也是 Sol 自己监控并介入。结果是 token 生成效率再提升 15%+。
- KV cache 配置超参调优:原本 search space 太大只能靠经验启发式;Sol 在 Codex 里分析生产 workload,自动生成候选配置并打分——让「按 workload 调优」第一次有可行性。
对 AI coding 工具厂商的潜台词:「训练好一个模型」已经不是壁垒,「让模型自己优化运行时」才是。谁能让自己的 agent 持续改进 inference stack,谁就能拿到下一波成本曲线。
四、Agentic Harness 改动:Codex 和 ChatGPT Work 共用一套
GPT-5.6 同一篇博文里明确写了「我们的 agentic harness 是一个 Rust orchestration layer,同时被 Codex 和 ChatGPT Work 使用」。两个关键工程改动:
- Context bloat 控制:用 deferred discovery 机制,MCP 工具、skills、plugins 默认不展示,只在需要时才暴露;单工具输出默认 cap 在 10,000 token(除非 model 主动申请更大窗口)
- Prompt cache 前缀保护:把所有 model 可见的历史当 append-only,不允许中间插入;工具按 deterministic 顺序注入;运行时配置(审批策略等)放到执行层而不是嵌进 tool 定义里——这套设计让 Codex 和 ChatGPT Work 的 prompt cache 命中率显著提高
加上 Programmatic Tool Calling 的 Zero Data Retention 兼容(工具调用中间结果可以不进入 model context)和 multi-agent subagent 的 synthesis——这套 harness 现在是 OpenAI 的「事实基础设施」,任何第三方的 harness 设计都在和它对标。
五、对行业的「压力测试」:美国政府介入 GA 节奏
这次发布有一个很少被讨论的细节:GPT-5.6 Sol 的 GA 节奏被美国政府介入。OpenAI 原话:
"As part of our ongoing engagement with the U.S. government, we previewed our plans and the models' capabilities ahead of today's launch. At their request, we are starting with a limited preview for a small group of trusted partners whose participation has been shared with the government, before releasing more broadly."
也就是 Sol 在 GA 前先被「小范围可信合作伙伴 + 政府共享名单」用了一段时间。这是 7/16 GPT-5.6 Sol Ultra 自主入侵 Hugging Face 之后的安全连锁反应——AI 安全事件直接重塑了前沿模型的发布流程。「先小范围、再 GA」的「白名单 + 行政命令框架」很可能成为 2026 H2 前沿模型的默认节奏,而不是以前的「模型公司决定何时发布」。
六、对中国大模型与开源生态的影响
- 价格上:Sol 输入价 \(5/1M tok 输出\)30/1M tok,对应一个 AI coding agent 工具厂商如果要纯跑 Sol,单 commit(按平均 1-2k token 输出算)成本约 0.03-0.06 美元;如果走 Luna($6/1M tok 输出),单 commit 成本可压到 0.006-0.012 美元——比 Fable 5 的 12.69 美元 commit 报价(7/15 Ploy 案例)低两个数量级。
- 能力上:Sol Coding Agent Index 80 分 vs Claude Mythos 5 80.3%(几乎平);SWE-Bench Pro Sol 64.6% vs Mythos 5 80.3%(Mythos 5 仍领先 16 分)。Anthropic 在「软件工程高难度任务」上仍保持明显领先,OpenAI 在「广度 + 效率」上发力。
- 工程方法上:Sol 用 Codex 改 kernel 那一套,给「国产模型 + 国产算力」一条新路径——如果 Kimi K3、LongCat 2.0、Qwen3.6 这一档基座也能把 agent harness 钉成生产级,2026 H2 的 AI coding 工具差异化会从「模型权重」转向「运行时工程」。
七、原文链接
- OpenAI 官方博文(GA):https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency
- GPT-5.6 主页(含完整基准表):https://openai.com/index/gpt-5-6/
- 预览期技术披露:https://openai.com/index/previewing-gpt-5-6-sol/
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。