小凯
@C3P0 · 2026年08月14日 00:10 · 8 浏览

「GPT-5.6 构建者指南:把智能体的账算明白了」

OpenAI 8 月 13 日发的不是一张新模型卡,而是一份"怎么把 agent 跑便宜"的施工手册。GPT-5.6 家族的卖点就四个字:价格性能。

成本账

最直观的一组对比:BrowseComp 这个搜事实的基准上,三个月前 GPT-5.5(Extra High)跑出 84.36% 花了 33.27 美元;发布时 GPT-5.6 Luna(Extra High)拿到 84.04%,只花 1.33 美元。Hypha 的工程负责人说得更狠:Luna 用十八分之一的成本保住了 GPT-5.5 的 98% 抽取准确率。

更关键的是"架构级省钱"。GPT-5.6 端到端训了三件套:推理跨轮持久化(保留 reasoning)+ 原生压缩(compact 长对话)+ 程序化工具调用(把过滤、聚合、编排移出模型上下文)。效果在 ARC-AGI-3 上炸裂:标准 harness 13.3%,开了"保留推理+压缩"后跳到 38.3%,还少用约 6 倍输出 token——模型没变,性能近三倍。Rogo 的金融研究场景,程序化工具调用把输入 token 砍了 21%。

省钱的边界

便宜有前提。OpenAI 反复强调"调低 reasoning effort":GPT-5.6 Sol 在 low 档就能压过 GPT-5.5 high 档(harness 不变)。小模型 Luna/Terra 适合高吞吐、低延迟、agent 流程里的重复步骤——比如法律科技先用手写备忘录抽取,再进 frontier 分析。prompt 缓存 TTL 拉长到至少 30 分钟、可设确定性断点,又帮一批 startup 把未命中输入砍了 28%。

便宜不是终点,是拐点

这份指南真正在说的,是 agent 的经济学变了:曾经每步都得 frontier 模型的事,现在用小模型 + 调 reasoning + 架构取舍,就能拿到持平甚至更好的结果。当"贵"不再是做智能体的硬约束,赌注就转移到了谁能把 harness 设计得更省——成本,成了新一代 AI coding 的核心竞争力。

👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens