十分之一的价格,一份算不过来的账:Claude Haiku 5.5 把子智能体变成了成本选项

Anthropic 在 10 月 7 日推出 Claude Haiku 5.5,官方定价表里,提示词不超过 10 万 token 时输入每百万 token 0.10 美元、输出 0.50 美元。上一代 Haiku 4.5 是 1 美元和 5 美元,两档都没有。Anthropic 说平均运行成本降约 75%,理由是他们…

目录
  1. 🤖 一个便宜十倍的小模型,和一笔算不过来的账
  2. 🧾 能力这一栏,跳跃比降价更大
  3. 🔀 价格结构的两个变化,比降价更影响架构
  4. 🛡️ 安全这一栏跟着能力一起挪了位置

🤖 一个便宜十倍的小模型,和一笔算不过来的账

十倍。这是个容易让人停一下的数字。

Anthropic 在 10 月 7 日推出 Claude Haiku 5.5,官方定价表里,提示词不超过 10 万 token 时输入每百万 token 0.10 美元、输出 0.50 美元。上一代 Haiku 4.5 是 1 美元和 5 美元,两档都没有。Anthropic 说平均运行成本降约 75%,理由是他们自家约 90% 的历史请求落在 10 万 token 以内。

真正值得琢磨的是另一半账单。Simon Willison 在发布当天测了同一个长提示词,得到的 token 数约为 Haiku 4.5 的 1.25 倍。Anthropic 自己承认换分词器会让单任务 token 变多,参照 Opus 4.x 时代约 30% 的涨幅。他们说 75% 这个数已经算进去了。

【推论】一张价格表和一个分词器之间的距离,就是这轮定价战争里被最少讨论的那一段。

🧾 能力这一栏,跳跃比降价更大

基准Haiku 5.5Haiku 4.5GPT-6 Luna
Terminal-Bench 4.039.2%0未给
OSWorld 2.1 离线子集72.4%15.7%48.9%
Humanity's Last Exam 无工具45.9%10.2%未给
Humanity's Last Exam 带工具57.4%18.7%未给
GDPval-AA v2.11620735未给
表里要说清一件事:Haiku 5.5 在自己家表格上全面压过 GPT-6 Luna,但 Artificial Analysis 给它的 Intelligence Index 是 43 或 43.4,Terminal-Bench 4.0 在该机构口径下记 32.8%。同一项基准两个数字,来源不同。

Anthropic 自己划了边界:Sonnet 5.5 和 Opus 5.5 仍是复杂智能体编码任务的更好选择。Haiku 5.5 的定位是摘要与上下文压缩,外加分类、数据库查询、客服这类活,以及子智能体。

🔀 价格结构的两个变化,比降价更影响架构

Sonnet 5.5 的缓存读取价从 0.20 美元砍到 0.10 美元。Anthropic 估计这让多数智能体任务成本降约 20%,理由是缓存读取占模型 token 消耗很大一块。

Haiku 5.5 是 Haiku 系列第一个带 effort 调节的模型。但 Willison 报告说推理关不掉,默认 effort 是 medium。他实测同一个画图提示词:low effort 约 7 秒、成本不到 0.1 美分;max effort 略超 5 分钟、约 3.4 美分。

【推论】同一档模型在 effort 两端差 34 倍时间、差 30 倍以上成本,架构上的含义是:让大模型做判断,让小模型做可以标注成本的重活。

订阅侧同时发了月度 API 额度:Max 5x 每月 100 美元,Max 20x 每月 200 美元,Team 池子最高 500 美元,不累积。Python 和 TypeScript SDK 加了 computer use 与 browser use 的 beta。

🛡️ 安全这一栏跟着能力一起挪了位置

Anthropic 说 Haiku 5.5 在几乎所有对齐评估上都明显好于 4.5,misaligned 行为更少,更不愿配合滥用。网络安全防护比 4.5 更严,比 Sonnet 5.5 略松:允许更宽的防御性任务,仍拦渗透测试。生物防护的严格程度与 Sonnet 5 相同,Sonnet 5.5 和 Opus 5 也是这一档。

早期客户报的数字如下。三家都是自家场景,无第三方复现,也没有对照的负载描述。

客户报了什么
Asana任务完成延迟降低 30% 以上
CognitionHaiku 5.5 副手配 Opus 5.5 主手跑 Devin Fusion,FrontierCode 66.2 分
Box比 Haiku 4.5 高 11 分,延迟约减半
模型 ID 是 claude-haiku-5-5,上下文 100 万 token。

信源与限定:价格、基准、安全评估、额度与 SDK 来自 Anthropic 官方发布页。分词器 1.25 倍与 effort 实测来自 Simon Willison 的发布日测试。Asana 报延迟降 30% 以上,Cognition 报 FrontierCode 66.2 分,Box 报高 11 分且延迟约减半,这三家数字均为客户自述,无第三方复现。Haiku 5.5 未开源。

一句话:这轮定价把「子智能体」从一个架构技巧变成一个成本可算的选项,而分词器决定了这笔账最后能不能真省下来。

👍 1

想参与讨论或点赞?登录后使用完整功能

讨论回复(0)

暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens