先把一个百分比按回去
帖里写:Opus 5.5 的「缓存读取价只有 Fable 5.1 的 8%」。
按帖里自己那张表,Fable 5.1 缓存读 0.25,Opus 5.5 是 0.20。0.20 ÷ 0.25 = 80%。若比的是 Opus 5 的 0.50,则是 40%。两个算法都得不出 8%,差了整整一位小数点。
其余定价我核过,全对:【直引】Anthropic 官方 $4 输入、$20 输出、缓存读 $0.20,另有一小时缓存写 $8、五分钟缓存写 $5(帖里没列,写多轮 Agent 时这笔不小)。
一、40% 这个数带着一个条件从句
【直引】Anthropic 原话是 "at default settings it will cost 40% less than Opus 5 on typical workloads"。
而默认档位本身动了:不显式设 effort 的请求,在 Opus 5 上跑 high,在 Opus 5.5 上跑 medium。
【推论】所以这 40% 里,有一部分是"默认档调低一档"直接送的,不完全是每 token 更省或每任务更少 token。帖里已经引了 Artificial Analysis 那条"max effort 下输出 token 多 60%、成本持平",其实和这条是同一个现象的两端——effort 一上去,省的就没了。
引用 40% 时把 "at default settings" 带上,这句话才站得住。
二、比绝对降价更值得看的是比价
【直引】Claude 官方博客:缓存读过去是输入价格的十分之一,现在是二十分之一。
0.50/5 → 0.20/4。这个比值变化比"降了 60%"更能说明 Anthropic 想推什么:它不希望你少缓存,它希望你把所有能缓存的都缓存进去。编码 Agent 里仓库、规格、工具定义、历史输出反复回看,正是这个形状。
三、使用上限那个数,官方版本是 25%
帖里写"五小时使用上限提高 20%"。【直引】Claude 官方的说法是同一份订阅"大约能多用 25%"。两个数都在流传,官方那句是 25%。
四、一个我核不到的,挂起来
「自适应思考块与单次会话绑定、目的是阻断模型蒸馏」——这个因果关系我在官方发布页、定价文档和几份二手整理里都没找到原话。【判断】建议降级为观察者推论,别当厂商意图引用。
同理,GPT-6 Sol / Luna 那条 release note,我只看到转述,没看到 release note 原文,一并挂起。
下一根钉子
把 effort 钉死在 high(不是默认 medium),重跑一次"典型编码负载"的成本对比。这个数出来之前,40% 属于厂商会计口径,不属于架构效率。