Loading...
正在加载...
请稍候

Spotify 把 Claude Code 的 token 砍掉九成:一套值得偷的架构,和一次 N=1 的实验

QianXun (QianXun) 2026年09月05日 22:20

你问编码代理一个方法的问题,它把五个文件整个读进上下文。几万 token 进去了,推理没走几步。Spotify 一位首席产品经理 Dimitri Mazmanov 9 月 3 日在工程博客里的判断很直接:"Most of what an AI coding agent does for me isn't thinking. It's I/O."——它干的多数是搬运,不是思考。

搬运,就该按搬运的价钱付费。

这套架构长什么样

他的方案跑在 Spotify Portal 的 AiKA Modes 上。所谓 Mode,官方定义是"跑在临时运行时上的声明式 agent——可以理解成 agent 版的 AWS Lambda":写清指令、挑好模型、挂上工具,剩下交给平台,不留状态、不管基础设施。

真正省钱的是分工。一个叫 shunt 的 Claude Code 插件装了两道确定性钩子:Read 碰到超过 350 行的文件就拦下,cat/head/tail 这类读大文件的命令也会被抓到。被拦下的脏活派给便宜模型(他的例子里是 Gemini 2.5 Flash)去读文件、出摘要;Claude 只拿摘要做推理。调试、架构决策、安全关键代码不外派,原样留给贵模型。博客里一句话说得很清楚:"The plugin decides when to delegate. The mode decides how to respond."

决定权值得单独说。路由由行数阈值拍板,不由任何模型拍板。它笨,但可预测。

作者在自己那个 Java 单仓上跑了四个场景,批量读取类的平均节省"around a whopping 90%"。

钱的背景

单看个人实验没意思,看行业的账。Gartner 的 Peer Insights 调查(经 ComputerWeekly 与 devops.com 转述):23% 的技术负责人报告每开发者每月 token 开销在 200 到 500 美元,约 6% 超过 2000 美元。我拿 2000 美元乘十二个月算了下,一年 2.4 万美元——这还只是 token 账单,没算限额换来的等待。

更狠的预测在 Gartner 今年 6 月的新闻稿里,也是博客原文链接到的那句:到 2028 年,AI 编码成本将超过开发者的平均工资。

站里前阵子聊过 Claude Code 的周限额风暴(178634365 那帖),那是供给侧在收紧;Spotify 这套是需求侧在自救。两头一起挤,架构级的省 token 方案会越来越像标配。

冷水也得泼

九成这个数字,是他一个人、一个仓库、四个场景、只算批量读取的平均值。质量没测。时间跨度没写。他自己承认便宜模型漏了一个隐蔽的线程安全 bug——"Claude spotted it in seconds once given the right context."

HN 上 239 分 151 条评论,最扎的几句都指向同一个地方。tetrisgm:"This is just offshoring but for models."(模型版离岸外包。)gruez:全文没有任何准确率或实际性能数据,好歹跑个 DeepSWE bench。jnwatson 提醒得更实在:token 变少,是因为这部分消耗记到了另一个服务、另一个预算上——总账单没人给你看。

还有一层:Portal 本体是企业级收费产品(Spotify 托管的 Backstage 门户),开源的只有那两个 Claude Code 插件,仓库 7 月 23 日才建,76 颗星。想照抄的人,抄得走钩子和路由,抄不走平台。

【判断】这篇博客真正的贡献,是把模型路由从系统工程题变成配置题——"You don't build infrastructure. You describe what you want and name it."至于九成,那是他的仓库的数字。你的仓库多少,得自己量。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录