同一个 agent 任务跑两遍,API 账单能差多少?答案:30 倍。这不是标题党,是论文转引 Bai et al. 2026 的实测——同一任务的不同执行,token 消耗可以差出一个数量级还多。
原因藏在工作方式里。agent 每走一步都可能触发新的模型调用,而前几步留下的上下文,会变成后面每一次调用的输入。早一步多生成一段话,后面十次调用的输入就各多一段。上下文不是一次性支出,是复利债务。再叠加模型的随机行为——同输入可以走出不同路径、重试不同轮数——账单在开跑之前就是不可预测的。
中山大学、RPI、东南大学和港科大的 TokenCast(arXiv 2609.35760)就是给这个债做预测的:11,712 条执行轨迹、240 个任务、6 个 agent 模型、4 个基准(SWE-bench Verified、Search-R1、MMLU-Pro、LongBench-v2),代码开源。
核心机制:把成本从加法改成组合
传统预测为什么失效?因为它们把各步成本当独立项加总。TokenCast 的做法是给每段执行记三个数:自己花掉多少、上下文增长多少、起点偏移多少。组合公式里最关键的是第三项——后面每段都要把前面段引入的上下文重读一遍,这项就是重读税。一段话总结:你早期欠下的上下文,后面每次调用都在替你还利息。
预测器本体出乎意料地朴素:LightGBM。单次推理 0.8 毫秒,全管线(特征提取加组合)一次任务累计 32.8 毫秒,不花一分钱 API 调用。用树模型预测大模型的花销,这件事本身值得想一下:agent 怎么花钱,是可学习的。
先对账
素材里的数字逐条对了论文:30 倍 ✓(转引 Bai et al.,标注)、组合式成本表示 ✓、零额外 LLM 调用 ✓、32.8 ms ✓、MAE 降 14.5%(96 组合平均)✓、省 21.3% ✓。数字全对,这自媒体的转述保真度不低。但有三处选择性强调,论文自己的表格里都印着:
第一处,14.5% 是被挑着看的。 论文按四个预测时点拆开报:任务开跑前(Task Start)平均 −2.2%,比最强基线倒输;每次调用开始 +1.9%,基本打平;生成中滚动更新 +30.4%;任务中途更新 +27.8%。平均 14.5% 全靠后两格拉起来的。也就是说:事前预测它不赢,执行中修正它大赢。而付账单的人恰恰最想要事前预测。本号在硬件事件研究里记过一句「跑分是断言,日用是执行」,这里是同构的成本版:跑分格输,日用格赢。
第二处,21.3% 有两个限定。 一是离线回放:288 个 GPT-5.4 轨迹,按七档预算做停止规则实验,不是线上真实干预;二是论文自己在脚注里写明「回放不测任务是否真正解决」——素材说的「完全不牺牲任务完成率」,其中的「完成」是到达记录终点,不是把问题做对。主动把这些预测接进运行时做实时干预,论文原话是 future work。
第三处,32.8 ms 的口径。 是一次任务全程预测的累计时间,不是单次响应延迟。说毫秒级没错,但不是「每步都快」,是「整场便宜」。
接主线
三条线接上。其一,接口税账本里记过 KV cache 暴政——换模型等于换接口,前缀税重付;TokenCast 量化的是同一任务内的前缀税复利,两者是同一物理直觉的静态版和动态版。其二,ripwire 案把「请求级预算参数」定为接口税定价学第四格——ask for rather than discover;TokenCast 等于给这个参数装了仪表盘,你终于能 ask 了。其三,验证带宽经济学:预测本身 32.8 毫秒、零 token,这份几乎免费的账本让失控变得可预知——最便宜的控制,是提前知道哪一次要失控。
可打脸预测:十二个月内,主流 agent 框架会内置成本预测与停止规则,暴露成类似 max_estimated_cost 的请求参数——如果没发生,说明成本不可预测对用户而言还不够痛。
结尾停在 30 倍本身。方差不是噪声,是行为不可预测的影子:模型多试一轮、多读一个文件,账单就翻倍。预测器消灭不了方差,但把「失控」从账单上不可知的部分,挪到了开跑前就能看见的部分。省 21.3% 只是副产品,真正的交付是让预算从撞墙变成导航。
信源:论文全文(arXiv 2609.35760v2,摘要/四象限数据/公式 1/Table 3/LightGBM 对比/预算回放章节逐段核对)、GitHub 仓库(DEFENSE-SEU/TokenCast)。30 倍为论文转引 Bai et al. 2026。素材「完全不牺牲任务完成率」与「自动化熔断」按论文口径裁决为选择性强调。发布于 2026-10-06。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。