凌晨三点,你的编码智能体还在干活。它改一个文件,跑一遍测试,读一遍报错,再改,再跑。第二天早上账单出来,数字停在 1339 美元。任务做完了,分数也不差,可这个价钱请一个外包工程师都绰绰有余。
2026 年 9 月底,Nvidia 把一套针对这个问题的方案开源了,名叫 SoL-Pi,MIT 协议。它回答的问题很直接:编码智能体烧掉的 token 里,有多少是真花在解题上,有多少纯属浪费。
它是什么
SoL-Pi 的本体是一层测试驱动的自动优化。模型不动,提示词不大改,它盯的是智能体跑任务的整个过程,把其中不产生价值的部分剪掉。剪掉的依据来自测试框架,每一轮改动都要过测试,省下的 token 必须换来不掉分的结果,否则这条优化不成立。
整套系统在 535 个环境里调出来,覆盖 152 个优化方向,跑了 3000 多次运行。工程量摆在这里,它已经不是几个小技巧的拼盘。
四种机制,各砍一段浪费
它的四种机制各管一段,从动作层一路管到记忆层。
- 动作融合:智能体经常重复做同类操作,把这些动作合并,少发几轮请求。
- 在线上下文压缩:上下文窗口边跑边瘦身,不等到塞爆才动手。
- ObservationPack:从终端输出到测试结果,观测流压缩成更小的形态再喂回模型。
- 证据保留归约器:删历史时有原则,结论和证据留下,过程性文本清掉,防止下一轮从头查起。
数字
评测用的是 EdgeBench,51 项任务,其中 11 项用于验证,40 项用于最终评估。官方口径如下。
- token 用量下降 44.7% 到 49%
- Pi 分数保留 93.7%
- 单一机制开到最强,还能带来 5.3% 的分数提升
省下的钱按小时算更直观。
- 对比原生 Codex 与 Claude Code:每小时省 8.75 到 13.50 美元
- 对比 Pi 这个已经做过优化的基线:每小时再省 4.36 到 5.71 美元
- 那张 1339 美元的账单,同样的活降到 894 美元
| 对比对象 | 每小时节省 |
|---|---|
| 原生 Codex / Claude Code | 8.75 – 13.50 美元 |
| Pi(已优化基线) | 4.36 – 5.71 美元 |
换个模型还行吗
团队用 GPT-5.6 Sol 构建整套优化流程,然后原样迁移到 Opus 5,效果保留 94.3%。这一点值得多看一眼,它优化的对象是流程本身,换模型不必从头调一遍。对同时维护多条模型线的团队来说,这个性质的实用价值可能超过省下的 token。
不全是好消息
评测里的三组结果参差,官方没有藏。
- Terminal-Bench 4:18 个任务完成 15 个,成本降 25%
- Lean4 奥数:6 个任务拿下 3 个,但拿下的都是最便宜的解法
- swarm 内核:成本降 26.8%,效果反而是几组里最好的
数学证明类任务的 token 密度太高,压缩空间天然有限,这个结果符合预期。把它当万能开关会失望,当默认可开的省钱层,多数场景成立。
为什么值得关注
智能体的成本结构里,token 是最大头。上游模型每一次提价或限速,都在放大流程浪费的代价。SoL-Pi 给出了一条上游之外的省钱路径,不改模型,改流程。
还有一层生意逻辑可以放在心里。Nvidia 不卖编码模型,它卖算力和工程能力。流程层开源出去,生态里跑的每一个编码智能体都更便宜、更快、更离不开 GPU。省钱和卖铲子,在这套方案里是同一件事。
回到凌晨三点那个场景。同样的活,账单从 1339 美元变成 894 美元,分数几乎没动。省下的 445 美元没有魔法,它只是把智能体每一次重复的弯路折了回去。智能体时代的成本战争,第一枪打在了流程层。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。