Loading...
正在加载...
请稍候

Nvidia 开源 SoL-Pi:让编码智能体自己给自己省钱

QianXun • 2026年09月26日 23:31

凌晨三点,你的编码智能体还在干活。它改一个文件,跑一遍测试,读一遍报错,再改,再跑。第二天早上账单出来,数字停在 1339 美元。任务做完了,分数也不差,可这个价钱请一个外包工程师都绰绰有余。

2026 年 9 月底,Nvidia 把一套针对这个问题的方案开源了,名叫 SoL-Pi,MIT 协议。它回答的问题很直接:编码智能体烧掉的 token 里,有多少是真花在解题上,有多少纯属浪费。

它是什么

SoL-Pi 的本体是一层测试驱动的自动优化。模型不动,提示词不大改,它盯的是智能体跑任务的整个过程,把其中不产生价值的部分剪掉。剪掉的依据来自测试框架,每一轮改动都要过测试,省下的 token 必须换来不掉分的结果,否则这条优化不成立。

整套系统在 535 个环境里调出来,覆盖 152 个优化方向,跑了 3000 多次运行。工程量摆在这里,它已经不是几个小技巧的拼盘。

四种机制,各砍一段浪费

它的四种机制各管一段,从动作层一路管到记忆层。

  • 动作融合:智能体经常重复做同类操作,把这些动作合并,少发几轮请求。
  • 在线上下文压缩:上下文窗口边跑边瘦身,不等到塞爆才动手。
  • ObservationPack:从终端输出到测试结果,观测流压缩成更小的形态再喂回模型。
  • 证据保留归约器:删历史时有原则,结论和证据留下,过程性文本清掉,防止下一轮从头查起。

数字

评测用的是 EdgeBench,51 项任务,其中 11 项用于验证,40 项用于最终评估。官方口径如下。

  • token 用量下降 44.7% 到 49%
  • Pi 分数保留 93.7%
  • 单一机制开到最强,还能带来 5.3% 的分数提升

省下的钱按小时算更直观。

  • 对比原生 Codex 与 Claude Code:每小时省 8.75 到 13.50 美元
  • 对比 Pi 这个已经做过优化的基线:每小时再省 4.36 到 5.71 美元
  • 那张 1339 美元的账单,同样的活降到 894 美元
对比对象 每小时节省
原生 Codex / Claude Code 8.75 – 13.50 美元
Pi(已优化基线) 4.36 – 5.71 美元

换个模型还行吗

团队用 GPT-5.6 Sol 构建整套优化流程,然后原样迁移到 Opus 5,效果保留 94.3%。这一点值得多看一眼,它优化的对象是流程本身,换模型不必从头调一遍。对同时维护多条模型线的团队来说,这个性质的实用价值可能超过省下的 token。

不全是好消息

评测里的三组结果参差,官方没有藏。

  • Terminal-Bench 4:18 个任务完成 15 个,成本降 25%
  • Lean4 奥数:6 个任务拿下 3 个,但拿下的都是最便宜的解法
  • swarm 内核:成本降 26.8%,效果反而是几组里最好的

数学证明类任务的 token 密度太高,压缩空间天然有限,这个结果符合预期。把它当万能开关会失望,当默认可开的省钱层,多数场景成立。

为什么值得关注

智能体的成本结构里,token 是最大头。上游模型每一次提价或限速,都在放大流程浪费的代价。SoL-Pi 给出了一条上游之外的省钱路径,不改模型,改流程。

还有一层生意逻辑可以放在心里。Nvidia 不卖编码模型,它卖算力和工程能力。流程层开源出去,生态里跑的每一个编码智能体都更便宜、更快、更离不开 GPU。省钱和卖铲子,在这套方案里是同一件事。

回到凌晨三点那个场景。同样的活,账单从 1339 美元变成 894 美元,分数几乎没动。省下的 445 美元没有魔法,它只是把智能体每一次重复的弯路折了回去。智能体时代的成本战争,第一枪打在了流程层。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录