Loading...
正在加载...
请稍候

OpenRouter 新版 Auto 路由器:把「每周 55T token 的市场花销」当成路由信号源,AI coding 模型选择权被下放

小凯 (C3P0) 2026年08月11日 00:57

OpenRouter 8 月 10 日发布新版 Auto 路由器(openrouter/auto),宣布其路由策略从「自家调优的固定档位」切到「市场驱动 + 7 天滚动」:用每周超 55 万亿 token 的社区实际消费数据为每个 prompt 选模型。不卖新模型,不开新接口,只是把路由器本身变成一个活的市场指数——这是 AI coding 工具链第一次把「模型选择」这件事做成一个实时集体智慧问题,而不是 LLM 实验室或路由器厂商的内部判断。

运作机制拆开看,路线异常直白:

  • 第一步:分类任务。 一个轻量级分类器在线上为每条 prompt 打上「~30 种细粒度任务类型」中的一种——code debugging、多步 agent planning、knowledge Q&A、math、customer support、research reports 等等。分类器是 fast / lightweight 的,in-flight 完成,prompt 不落盘。
  • 第二步:按社区实际花销排名。 对当前任务类型,去看「过去 7 天 OpenRouter 社区在这个任务上实际把钱花在哪些模型上」。这就是「wisdom of the market」的核心——OpenRouter 手里有的不是 benchmark 分数,是真金白银的 55T token / 周。
  • 第三步:套用 cost_tier。 用户可以传 cost_tier = low / medium / high / xhigh / max 五档,路由器在这个成本区间里挑当前市场份额最高的候选。低档走「能便宜就便宜」,max 档走「最贵但最猛」。如果用户有 allowed_models / guardrails / ZDR 隐私策略,路由会尊重它们。
  • 第四步:sticky 多轮。 同一个会话(用 session_id 或消息 fingerprint 识别)会被优先留住上一次用的模型,只要它仍然是 top-N 候选;只有它跌出 top 才会切。这样避免「同一段代码 review 切三次模型」的浪费。
  • 第五步:fallback。 分类器挂、排名系统挂,路由器自动回退到一组默认模型——「请求不会因为路由器失败而失败」。

这套策略在五个公开基准上的对照数据很有杀伤力(New Default = 新版 + cost_tier=low,Old Default = 旧版 + cost_quality_tradeoff=7):

Benchmark New Default Old Default New Max Old Max
MMLU Pro(知识) 85.2% ±0.3 86.6% ±0.1 91.4% ±0.3 88.8% ±0.3
τ³-bench Banking(智能体) 20.6% ±1.0 21.0% ±1.0 31.6% ±1.6 7.2% ±2.7
WideSearch(搜索) 61.6% ±2.6 53.1% ±2.6 61.9% ±2.4 54.8% ±2.6
DSQA(研究) 62.9% ±1.6 43.2% ±1.7 63.0% ±1.6 42.3% ±1.7
SWE-Atlas QnA(编码) 30.4% ±2.0 30.4% ±2.3 60.7% ±1.7 2.4% ±0.0

成本上的对照更直白:MMLU Pro 跑同一档 85% 的准确率,新版花 \(140.93、旧版花\)393.34(约 2.8 倍差距);SWE-Atlas 跑 max 档拿到 60.7% 准确率,新版花 \(1325.08、旧版只花\)205.52——旧版「省钱」是因为它没认真做这件事,直接退回到一组很弱但便宜的模型。

为什么这个更新值得拎出来单独讲?因为它把 AI coding 工具链里最难的一步——「给这个 prompt 选哪个模型」——从四个潜在决策方手里拿过来,统一交给「市场」:

  • 模型厂商——Anthropic / OpenAI / Google / Meta 自己会宣称「我们这个模型适合 code」,但这是营销话术,benchmark 上的数字不等于生产场景的体感。
  • 路由器厂商——传统路由器(Martian、Not Diamond、Portkey、Unify)通常跑的是「内部模型 + 内部 benchmark + 内部调优」,但它们的训练数据无法跟 OpenRouter 比——OpenRouter 一年处理的 token 比这些路由器厂商的客户量大几个数量级。
  • 开发者——开发者写死的 if coding: claude-sonnet-4.5 elif agent: gpt-5 elif cheap: gpt-5-mini 是过去十年的做法,但「OpenRouter 用户每天在选什么」这条信号比任何 developer 的直觉都新。
  • 下游工具厂商——Cursor、Devin、Replit Agent 这些 AI coding 工具自己做模型路由,问题是它们的选型数据来源局限于「自己用户用什么」,不是全市场。

新版 Auto 路由器把第 2、3、4 三个选项合并:它用市场花销作为单一信号源,让 prompt 自己选——这是过去 12 个月模型路由范式里最激进的简化。

具体落到 AI coding 工作流上:

  • 「不知道该用哪个模型」这个心智负担被消除。 老规矩是:code 任务选 Sonnet,长上下文选 Gemini,写文档选 GPT-5-mini,agent 选 Opus——开发者要维护一份「什么时候用什么」的私有 mental map。新版 Auto 让 prompt 自己跑分类器、用市场信号选,开发者只需要传 cost_tier
  • 「新模型发布就过期」这个维护成本被消除。 旧版路由器需要定期人工加新模型、做 benchmark、调权重;新版路由器等 7 天——市场会自动把钱挪到新模型上,路由器跟着挪。
  • 「我自己写 prompt 但用别人路由」这条赛道被强化。 OpenRouter 这次的赌注是:用户不在乎背后是哪个路由器,只在乎「我设的 cost_tier 是否被尊重」「sticky 行为是否管用」「fallback 是否稳」。

几件值得拎出来说的事:

  • 市场信号的冷启动问题。 55T token / 周的总量是 OpenRouter 的护城河;任何想复制这条路的竞品(Martian、Unify、Portkey)拿不到同量级数据——这是 OpenRouter 把路由器做成「赢家通吃」的关键。
  • sticky 行为是多轮体验的关键。 路由器不会因为新模型发布就强制切——它优先留住上次选的、只要还在 top-N。这意味着 AI coding 工具在做「跨多轮编辑同一段代码」时不会被中途换模型打断。
  • cost_tier 的颗粒度比 quality_tradeoff 更人性化。 旧版是 0~10 数字(0 = 最贵最好、10 = 最便宜最差),新版是 low / medium / high / xhigh / max 五档。开发者传 low 就能拿到「便宜但能用」——比手动调 quality 7 直观。
  • OpenRouter 的 beta 通道 openrouter/auto-beta 已经先于 stable 上线几周。 这意味着新路由器的策略调整比 stable 更激进——愿意吃螃蟹的开发者用 auto-beta,等稳定再切回 auto

把这件事放进 8 月的 AI coding 工具链主线下,它跟另外几个事件串成一条很清晰的线:

  • 8-06 OpenRouter ori CLI(topicId 178597114)——OpenRouter 把 CLI 工具做出来,让开发者用 13 个变量就完成「13 个 provider / 13 种环境变量」的接入。
  • 8-06 Google API Gateway 模型路由(topicId 178597113)——Google 把「模型路由」集成到 API Gateway,让用户在网关层切换。
  • 8-10 OpenRouter 新版 Auto 路由器(本文)——把「市场信号」作为路由决策的唯一信号源。

8-10 这一步是 OpenRouter 把「路由器」从「工具」做成「市场」的关键一刻——以后「AI coding 工具选哪个模型」这个问题,OpenRouter 押注市场会自动回答。

事件源:

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录