OpenRouter 新版 Auto 路由器:把「每周 55T token 的市场花销」当成路由信号源,AI coding 模型选择权被下放
OpenRouter 8 月 10 日发布新版 Auto 路由器(openrouter/auto),宣布其路由策略从「自家调优的固定档位」切到「市场驱动 + 7 天滚动」:用每周超 55 万亿 token 的社区实际消费数据为每个 prompt 选模型。不卖新模型,不开新接口,只是把路由器本身变成一个活的市场指数——这是 AI coding 工具链第一次把「模型选择」这件事做成一个实时集体智慧问题,而不是 LLM 实验室或路由器厂商的内部判断。
运作机制拆开看,路线异常直白:
- 第一步:分类任务。 一个轻量级分类器在线上为每条 prompt 打上「~30 种细粒度任务类型」中的一种——code debugging、多步 agent planning、knowledge Q&A、math、customer support、research reports 等等。分类器是 fast / lightweight 的,in-flight 完成,prompt 不落盘。
- 第二步:按社区实际花销排名。 对当前任务类型,去看「过去 7 天 OpenRouter 社区在这个任务上实际把钱花在哪些模型上」。这就是「wisdom of the market」的核心——OpenRouter 手里有的不是 benchmark 分数,是真金白银的 55T token / 周。
- 第三步:套用 cost_tier。 用户可以传
cost_tier = low / medium / high / xhigh / max五档,路由器在这个成本区间里挑当前市场份额最高的候选。低档走「能便宜就便宜」,max 档走「最贵但最猛」。如果用户有 allowed_models / guardrails / ZDR 隐私策略,路由会尊重它们。 - 第四步:sticky 多轮。 同一个会话(用 session_id 或消息 fingerprint 识别)会被优先留住上一次用的模型,只要它仍然是 top-N 候选;只有它跌出 top 才会切。这样避免「同一段代码 review 切三次模型」的浪费。
- 第五步:fallback。 分类器挂、排名系统挂,路由器自动回退到一组默认模型——「请求不会因为路由器失败而失败」。
cost_tier=low,Old Default = 旧版 + cost_quality_tradeoff=7):| Benchmark | New Default | Old Default | New Max | Old Max |
|---|---|---|---|---|
| MMLU Pro(知识) | 85.2% ±0.3 | 86.6% ±0.1 | 91.4% ±0.3 | 88.8% ±0.3 |
| τ³-bench Banking(智能体) | 20.6% ±1.0 | 21.0% ±1.0 | 31.6% ±1.6 | 7.2% ±2.7 |
| WideSearch(搜索) | 61.6% ±2.6 | 53.1% ±2.6 | 61.9% ±2.4 | 54.8% ±2.6 |
| DSQA(研究) | 62.9% ±1.6 | 43.2% ±1.7 | 63.0% ±1.6 | 42.3% ±1.7 |
| SWE-Atlas QnA(编码) | 30.4% ±2.0 | 30.4% ±2.3 | 60.7% ±1.7 | 2.4% ±0.0 |
为什么这个更新值得拎出来单独讲?因为它把 AI coding 工具链里最难的一步——「给这个 prompt 选哪个模型」——从四个潜在决策方手里拿过来,统一交给「市场」:
- 模型厂商——Anthropic / OpenAI / Google / Meta 自己会宣称「我们这个模型适合 code」,但这是营销话术,benchmark 上的数字不等于生产场景的体感。
- 路由器厂商——传统路由器(Martian、Not Diamond、Portkey、Unify)通常跑的是「内部模型 + 内部 benchmark + 内部调优」,但它们的训练数据无法跟 OpenRouter 比——OpenRouter 一年处理的 token 比这些路由器厂商的客户量大几个数量级。
- 开发者——开发者写死的
if coding: claude-sonnet-4.5 elif agent: gpt-5 elif cheap: gpt-5-mini是过去十年的做法,但「OpenRouter 用户每天在选什么」这条信号比任何 developer 的直觉都新。 - 下游工具厂商——Cursor、Devin、Replit Agent 这些 AI coding 工具自己做模型路由,问题是它们的选型数据来源局限于「自己用户用什么」,不是全市场。
具体落到 AI coding 工作流上:
- 「不知道该用哪个模型」这个心智负担被消除。 老规矩是:code 任务选 Sonnet,长上下文选 Gemini,写文档选 GPT-5-mini,agent 选 Opus——开发者要维护一份「什么时候用什么」的私有 mental map。新版 Auto 让 prompt 自己跑分类器、用市场信号选,开发者只需要传
cost_tier。 - 「新模型发布就过期」这个维护成本被消除。 旧版路由器需要定期人工加新模型、做 benchmark、调权重;新版路由器等 7 天——市场会自动把钱挪到新模型上,路由器跟着挪。
- 「我自己写 prompt 但用别人路由」这条赛道被强化。 OpenRouter 这次的赌注是:用户不在乎背后是哪个路由器,只在乎「我设的
cost_tier是否被尊重」「sticky 行为是否管用」「fallback 是否稳」。
- 市场信号的冷启动问题。 55T token / 周的总量是 OpenRouter 的护城河;任何想复制这条路的竞品(Martian、Unify、Portkey)拿不到同量级数据——这是 OpenRouter 把路由器做成「赢家通吃」的关键。
- sticky 行为是多轮体验的关键。 路由器不会因为新模型发布就强制切——它优先留住上次选的、只要还在 top-N。这意味着 AI coding 工具在做「跨多轮编辑同一段代码」时不会被中途换模型打断。
- cost_tier 的颗粒度比 quality_tradeoff 更人性化。 旧版是 0~10 数字(0 = 最贵最好、10 = 最便宜最差),新版是 low / medium / high / xhigh / max 五档。开发者传
low就能拿到「便宜但能用」——比手动调 quality 7 直观。 - OpenRouter 的 beta 通道
openrouter/auto-beta已经先于 stable 上线几周。 这意味着新路由器的策略调整比 stable 更激进——愿意吃螃蟹的开发者用auto-beta,等稳定再切回auto。
- 8-06 OpenRouter ori CLI(topicId 178597114)——OpenRouter 把 CLI 工具做出来,让开发者用 13 个变量就完成「13 个 provider / 13 种环境变量」的接入。
- 8-06 Google API Gateway 模型路由(topicId 178597113)——Google 把「模型路由」集成到 API Gateway,让用户在网关层切换。
- 8-10 OpenRouter 新版 Auto 路由器(本文)——把「市场信号」作为路由决策的唯一信号源。
事件源:
- OpenRouter 公告:https://openrouter.ai/blog/announcements/introducing-the-new-auto-router
- OpenRouter Auto 路由文档:https://openrouter.ai/docs/guides/routing/routers/auto-router
- OpenRouter Rankings(任务花销页):https://openrouter.ai/rankings#task-spend
- OpenRouter
openrouter/auto模型页:https://openrouter.ai/openrouter/auto - SWE-Atlas QnA 基准:https://github.com/scaleapi/SWE-Atlas
- MMLU Pro 基准:https://github.com/TIGER-Lab/MMLU-Pro