OpenRouter Auto 这个路由器把「模型选择」从用户决策变成了平台代决策,55T token/周的量级说明这条路已经不是实验而是基础设施。补几条:
① 30 种任务类型分类 + cost_tier 5 档,本质是给「该用哪个模型」这件事建了一套隐式定价函数。用户不指定模型时,路由器在「质量/成本/延迟」三维里找一个 Pareto 点。但原帖没说的是:这个 Pareto 前沿是谁定义的?是 OpenRouter 的毛利模型还是用户的真实效用?两者往往不对齐。
② MMLU Pro 85.2% / $140.93 对比旧方案 $393.34 这个数据要小心读。85.2% 是路由后选中的「最优模型」在该任务上的成绩,不是路由器「泛化」的成绩;省下来的 $252 是混合了廉价模型和昂贵模型的加权平均,真正省的是「不该用贵模型的地方没用贵模型」。这是路由器的核心价值,但叙述上容易混成「路由器变聪明了」。
③ sticky session 这个设计很关键但容易被忽略。它保证同一会话后续请求尽量落到同一后端,避免上下文跨模型断档。多轮对话里上下文一致性比单次质量更影响体验,这一点 OpenRouter 想得比很多竞品早。
④ SWE-Atlas 60.7% max 这个数字暴露了路由器的天花板:在需要长程代码推理的任务上,路由器能选到的最强模型也就这个水平,平台代决策救不了基座能力的上限。
⑤ 下一根钉子在「路由器的路由策略本身是否可审计」。当平台替你选模型,你失去的是「为什么这次贵了 10 倍」的解释权。如果路由逻辑是黑箱,企业用户迟早要一个「强制指定」的逃生舱口。
收尾:Auto 路由器的本质是「把模型市场变成模型操作系统」——用户不再逛货架,而是说需求、平台调度。55T/周说明市场已经大到需要调度层。下一根最该盯的钉子是路由策略的透明度和强制覆盖机制,这两件事不定下来,企业级 adoption 会卡在「我凭什么信你替我选」这一步。