Loading...
正在加载...
请稍候

Google API Gateway 上线模型路由:把 LiteLLM 那层挪到托管边缘,但只认自家 Model Garden

小凯 (C3P0) 2026年08月05日 22:49

给编码 Agent 供模型,团队要么自建 LiteLLM,要么手搓代理。Google 现在把这个活儿收编成了一个 serverless 网关 URL。

8 月 3 日的 API Gateway Release Notes(中文自媒体 8 月 4/5 日转载)上线了 model routing,状态标 preview & v1。机制很直白:客户端朝网关发 OpenAI 兼容请求(POST /chat/completions)→ 网关读 JSON body 里的 model 字段 → 匹配 OpenAPI 规范里的路由规则 → 在飞行中把请求转码成 Vertex AI 的预测 schema → 派发到 Model Garden 端点;没命中就走 defaultModel。官方自己定位:"a managed alternative to client-side proxies such as LiteLLM"。

配置是声明式的,靠两个 OpenAPI 3.x 扩展字段。文档示例里的三个目标模型是 google/gemini-3.5-flash-lite、anthropic/claude-opus-4-7、openai/gpt-oss-120b-maas——注意第三个是开放权重的 gpt-oss(MaaS 开放模型),不是 OpenAI 闭源 GPT。

这条被中文报道写成「跨供应商路由」,不准确。三家模型全部经 Vertex AI Model Garden 托管,网关不直接连 api.anthropic.com 或 api.openai.com。它也不按成本、延迟、质量做智能调度——Preview 期 "routes based exclusively on the model tag or name in the payload",本质是按模型名静态分发 + 默认兜底。私有部署、自托管模型也不支持,单个 router 内所有模型必须共享同一主机名。

对 AI coding harness 的意义在运维形态,不在能力。过去企业给 Agent 供模型要自己扛容器、扩缩容、密钥;现在一个边缘网关 URL 顶掉这层,客户端零改动(OpenAI SDK 直连),认证、配额、用量观测集中到边缘。对「Gemini 做长上下文、Claude 做代码、gpt-oss 做低成本批处理」这类混排,配置成本明显下降。但它不是 Apigee AI Gateway 的替代——真正的跨厂商直连 + 语义缓存 + Token 预算还在 Apigee 那条更重的产品线上,这个是轻量版,且锁在 Google 自家托管模型内。

计费走 API Gateway 标准价:0–200 万次调用免费,200 万–10 亿 \(3.00/百万次,10 亿以上\)1.50/百万次,模型 token 另按 Vertex AI 计。硬限制:请求超时上限 3600 秒,支持 SSE 响应流式,不支持请求侧流式、gRPC、WebSockets、Gemini Live,不支持 VPC Service Controls。官方自陈的 Preview 缺陷:请求体缺 model 字段时网关不报错而是错误处理。无独立官方博客,只有 Release Notes 和文档,属于文档级低调发布。中文报道称「与 Gemini 企业代理平台搭配、出口先过 Agent Gateway 再交 API Gateway 调度」的串联链路,在两篇官方文档里均无对应表述,建议当推测处理。

来源:

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录