Q
QianXun
@QianXun · 2026年08月24日 02:22 · 0 浏览

Ox Alpha「牛来大模型」登顶 OpenRouter:Tokenizer 95/95 指纹 + Z.ai 服务层 + DeepSWE 63% + 100T Token 免费窗口

匿名模型 Ox Alpha「牛来大模型」登顶 OpenRouter:Tokenizer 95/95 指纹 + Z.ai 服务层 + DeepSWE 63% + 100T Token 免费窗口

> 一款没有发布会、没有官方公告、provider 只写 "stealth" 的匿名模型,单日调用量冲到 OpenRouter 榜首,把 DeepSeek 56 天霸榜纪录终结。社区用 95/95 的 tokenizer 测试、Java stack trace、错误码 1214 三层证据,把它的血缘指回中国智谱。Stripe CEO Patrick Collison 试完后评价「very impressive」。

---

一、4 万亿 Token 单日调用,把 DeepSeek 拉下马

Ox Alpha 在 8 月 20 日以匿名身份出现在 OpenRouter(provider 写着 Stealth),凭一组令人坐不住的规格迅速刷屏:

  • 上下文窗口 1,048,576 token(1M);
  • 单次最多输出 131,072 token(131K);
  • 多模态输入:文本、图片、视频;
  • 预览期每日 100T Token 服务容量(由 OpenCode 转发供应商说法,未经独立审计);
  • OpenCode Go 上几乎不限量免费,不计入用户原本的 Go 额度;
  • 强制推理模式,efforts 支持 max/high/low,默认 max;
  • temperature=1,top_p=0.95,top_k 限定参数。
8 月 22 日 Ox Alpha 冲至 OpenRouter 榜首,终结 DeepSeek 在 OpenCode 连续 56 天的霸榜纪录。OpenRouter 8/23 数据显示,前五大调用方(Hermes Agent、Claude Code 等)累计调用已超 4 万亿 Token。8 月 24 日中文社区给它起了外号——「牛来大模型」(Ox 是「牛」+ 谐音最近《牛来》梗火遍互联网)。

Stripe CEO Patrick Collison 试完只说了四个字:"very impressive."——能让他下场表态的开发者工具,本来就不多。

二、95/95 tokenizer 指纹,把 GLM-5 钉死

要确认模型血缘,常规 benchmark 不够——Ox Alpha 走的是「指纹学」。研究者 Joseph W. Elstner 在 8 月 22-23 日用 95 组 probe 字符串(覆盖 ASCII、Python、中日韩、emoji、阿拉伯语、希伯来语、泰语、稀有 Unicode、空白、regex、HTML、JSON、长重复等)喂给 Ox Alpha,记录 usage.prompt_tokens 数值,再与 14 款主流模型词表比对。

graph TD
OA["Ox Alpha<br/>prompt_tokens"]
OA --> A1["z-ai/glm-5.3<br/>MAE 0.0<br/>15/15"]
OA --> A2["~z-ai/glm-latest<br/>MAE 0.0<br/>15/15"]
OA --> A3["z-ai/glm-5v-turbo<br/>MAE 0.53<br/>13/15"]
OA --> A4["qwen3-max / deepseek-v3.2<br/>MAE ~4<br/>1/15"]
OA --> A5["xiaomi/mimo-v2.5-pro<br/>MAE 65.8<br/>2/15"]

8 月 23 日,Elstner 用智谱公开的 GLM-5 词表重测——95/95 全部完全匹配,MAE 0.0。背后逻辑是:Ox Alpha 的 prompt_tokens = GLM-5.3 的 prompt_tokens + 75(常量偏移)。这个偏移恰好可以由一段隐藏 System Prompt 解释,意味着底层用的是同一套词表,只是在 chat template 包装上多套了一层。

随后研究者 Chetaslua 又对视频 token 预算做了受控测试:四段控制视频,每段改变帧率、时长、分辨率三个维度。结果 Ox Alpha 与 GLM-5V-Turbo 在每秒约 147 token 增长、帧采样不受时长变化影响、每帧分辨率 token 缩放方式四项指标上完全对齐。MiMo、Qwen、GLM-4.6V 都被排除在外。

三、Java stack trace 把运营商钉死

词表血缘只是身份的一半,服务层是谁跑的另一半。Chetaslua 8/22 给 OpenCode 直接转发的 Ox Alpha 路由故意发了一个畸形请求(top_p 设成字符串 "abc" 而不是数字),服务器返回的 Java stack trace 里赫然出现:

com.wd.paas.api.domain.v4.chat.ChatCompletionRequest

这个包路径直接对应智谱在 open.bigmodel.cnapi.z.ai 上的官方 API 结构。另一个 bad-role 测试触发的 code 1214 错误码,与 Z.ai 托管的 GLM 模型完全一致。

关键控制变量:同一份 GLM-5.2 权重,由 DeepInfra 托管时返回的是另一种错误格式。所以错误码是服务层指纹,不是模型权重指纹——这意味着同一份词表的模型在不同主机上会留下不同身份签名。Chetaslua 给出的置信度是 0.98。

graph LR
W["GLM-5 权重"] --> Z["Z.ai 托管"]
W --> D["DeepInfra 托管"]
Z --> O1["Ox Alpha<br/>code 1214 ✓"]
Z --> O2["公开 GLM-5.3<br/>code 1214 ✓"]
D --> O3["DeepInfra GLM-5.2<br/>code 不同 ✗"]

四、DeepSWE 113 题 63%,社区测试的现实

Ox Alpha 最出圈的跑分是 DeepSWE。一项 10 题小样本社区测试中,Ox Alpha 完成 8 个、80% 通过率,同一组任务里 Fable 5 为 65%、GLM-5.3 为 62%、GPT-5.6 Sol 为 52%。这一数字引爆推特——一款匿名模型在 10 题测试里打赢了所有头部闭源

但 8 月 23 日开发者 Ben Davis 跑完完整 113 题,得分约 63%。他自己说「这数字才更说得通」——10 题样本的方差太大,一题就影响 10 个百分点。DeepSWE 公开 BenchSift leaderboard 上 8/21 仍未收录 Ox Alpha。

Ox Alpha 的真实水位大致可以这么描述:在小样本编程和 Agent 任务表现亮眼、规格激进(1M 上下文 + 多模态 + 强制推理),评测结果分歧极大。Abacus.AI CEO Bindu Reddy 公开说他们测试后发现 Ox Alpha 表现低于预期,一些指标只达到较早一代模型水平。沃顿商学院 Ethan Mollick 试完表示「惊艳程度一般般」。低推理强度任务上偏弱,视觉任务上明显弱于 Gemini 系列。

但 OpenRouter 8/23 的使用数据才是真正信号——最大流量来源不是尝鲜的网友,是 Claude Code 与 Hermes Agent 这种生产级 Agent 工具,真实消耗超过 180 亿 Token。Stripe CEO 用它做真实任务,不是测试集。

五、8/26 前后免费窗口关闭,Identity 仍待揭晓

OpenCode 公开数据显示,Ox Alpha 累计出现 250B Token 级别的使用量,拥有约 8500 名独立用户,完成会话超 11 万次。OpenRouter 列出条款:匿名第三方 provider 保留 prompt 与 completion,但不用作训练。这是一个比「不存储」窄但比「自由使用」宽的承诺——把私有代码发给一个身份不公开的对手方,等于把合规与机密性赌在它的承诺上。

免费窗口预计 8 月 26 日前后结束。之后价格、运营方、长期可用性全部未披露。

身份候选现在有两派:

  • 智谱派(领先):tokenizer 95/95、Java 内部类路径、code 1214 错误码、命名脉络(Pony Alpha → Ox Alpha);
  • 谷歌派(追赶):DeepMind 研究员 Evan Otero 在相关讨论下回「Gemini」,Techmeme 汇总的社媒讨论里 Gemini 团队成员密集发帖,1M 上下文与多模态都是 Gemini 长期投入方向;
  • 第三方托管派(少数):Microsoft MAI 家族与 Cursor 自己训一遍的可能也被提出。
到 8/24 上午,智谱方面仍未正式认领。谷歌也未公开表态。匿名发布本身是一种营销实验——规避地缘政治风险,让产品在无品牌偏见下接受检验,在定价战中释放烟幕弹

六、判断:Ox Alpha 真正改写的是什么

graph TD
A["匿名发布<br/>无品牌偏见"] --> B["1M 上下文 + 多模态<br/>规格透明"]
A --> C["100T Token/天免费<br/>逆向筛选高质量用户"]
B --> D["Tokenizer 95/95<br/>服务层 code 1214"]
C --> D
D --> E["社区法医式解剖<br/>推理结构透明"]
E --> F["Agent 时代分发权<br/>从厂商转移到社区"]

短期看,Ox Alpha 是一场免费的开发者狂欢,窗口 8/26 关闭。中期看,这是「模型血缘可被社区验证」的范式转换——以后任何匿名模型都不可能藏得住 tokenizer 指纹,服务层 stack trace 也会暴露运营方。长期看,这给中国大模型出海打开了一种新渠道:先用匿名版本积累国际开发者生态与口碑,再决定要不要正式认领

如果智谱后续确认归属,意味着国产大模型不仅在跑分上逼近海外前沿水平,还具备了承接万亿级 Token 调用、支撑全球 Agent 工作负载的上量能力——OpenCode 宣称的每日 100T Token 服务容量,如果被实际验证,将是国产模型海外分发能力的关键拐点。

但身份谜题本身不掩盖另一层事实:「模型在哪里训练」和「模型在哪里部署」已经成为两道题。Ox Alpha 用 Z.ai 的服务栈跑智谱的 GLM 词表,这种「词表+服务栈」组合可以在很多厂商之间复制,模型分发权不再专属某一家。AI 时代的「产地证明」正在变成「服务层指纹」,而指纹,任何人都能扒。

七、给从业者的话

如果你在做 Agent 或 Coding 工具:

  • 8/26 前亲自跑一遍 Ox Alpha——规格激进未必对应强能力,但 DeepSWE 63% 在 100T 免费窗口下值得压测;
  • 关注 OpenRouter 后续的命名揭晓,大概率会有「智谱 GLM-5.x 后续版本」或「智谱海外版」两个剧本;
  • 把自有产品对第三方模型的依赖分级:核心 Agent 路径不要锁死单一闭源 API,海外匿名模型是检验兼容性的好契机;
  • 提前评估「匿名模型」的风险——prompt 与 completion 是否被保留,是否参与训练,免费窗口关闭后的续约条件;
  • 不要押宝 Ox Alpha 的「国产或海外」身份,而要看它在 Agent 工具链中的真实使用深度——Stripe CEO、Claude Code、Hermes Agent 都在用,这是比 10 道题小样本更可靠的信号。

参考来源

  • Implicator.ai《Ox Alpha Matches Zhipu's GLM Tokenizer in 95 of 95 Tests》(Joseph W. Elstner 8/22-23 实验);
  • Singularity.Kiwi《An Anonymous AI Model Appeared on OpenRouter. The Trail Points to Zhipu.》(Chetaslua 服务层取证);
  • 网易《匿名模型 Ox Alpha 登顶 OpenRouter,社区证据指向智谱 GLM》(8/24 10:04 未来图灵);
  • 网易《"牛来"引爆全球开发者圈,谷歌员工下场认领,国产模型身份待揭晓》(智通财经 8/24 08:30);
  • 量子位《全世界刷屏的"牛来大模型",到底是谁家的牛?》(衡宇);
  • Reddit r/singularity Ox Alpha 讨论;
  • OpenRouter 模型列表 8/23 数据;
  • OpenCode Zen 文档(每日 100T Token 容量声明)。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens