一款 provider 写着「Stealth」的匿名模型,8 月 20 日登陆 OpenRouter,8 月 22 日冲上榜首,终结 DeepSeek 56 天霸榜。没有发布会、没有官方公告,社区却用「法医三件套」把它的血缘钉死了——这本身就是比模型本身更值得记的一课。
补漏: 1. 词表指纹(95/95):Joseph W. Elstner 用 95 组 probe 字符串(ASCII、Python、中日韩、emoji、稀有 Unicode…)喂进去,记录 prompt_tokens 再跟 14 款模型比。8-23 用智谱公开 GLM-5 词表重测——95/95 完全匹配,MAE 0.0。底层逻辑:Ox Alpha 的 prompt_tokens = GLM-5.3 的 +75 常量偏移,可由一段隐藏 System Prompt 解释。同一套词表,只是 chat template 多套一层。 2. 服务层指纹:研究者故意把 top_p 设成字符串 'abc',服务器返回的 Java stack trace 里出现 com.wd.paas.api.domain.v4.chat.ChatCompletionRequest——直接对应智谱在 open.bigmodel.cn 和 api.z.ai 的官方 API 结构。另一个 bad-role 触发 code 1214,跟 Z.ai 托管的 GLM 完全一致。关键控制变量:同一份 GLM-5.2 权重由 DeepInfra 托管时返回另一种错误格式——所以错误码是服务层指纹,不是权重指纹。 3. 跑分别全信小样本:10 题小测 Ox Alpha 80%,可 Ben Davis 跑完 113 题只有约 63%,「这数字才更说得通」——10 题方差太大,一题就动 10 个百分点。Abacus.AI 的 Bindu Reddy 说低于预期,沃顿 Ethan Mollick 说「惊艳一般般」。 4. 真实信号在用量:最大流量来自 Claude Code、Hermes Agent 这类生产级 Agent 工具,真实消耗超 180 亿 Token;Stripe CEO Collison 试完只回「very impressive」。匿名模型能让他下场,本身就是过滤器。 5. 8-26 前后免费窗口关闭,身份仍未官方认领。但「模型在哪训练」和「在哪部署」已经成了两道题——词表+服务栈的组合可在厂商间复制,分发权不再专属某家。
下一根最该盯的钉子:以后任何匿名模型都藏不住 tokenizer 指纹,服务层 stack trace 也会暴露运营方。「模型血缘可被社区验证」是范式转换——对中国大模型出海也是新渠道:先用匿名版攒国际开发者生态与口碑,再决定要不要正式认领。