8 月 20 日,OpenRouter 上架了一个匿名模型 Ox Alpha,限免一周。开发者 Ben Davis 拿它跑了 DeepSWE 基准——看 AI 读真实代码库、找漏洞、写补丁的本事。10 个任务平均分 80%。作为对比:Claude Fable 5(max)65%、GPT-5.6 Sol(max)52%、GLM-5.3(max)62%、Grok 4.6(xhigh)62%。
这是分词器指纹分析告诉我们的:有人对 25 个提示词跑了 token 化,发现 Ox Alpha 的 token 数跟 GLM-5.3 几乎一模一样,只差一个恒定的 75 token 包装层。视频编码器行为、API 响应特征也跟智谱的架构对得上。
这件事的真正信号不在 Ox Alpha 跑分第一,而在两个新现象。
第一,DeepSWE 这种「端到端工程任务」基准开始比刷榜更有说服力。以前大家比 MMLU、比 GSM8K、比 HumanEval——这些是考试题。DeepSWE 是工程题:你给我一个真实仓库,给我 bug 描述,给我目标 PR,给我测试套件,你能不能在一个连续工作流里把补丁写出来?这一步是「代码生成」走到「代码施工」的分水岭。Ox Alpha 在这种基准上碾压 Claude Fable 5 15 个百分点,意味着基准本身已经位移。
第二,「分词器指纹 = DNA 鉴定」是一种奇怪但有效的归属方法。这不是法院级证据——75 token 的恒定偏移可以是 API 包装层的差异,也可以是有意为之的混淆。但配合视频编码器行为、API 响应特征、视频编码器实现细节这三层独立信号,同步指向一家公司,置信度比单一信号高得多。问题是:智谱愿不愿意认?承认就意味着默认 OpenRouter 上的限免是一次匿名营销,不承认就要面对「匿名模型跑分第一」的舆论场。
上下文规格写着:1,048,576 token 上下文窗口,能收文本图片视频,单次输出 131,072 token。OpenCode 也把它接进免费套餐,每天能处理 100 万亿 token。这种「限免 + 超大上下文 + 多模态」的组合拳,明显是一次产品预热,不是技术试用。
下一根钉子:如果智谱在 8 月 27 日之前不公开认领,且 OpenRouter 不主动下架,那么「匿名大模型 + 分词器指纹归属」这套玩法会变成中文 AI 圈的常态——从此每个新模型都会先被怀疑是某家已知厂商的翻版。模型发布的「前置信任成本」会从「OpenAI vs Anthropic vs DeepMind 谁的版本号更可信」升级为「这是谁家孩子」。这是好事(让水军营销更难)也是坏事(让独立开源研究者更难立足)。
#OxAlpha #DeepSWE #智谱