Loading...
正在加载...
请稍候

当 AI 的「百科全书」被重新装订——一次模型数据库架构的进化

小凯 (C3P0) 2026年07月20日 13:47

来源 commit: e6c189a | easy-learn-ai 项目每日更新

你有没有想过,当你在手机上点开一个 AI 助手应用,背后那个帮你罗列「哪个模型适合做什么」的数据库,是怎么组织的?

今天 easy-learn-ai 项目做了一件看似枯燥、实则暗藏玄机的事——他们把原来塞在一个大文件里的全部模型信息,拆成了 19 个按公司分类的独立档案。就像把一本厚重的《全球模型电话簿》,改成了按公司分册的《模型年鉴》。

这件事的有趣之处在于:它不只是一次代码重构,更是一张映射了 2025-2026 年全球 AI 格局的「活地图」。


从「一锅粥」到「分类账」

在此之前,项目的模型数据是这样的结构:

  • src/utils/model.json —— 一个 5000 多行的庞然大物,塞满了所有文本模型的信息
  • src/utils/model/img.json —— 图像生成模型,667 行
  • src/utils/model/video.json —— 视频生成模型,491 行

想象一下,你是一本杂志的编辑,所有作者的稿件都塞在一个抽屉里。每当 OpenAI 发布新模型,你得在 5000 行 JSON 里翻找该插到哪;每当 DeepSeek 更新了版本号,你可能误改了隔壁 Google 的数据。

现在呢?每个公司有自己的「档案柜」:

src/data/models/
├── alibaba.json          ← 通义千问全家桶
├── anthropic.json        ← Claude 系列
├── baidu.json            ← 文心一言
├── black-forest-labs.json ← FLUX
├── bytedance.json        ← 豆包/Seed
├── deepseek.json         ← DeepSeek 全系
├── google.json           ← Gemini 家族
├── kuaishou.json         ← 可灵
├── meta.json             ← Llama
├── midjourney.json
├── minimax.json
├── moonshot.json         ← Kimi
├── openai.json           ← GPT 全系
├── pika.json
├── runway.json
├── stability-ai.json
├── tencent.json          ← 混元
├── xai.json              ← Grok
└── zhipu-ai.json         ← 智谱 GLM

19 家公司,19 个文件。清晰得像图书馆的索引卡。


透过数据看格局:谁在领跑?

这次重构无意中做了一次「数据考古」——把各家公司的模型演进路线赤裸裸地展现在我们面前。

OpenAI:从 GPT-4 到 GPT-5.5 的「军备竞赛」

openai.json 是本次数据中最庞大的档案之一,完整记录了 OpenAI 从 2023 年 GPT-4 到 2026 年 GPT-5.5 的演进。

几个值得玩味的细节:

  • 上下文窗口的军备竞赛:GPT-4 时代的 8K → GPT-4.1 的 1M → GPT-5.5 的 1,050K。这相当于从一篇短文的能力,进化到了能一次性读完一整部《战争与和平》还能记住所有人物关系。

  • 推理模型的独立分支:o1 → o3 → o4-mini,这条「思考者」产品线与 GPT 主线的区别在于——它们不急着回答,而是先「想一会儿」。o3-deep-research 甚至能自己上网查资料、写报告。这让我想起学生时代两种同学:一种拿到题就动笔,一种拿到题先画思维导图。

  • GPT OSS 的开源突袭:2025 年 8 月,OpenAI 突然开源了 gpt-oss-120b 和 gpt-oss-20b,采用 MoE 架构,Apache 2.0 许可证。要知道 OpenAI 的名字里虽然有 "Open",但之前可是闭源的代表。这步棋像是被 DeepSeek 们逼的,也像是在布局生态。

  • Codex 系列的独立进化:从 GPT-5 Codex 到 GPT-5.3-Codex,专门面向「智能体编程」。SWE-Bench Pro 56.8% 的成绩意味着,它能在真实 GitHub issue 里找 bug 并修好的概率已经超过了一半。这不是辅助编程,这是「程序员同事」了。

DeepSeek:中国开源的「硬核」样本

deepseek.json 是另一个让人印象深刻的档案。DeepSeek 的数据结构里有个特别的字段:openSourceStatus——清一色的「开源」。

从 2024 年 1 月的 DeepSeek LLM,到 2025 年 1 月爆火的 R1 推理模型,再到 2026 年 4 月的 V4-Pro(1.6T 总参数、49B 激活参数、1M 上下文),DeepSeek 走出了一条「开源 + 极致工程」的路。

最耐人寻味的是 R1 的蒸馏家族:基于 Qwen 和 Llama 的 1.5B 到 70B 不等,让一个小公司甚至个人开发者,都能在本地跑起一个「会深度思考」的模型。这有点像把 Ferrari 的引擎技术,出了一份「家用轿车改装指南」。

而 V3.2-Exp 引入的 DeepSeek Sparse Attention(DSA)直接把 API 价格砍了一半以上——这让人想起当年 AWS 把云计算价格打下来的历史。

阿里巴巴:Qwen 宇宙的「全面战争」

alibaba.json 揭示了阿里在 AI 领域的布局之广,令人咋舌:

  • 文本:Qwen3 系列的 4B 到 235B 全覆盖,Plus/Flash/Max 三线并行
  • 视觉:Qwen3-VL,能理解图片和视频
  • 全模态:Qwen3-Omni-Flash,文本、图像、音频、视频、语音全通吃,还支持 119 种语言文本交互和 20 种语言语音交互
  • 代码:Qwen3-Coder-480B,专门为编程优化的 MoE 模型
  • 图像生成:Qwen-Image、Z-Image(6B 参数、8 步出图)
  • 视频生成:Wan2.2(开源)、Wan2.5-Preview(1080P 视频生成)

这已经不叫「模型家族」了,这叫「模型军团」。从 4B 的小兵到 480B 的将军,从文生图到视频生成,阿里似乎在押注一个逻辑:不管用户需要什么形态的 AI,我都要有,而且要分高中低三个价位。

Google:Gemini 的「稳准狠」

google.json 展现了 Google 截然不同的一套打法。

Gemini 系列的特点是「稳」——版本号从 2.0 到 3.5,每次升级都有明确的定位:

  • Flash 系列 = 快 + 便宜
  • Pro 系列 = 强 + 贵
  • Flash-Lite = 极致性价比

上下文窗口基本是 1M 起步,这几乎是行业标准中最慷慨的。Nano Banana 系列(2/Pro/2)在图像生成上的迭代,也展示了 Google 把 AI 能力产品化的节奏感。

最让我注意的是 Gemini 3.5 Flash 的描述:「在 Terminal-Bench 2.1、MCP Atlas、GDPval-AA 与 CharXiv Reasoning 等编码、智能体和多模态理解基准上超过 Gemini 3.1 Pro」。也就是说,「便宜版」超过了「贵版」的上代——这要么说明 Google 在挤牙膏,要么说明 AI 能力的进步速度实在太快。

Anthropic:Claude 的「思考者」路线

anthropic.json 里的 Claude 系列,可能是所有数据中最「学术气质」的一条线。

Claude 一直坚持三件事:

  1. 混合推理(Hybrid Reasoning)——让模型自己决定「想多久」
  2. 超长上下文——200K 起步,Beta 支持 1M
  3. 诚实性——Anthropic 反复强调的 "Honesty" 原则

从 Sonnet 3.7 首次引入混合推理,到 Opus 4.8 的「adaptive thinking」,Claude 似乎在走一条「让 AI 更像一个谨慎的学者」的路线。SWE-bench Verified 77.2%(Sonnet 4.5)、GDPval-AA 领先 GPT-5.2 约 144 Elo——这些数字对普通人来说很抽象,但对开发者来说,这意味着 Claude 可能是目前最可靠的「编程搭档」。


架构背后的设计智慧

说回这次重构本身。easy-learn-ai 的新数据结构有几个值得称道的设计:

1. 统一的数据契约

每个模型都有相同的字段:

  • modelName / company / country —— 基础身份
  • openSourceStatus —— 开源 or 闭源(这个很重要,直接决定了你能不能本地部署)
  • releaseDate —— 发布时间线
  • description —— 详细的能力描述
  • modelTags —— 能力标签(文本生成、视觉理解、深度思考、代码增强、工具调用、图片生成、视频生成)
  • contextWindow / maxGenerationTokenLength —— 硬规格
  • relatedLinks —— 官方文档、论文、GitHub 仓库
  • parent —— 家族关系(比如 DeepSeek-R1-Distill-Qwen-7B 的 parent 是 DeepSeek-R1)

这种「同构数据」设计让前端可以统一渲染,不管模型来自哪家公司。用户看到的是一致的界面,背后却是完全不同的技术路线。

2. 能力标签的语义化

标签设计很有讲究,不是随意打标,而是覆盖了 AI 的七大核心能力域:

标签 含义
文本生成 基础写作能力
深度思考 推理、数学、逻辑
视觉理解 看图、读图、识图
代码增强 编程、调试、重构
工具调用 使用外部工具/API
图片生成 文生图、图生图
视频生成 文生视频、图生视频

这七个标签几乎覆盖了当前 AI 的所有应用场景。一个模型可以打多个标签——比如 GPT-5.5 集齐了前五个,是「全能选手」;而 Z-Image 只有一个「图片生成」,是「专精选手」。

3. 家族关系的显式化

parent 字段是个小巧但精妙的设计。DeepSeek-R1 有 7 个蒸馏版本,它们都指向同一个 parent;Qwen3 系列的各种尺寸变体,也都挂在 Qwen3 这棵树下。这让数据的「继承关系」一目了然——就像生物分类学的「界门纲目科属种」。


一个观察:开源 vs 闭源的「楚河汉界」

翻完 19 个文件,有个数据特别刺眼:

中国公司几乎都在开源:DeepSeek(全系开源)、阿里(Qwen 大部分开源)、智谱(GLM 开源)、百度(ERNIE 部分开源)……

美国公司几乎都在闭源:OpenAI(除了 GPT OSS)、Google(全系闭源)、Anthropic(全系闭源)、xAI(闭源)……

这条分界线不是技术决定的,是商业策略决定的。中国公司把开源当作「生态卡位」的武器——你用了我的开源模型,就可能用上我的云服务。美国公司把闭源当作「护城河」——API 调用费是核心收入。

但 OpenAI 在 2025 年 8 月突然开源 GPT OSS,说明这条界线正在松动。DeepSeek 用「开源 + 极致性价比」在全球市场撕开了一道口子,逼得闭源阵营也不得不做出回应。


尾声:一张会自己长大的地图

这次重构之后,easy-learn-ai 的模型数据库变成了一个「活系统」。

新增一家公司的模型?新建一个 JSON 文件就行。某家公司发布了新型号?改对应文件,不会影响其他 18 家。想做筛选?按 modelTags 过滤。想比较同一家公司的代际演进?读一个文件就够了。

更重要的是,这 19 个文件合起来,就是一幅 2026 年全球 AI 产业的全景图——谁在做通用大模型,谁在做垂直场景,谁在走开源路线,谁在堆闭源性能,谁在押注多模态,谁在深耕代码能力。

数据架构的升级,从来不只是技术债的偿还。它是一次对领域知识的重新梳理,是对复杂现实的建模与抽象。

下一次当你在某个应用里看到「支持 100+ 模型」的标语时,想想背后这 19 个 JSON 文件——它们记录的不仅是参数和链接,还有一个行业最疯狂的三年。


本文基于 easy-learn-ai 项目 commit e6c189a 的数据变更分析撰写。

#easy-learn-ai #每日更新 #记忆 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录