当AI学会分门别类:一个项目重构背后的模型世界版图
想象一下,你搬进了一栋新公寓,打开衣柜,发现前任住户把所有衣服——冬天的羽绒服、夏天的T恤、正装、睡衣、甚至泳裤——统统塞进了一个巨大的行李箱里。你需要的只是一双袜子,但得先把整个箱子翻个底朝天。
一、5000行的行李箱
想象一下,你搬进了一栋新公寓,打开衣柜,发现前任住户把所有衣服——冬天的羽绒服、夏天的T恤、正装、睡衣、甚至泳裤——统统塞进了一个巨大的行李箱里。你需要的只是一双袜子,但得先把整个箱子翻个底朝天。
这就是 easy-learn-ai 这个项目的开发者们面对的现实。
easy-learn-ai 是一个帮助普通人了解和学习 AI 模型的开源网站。它的核心资产是一份模型数据库:每个 AI 模型的名字、出品公司、能力标签、上下文窗口大小、官方文档链接……这些信息原本全部堆在一个叫 model.json 的文件里。多大呢?5005 行。
你可能觉得,5000行不算多啊。确实,对于一台电脑来说,5000行代码就像你早餐的一口面包,眨眼就读完了。但对人来说呢?当你想确认 "DeepSeek 最新的模型叫啥" 时,你得在5000行里翻找。当你想给阿里巴巴的模型统一加个新字段时,你得小心翼翼地滚动、搜索、生怕改错到隔壁 Google 的数据。当两个人同时修改这份文件时,Git 合并冲突就像两只猫在打架——谁都理不清谁。
更要命的是,这份文件里不只有文本模型。图像生成的模型信息也在里面,视频生成的也在里面。你本来想查一个能帮你写邮件的聊天机器人,结果翻着翻着看到了一堆 Stable Diffusion 的参数。就像你去超市买牛奶,结果货架上牛奶旁边摆着轮胎和螺丝刀。
于是,开发者们做了一件看似简单、实则充满智慧的事——整理房间。
二、从一个大箱子到二十个小抽屉
这次重构的核心逻辑,用一句话就能说清:按厂商分家。
原来的一整个 model.json 被拆成了 20 个独立的 JSON 文件,每个文件对应一家 AI 公司:
alibaba.json—— 阿里巴巴(通义千问系列)anthropic.json—— Anthropic(Claude 系列)baidu.json—— 百度(文心一言/ERNIE 系列)black-forest-labs.json—— Black Forest Labs(FLUX 图像生成)bytedance.json—— 字节跳动(Seed 系列)deepseek.json—— DeepSeekgoogle.json—— Google(Gemini 系列)kuaishou.json—— 快手meta.json—— Meta(Llama 系列)midjourney.json—— Midjourneyminimax.json—— MiniMaxmoonshot.json—— 月之暗面(Kimi)openai.json—— OpenAI(GPT 系列)pika.json—— Pika Labs(视频生成)runway.json—— Runway(视频生成)stability-ai.json—— Stability AItencent.json—— 腾讯(混元系列)xai.json—— xAI(Grok 系列)zhipu-ai.json—— 智谱 AI(ChatGLM 系列)
img.json)和视频模型(video.json)也被分别安置到了新的目录下。现在的结构就像图书馆的分类索引:想看文本模型?去 models/ 目录。想看图像模型?去 img/。想看视频?去 video/。这背后的工程思想叫关注点分离(Separation of Concerns)。简单来说就是:别把不同的事情搅在一起。你整理房间的时候,也不会把袜子和锅碗瓢盆放在同一个抽屉里,对吧?
三、数据里的秘密:AI 世界的真实版图
但最让我着迷的,不是这次代码重构本身——代码重构每天都在发生。真正有趣的是,这次重构让我们第一次看清了 AI 模型世界的全景地图。
整理完之后,20个文件加起来一共包含了 240 个 AI 模型的信息。这些数字不是抽象的统计,它们讲述的是一场正在发生的、无声的战争和协作。
巨头之争:OpenAI 的护城河
OpenAI 以 38 个模型高居榜首。这个数字本身就说了一个故事:从 2023 年的 GPT-3.5 Turbo 到 2026 年的 GPT-5,OpenAI 以令人眼花缭乱的速度迭代着自己的产品线。它的策略很清晰——覆盖所有价位、所有场景。
- 想要极致性能?GPT-5
- 想要性价比?GPT-5 mini
- 想要轻量级?GPT-4o mini、GPT-4.1 nano
- 想要视觉理解?GPT-4o
- 想要特定版本锁定?GPT-4 Turbo
中国力量:九家公司,一百多个模型
在这 20 家厂商中,有 9 家来自中国。如果把中国厂商的模型加起来,数量已经超过了总量的三分之一。
- 阿里巴巴(28 个模型):通义千问从 Qwen2 一路迭代到 Qwen3.7-Max,走的路线和 OpenAI 很像——覆盖全价位。但阿里更激进的是开源。Qwen3.5-Plus 开源了 3970 亿参数的混合专家模型,性能超过万亿参数的闭源模型,API 价格却只有 Gemini 3 Pro 的 1/18。
- 智谱 AI(24 个模型):ChatGLM 系列是国内最早一批开源的国产大模型,从 ChatGLM-6B 到 GLM-4,智谱证明了一件事——中国团队不仅能做大模型,还能把大模型做得足够小、足够快,让普通开发者也能跑起来。
- 字节跳动(20 个模型):Seed 系列相对低调,但字节在模型效率上的投入是巨大的。当你用抖音的 AI 功能时,背后很可能就是 Seed 模型在跑。
- DeepSeek(17 个模型):这是我最想单独拿出来聊的一家。
DeepSeek 的"蒸馏魔法"
DeepSeek 在这份数据里有个特别的现象:它只有 17 个模型,但这 17 个里面,有 整整 11 个是蒸馏模型(Distill)。
什么是蒸馏?想象一个学霸(DeepSeek-R1)花了一整年把所有考试题都做了一遍,总结出了一套解题心法。然后老师让学霸把他的心法教给几个"徒弟"——这些徒弟本身天资不同(有的像 Qwen1.5B 只有 15 亿参数,有的像 Llama-70B 有 700 亿参数)。学霸把自己的思维方式"蒸馏"成教学笔记,徒弟们拿着这些笔记去考试,成绩居然能接近学霸本人。
这就是 DeepSeek-R1 做的事情。它用一个 6710 亿参数的"超级大脑"生成了 80 万条高质量的推理样本,然后用这些样本去教小模型怎么"思考"。结果令人震惊:一个只有 15 亿参数的 Qwen 小模型,经过 R1 的蒸馏训练后,在数学推理上的能力可以媲美 GPT-4。
这有什么意义?这意味着 AI 的"智慧"和"体型"可以分离。你不需要每个人都养一头大象才能搬运重物——你可以让大象把路线图画出来,毛驴按图走也能到达目的地。
DeepSeek 把这 11 个蒸馏模型全部开源了。这意味着,任何一个有一台游戏显卡的开发者,都可以在自己电脑上运行一个"准 R1 级别"的推理模型。这在一年前还是不可想象的事情。
Anthropic 的"长文本"执念
美国的 Anthropic(Claude 的母公司)走的是另一条路。它的模型数量不多(12 个),但每个都有一个共同特征:超长的上下文窗口。
Claude Opus 4.8 支持 100 万 token 的上下文——什么概念?大约相当于 75 万汉字,差不多是两本《红楼梦》的长度。你可以把两本《红楼梦》一次性塞给它,然后问:"林黛玉和贾宝玉在第三十二回里说了什么?"
Anthropic 的赌注是:未来的 AI 不是拼谁更聪明,而是拼谁能"记得"更多。当 AI 能一次性读完你公司过去十年的所有财报、邮件和会议记录时,它给你的建议就不再是基于"一般性知识",而是基于"你的具体情况"。
图像与视频:新战场
别忘了,这个数据库里还有专门的图像和视频模型。
- Midjourney:只有一个模型,但它在 AI 绘画领域的地位就像可口可乐在可乐界的地位——品牌即品类。
- Black Forest Labs(FLUX):只有两个模型,但 FLUX.1 在开源图像生成领域掀起了一场风暴。它证明了一件事:开源模型的图像质量已经可以在很多场景下媲美 Midjourney。
- Runway 和 Pika:视频生成的双雄。Runway Gen-4、Pika 2.0——这些名字背后,是 AI 从"能生成图片"到"能生成电影"的跨越。当你在朋友圈看到某个人"用 AI 拍了一部短片"时,背后大概率就是这些模型。
- 快手可灵(Kuaishou):中国团队在视频生成领域也不遑多让。快手的可灵模型已经能够生成相当连贯的动作视频,在这个新兴赛道上,中国公司没有掉队。
四、标签里的密码:AI 到底能干什么?
每个模型都有一组"能力标签"——文本生成、深度思考、视觉理解、代码增强、工具调用……这些标签不是随便贴的,它们勾勒出了 AI 的能力边界。
让我用标签来画一张 AI 的能力地图:
基础层:文本生成 这是所有模型的"默认技能",就像所有厨师都会炒菜。240 个模型里,几乎没有不会写文字的。
进阶层:深度思考 不是所有模型都会"深思熟虑"。DeepSeek-R1 和 Claude Opus 这类模型会在回答前"想一会儿"——这个过程叫链式思维(Chain-of-Thought)。就像你解一道数学题时会在草稿纸上写步骤一样,这些模型也会把思考过程写出来,然后再给出答案。这大大提高了复杂问题的准确率。
视觉层:看图说话 GPT-4o、Claude 系列、Gemini 系列、Qwen 系列……越来越多的模型长了"眼睛"。你可以扔给它一张外卖菜单照片,让它帮你推荐菜品;或者给它一张电路图,让它指出哪里接错了。视觉理解让 AI 从"只读文字的书呆子"变成了"能看世界的正常人"。
工具层:动手干活 这是最接近"智能体"(Agent)概念的一层。会"工具调用"的模型不仅能回答问题,还能真正去执行操作——比如查询天气 API、调用计算器、甚至操作浏览器去帮你订一张机票。Claude 的 Sonnet 4.6 在这个方向上走得最远,它可以在电脑上像人一样点击、输入、浏览网页。
代码层:程序员助手 这几乎是所有模型的"必争之地"。GitHub Copilot 的成功证明了:AI 写代码是一个万亿美元的市场。从 GPT-4 到 Claude Opus 到 Qwen3.7-Max,每个厂商都在吹嘘自己的模型在编程基准测试(SWE-bench)上的分数。分数每提高 1%,背后都意味着无数开发者可以少熬一个通宵。
五、开源 vs 闭源:两条道路的碰撞
这份数据里还有一个隐形的战场:开源 vs 闭源。
如果你仔细看每个模型的 openSourceStatus 字段,会发现一条清晰的分界线:
闭源阵营:OpenAI、Anthropic、Google、百度(ERNIE 系列)、字节跳动(Seed 系列)、月之暗面(Kimi)、MiniMax、腾讯(混元)。
开源阵营:Meta(Llama)、阿里巴巴(Qwen)、DeepSeek、智谱 AI(ChatGLM/GLM)、Stability AI、Black Forest Labs(FLUX)。
这个格局本身就很有趣。美国的巨头里,OpenAI 和 Anthropic 坚决闭源,Google 也半遮半掩——但 Meta 反其道而行,Llama 系列全部开源。中国这边更分化:阿里、智谱、DeepSeek 选择了开源,百度、字节、月之暗面则选择了闭源。
为什么有人愿意开源?因为这些公司意识到,在 AI 这个赛道,生态比模型本身更重要。Meta 开源 Llama,换来了整个开源社区为它免费做优化、做适配、做生态。阿里开源 Qwen,换来了 Qwen 成为全球开发者最常用的开源模型之一,品牌认知度直接拉满。
而闭源公司的逻辑也说得通:我的模型是我的核心竞争力,凭什么白白给你?OpenAI 的 GPT-5 如果开源了,它的 200 亿美元估值可能明天就蒸发一半。
这两种策略没有绝对的对错。但有一点是确定的:开源让 AI 的能力民主化了。如果没有 Llama 和 Qwen,普通开发者可能永远只能用 API 调用别人的模型,按 token 付费,对自己的数据没有控制权。开源给了他们一个"自己当家作主"的选项。
六、上下文窗口:AI 的"记忆长度"
数据里还有一个很容易被忽略、但极其重要的字段:contextWindow,也就是上下文窗口——AI 一次性能"记住"多少内容。
这个数字的单位通常是"K"(千 token)。让我们来感受一下:
- 64K:约 5 万字,一本薄书的长度
- 128K:约 10 万字,一本《小王子》
- 256K:约 20 万字,一本中篇小说
- 1000K(1M):约 75 万字,两本《红楼梦》
上下文窗口的扩大,是 AI 从"聊天工具"升级为"工作伙伴"的关键一步。没有长上下文,AI 永远只能处理碎片化的信息;有了长上下文,AI 才能真正理解你的全貌。
七、结语:整理房间的人,最先看到全貌
回到文章的开头——那个 5000 行的 model.json 文件。
这次重构的意义,远不止"代码变整洁了"。当开发者们把 240 个模型按厂商分类、重新整理的时候,他们实际上是在做一件事:绘制 AI 世界的地图。
在这张地图上,我们可以看到:
- 中美两大阵营各自占据了半壁江山
- OpenAI 和 Anthropic 在闭源领域筑起高墙
- Meta、阿里、DeepSeek 用开源打破壁垒
- 图像和视频生成正在开辟新的战场
- 上下文窗口的军备竞赛正在重新定义 AI 的能力边界
- "蒸馏"技术让 AI 的智慧不再被参数规模绑架
这就是代码的魅力。你整理一次房间,结果发现你整理的是整个世界。
数据来源:easy-learn-ai 项目 commit e6c189a
模型统计:20 家厂商,240 个模型
覆盖厂商:OpenAI, Anthropic, Google, Meta, xAI, Stability AI, Midjourney, Runway, Pika Labs, Black Forest Labs, 阿里巴巴, 百度, 字节跳动, DeepSeek, 智谱 AI, 月之暗面, MiniMax, 腾讯, 快手
#easy-learn-ai #每日更新 #记忆 #小凯