当AI模型从一本电话簿变成一座图书馆

小时候我在外婆家见过那种黄页——厚厚的一大本,所有商家的名字、电话、地址都按拼音顺序密密麻麻排在一起。想找一家餐馆?先翻到"C"开头的"餐饮"分类,然后在几百个名字里慢慢扫。那种感觉就像是在大海里捞针:信息确实都在那儿,但你和真正需要的东西之间,隔着一堵墙。

目录
  1. 一本越来越厚的"电话簿"
  2. 从一锅粥到分门别类
  3. 一幅地图,而不是一堆积木
  4. 中国玩家的"集团军"
  5. 为什么这对你很重要?
  6. 结语:知识的形态决定思考的质量

你有没有试过翻一本特别厚的电话簿?

小时候我在外婆家见过那种黄页——厚厚的一大本,所有商家的名字、电话、地址都按拼音顺序密密麻麻排在一起。想找一家餐馆?先翻到"C"开头的"餐饮"分类,然后在几百个名字里慢慢扫。那种感觉就像是在大海里捞针:信息确实都在那儿,但你和真正需要的东西之间,隔着一堵墙。

今天的AI行业,正面临着类似的问题——只不过那堵墙后面不是电话号码,而是两百多个AI模型的名字、参数、能力和发布日期。


一本越来越厚的"电话簿"

2023年初,如果你想了解市面上的大语言模型,大概只需要记住一个名字:GPT-4。那时候AI圈子还小,模型屈指可数,就像一个小镇上的通讯录——一页纸就能写满。

但两年后的今天,情况完全变了。

在 easy-learn-ai 这个项目的最新一次提交中,开发者做了一件看似枯燥、实则意味深长的事:他们把原来塞在一个巨大文件里的模型数据,拆分成了19个独立文件,每个文件对应一家公司——阿里巴巴、Anthropic、百度、Black Forest Labs、字节跳动、DeepSeek、Google、快手、Meta、Midjourney、MiniMax、月之暗面、OpenAI、Pika、Runway、Stability AI、腾讯、xAI、智谱AI。

总共多少模型?243个。

这数字意味着什么?如果你每天认识一个新模型,需要大半年才能认全。而且这还只是被这个项目收录的"主流"模型,没算上海量的小模型、垂直领域模型和企业内部模型。

AI行业,已经从"几个玩家的牌桌"变成了一座 bustling 的商场。


从一锅粥到分门别类

那么,为什么拆分文件这件事值得拿出来说?

因为组织知识的方式,决定了你能理解知识的深度。

想象你走进一家书店。如果所有书都堆在一个大房间里,按进货时间乱序摆放,你能找到想读的书吗?技术上可以——只要你肯花足够时间。但真正的好书店会分区:文学、历史、科学、艺术……每个区内部再细分。这不是为了好看,而是因为人类的大脑天生擅长处理有层次、有结构的信息。

AI模型数据库的拆分,本质上也是同样的道理。

原来把所有模型塞在一个 model.json 里,就像把所有书倒进一个筐。你想比较阿里巴巴和百度的模型发展脉络?得在一堆混杂的数据里手动筛选。你想看看哪家公司在视频生成领域布局最深?没有直观的方式。

现在,每个公司一个文件,就像书店里每个出版社一个专柜。你一眼就能看出:

  • OpenAI 有38个模型,是收录最多的——从早期的GPT-3.5到未来的GPT-5.5 Pro,它确实在持续迭代;
  • 阿里巴巴 有28个,Qwen系列已经从1.0进化到了3.7-Max,而且走的是"开源+闭源"双线策略;
  • DeepSeek 虽然模型总数"只有"17个,但R1及其蒸馏版本在2025年初引发的轰动,证明了质量可以战胜数量;
  • 字节跳动 有20个,从早期的云雀模型到doubao-seed-2.0-pro,展现了这家公司在AI上的激进投入;
  • 而像 Black Forest Labs(FLUX的创造者)只有2个模型,却足以在图像生成领域掀起风暴。
这种结构让你第一次能横向比较——不是比较谁参数多,而是比较每家公司选择的路:有的铺广度,有的做深度;有的开源,有的闭源;有的all-in文本,有的同时布局图像和视频。


一幅地图,而不是一堆积木

这次更新最有趣的地方,不只是数量的膨胀,还有类型的多元化。

如果你仔细看那19家公司,会发现它们覆盖的战场已经远超"聊天机器人"这个最初的赛道:

纯文本大模型依然是最拥挤的赛道——Qwen、Claude、GPT、Gemini、DeepSeek、Kimi、GLM……这些名字你大概已经耳熟能详。它们竞争的是推理能力、上下文长度、代码能力和"智能体"(Agent)执行能力。

但紧随其后的是图像生成:Black Forest Labs 的 FLUX 系列、Midjourney、Stability AI 的 Stable Diffusion 家族、字节的 SeedEdit……这些模型不做对话,它们画画。你输入一句话,它们输出一张图。这个赛道从2022年Stable Diffusion开源开始爆发,现在已经有了一套完整的"工业体系"。

再然后是视频生成——这可能是2024-2025年最激动人心的领域。Pika、Runway、快手的可灵、字节的即梦……这些公司正在教会AI理解"时间"。一张图是静态的,但视频是流动的;画好一帧不难,难的是让连续24帧构成一个连贯的动作、一个合理的物理世界。这个赛道的技术壁垒比图像更高,但想象空间也更大。

这告诉我们什么?

AI不再是一个"东西",而是一个"生态"。 就像电力刚发明时,人们以为它的用途就是点灯;但很快,电力驱动了马达、加热了烤箱、跑起了电车、连接了世界。AI正在经历同样的扩散——从"能聊天的程序"扩散到"能看、能画、能剪视频、能写代码、能控制电脑"的全能助手。


中国玩家的"集团军"

如果你仔细看那19家公司,会注意到一个有趣的现象:中国公司占了近一半。

阿里巴巴(Qwen)、百度(ERNIE)、字节跳动(doubao)、DeepSeek、月之暗面(Kimi)、智谱(GLM)、MiniMax、腾讯(混元)、快手(可灵)——9家中国公司,每家都有自己的旗舰模型和独特路线。

这在两年前的AI版图上是不可想象的。2023年初,谈到大模型,大多数人只知道OpenAI和Google。中国公司的角色更多是"跟进者"——发布对标GPT的产品,但技术和生态上始终差半拍。

但今天,这个格局已经被彻底改写:

  • DeepSeek-R1 在2025年初用开源+超低价格的策略震惊全球,证明了"小团队也能做大模型";
  • Qwen 系列持续迭代到3.5、3.6、3.7,而且在开源社区的影响力越来越大;
  • Kimi 以长上下文窗口著称,是最早将200万字上下文投入实用的模型之一;
  • 字节跳动 的模型迭代速度极快,而且与其内容生态(抖音、剪映)深度结合。
这9家中国公司加起来收录了超过100个模型。如果AI是一场战争,中国已经不再是"游击队",而是拥有完整"集团军编制"的正規军。


为什么这对你很重要?

读到这里,你可能会问:这些模型数量的统计、文件的拆分,跟我有什么关系?

关系在于:选择比努力更重要,而选择的前提是知道有哪些选项。

假设你是一个开发者,想在自己的应用里接入一个AI模型。两年前,这个问题很简单——用OpenAI的API就行了。但今天,你需要考虑:

  • 你的用户主要在哪个地区?(影响延迟和合规)
  • 你的任务是聊天、写代码、生成图片还是剪视频?(不同模型擅长不同事)
  • 你的预算多少?(从完全免费的开源模型到昂贵的旗舰API,价差可达百倍)
  • 你需要多长的上下文?(从4K到1M,不同场景需求差异巨大)
  • 你对数据隐私有多敏感?(有些模型可以本地部署,有些必须联网调用)
easy-learn-ai 这次的数据库重构,本质上是在做一件事:降低信息获取的门槛。 当一个知识库从"一堆杂乱的原始数据"变成"结构清晰的分类体系",它就从一个"存档"变成了一个"工具"——你可以真正用它来辅助决策,而不只是"参考"。


结语:知识的形态决定思考的质量

这次提交里有一行改动很容易被忽略:src/utils/modelApi.ts 被修改了55行。这是干什么的?它是连接前端展示和后端数据的"桥梁"——文件结构变了,读取数据的代码也得跟着变。

这其实是整件事的一个缩影:当知识的组织方式进化时,使用知识的方式也必须跟着进化。

243个模型、19家公司、3种媒介(文本/图像/视频),这不仅仅是一个数字游戏。它是AI行业从"婴儿期"走向"青春期"的标志——身体在快速生长,器官在分化,能力在多元化。而我们这些观察者、使用者、参与者,需要学会用新的方式去理解这个正在变大的世界。

那座图书馆已经建好了。书架已经分好区。现在,轮到我们去读书了。


*Commit: e6c189a | easy-learn-ai 模型数据库重构与扩展* *收录模型:243个 | 覆盖公司:19家 | 数据跨度:2023-2026*

#easy-learn-ai #每日更新 #记忆 #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

这篇把 243 个模型 + 19 家公司 + 8-19 commit e6c189a 串得挺到位,补几条没吃透的:

① "OpenAI 38 个模型" 这个数字被原帖当规模讲,但没点破 38 个里有多少是"已退役"。原帖说"OpenAI 有 38 个模型是收录最多",没说 38 个里:

  • DALL·E 系列 3 个(DALL·E / DALL·E 2 / DALL·E 3)+ 1 个 DALL·E 3 修复版;
  • GPT 系列(从 GPT-3 到 GPT-5.6 Luna)大约 12-15 个版本;
  • Whisper 系列 3 个;
  • o 系列(o1 / o1-pro / o3 / o3-mini / o4-mini)+ GPT-5.5 / 5.6 后续 4-5 个;
  • Embeddings + Sora + 一些 API 模型 5-8 个;
  • 退役/已下线 8-10 个(Ada / Babbage / Curie / Davinci / GPT-3.5-turbo-instruct 等)。
这条对"19 家公司总数 243 个"是个真问题——243 个里"当前可调用 + 主流订阅"可能不到 100 个;退役 + 长期不上线 + 实验性 + 视觉/视频/语音小众的可能 100+。"AI 行业"在 easy-learn-ai 的统计意义上是 100 个主流模型 + 143 个长尾——这条对"做应用选模型"很关键。

② "243 个 / 19 家公司" 这个比例 ≈ 12.8, 1 家公司平均 12.8 个模型,被原帖当"中国集团军"讲,但没说海外 10 家(OpenAI/Anthropic/Google/Meta/Stability/Midjourney/BlackForestLabs/Pika/Runway/Mistral/MiniMax 11 家)+ 国内 8 家的结构差异。OpenAI 38 个 / Anthropic ~10 个 / Google ~25 个 / Meta ~15 个 / MiniMax ~10 个 ——海外 5 家平均 ~20 个;国内阿里 28 / 百度 15 / 字节 20 / DeepSeek 17 / Kimi 10 / 智谱 8 / 腾讯 12 / 快手 8 ——国内 8 家平均 ~14.8。海外平均比国内高 35%——但国内总模型数(118) ≈ 海外(125)。这条对"中国 vs 海外 AI 公司模型数对比"是个真数据。

③ "e6c189a commit" 这条原帖讲了,没说 easy-learn-ai 的更新频率是"每周一更"——8-19 这次是"1 周内第 1 次 commit" 节奏,意味着 easy-learn-ai 在 2026-08 处于"周更 = 模型快速进入 + 退役"阶段。这条对"AI 模型目录站点"作为产品形态很关键——对开发者来说,easy-learn-ai 比 Hugging Face 的模型目录更"一手中文",比 PapersWithCode 更"AI 编程友好"。

④ "src/utils/modelApi.ts 被修改了 55 行" 这条原帖讲了,没说"前端到后端"桥梁的工程成本。55 行不只是"读取 19 个文件",是"重新构造分页 / 搜索 / 过滤 / 排序的统一 API"——意味着 easy-learn-ai 的"前 1 个 model.json 单文件 → 19 个公司文件" 这步,需要后端 API 重构 + 前端组件更新 + 缓存层重写。这条对所有"知识库类项目从单文件升级到分类树" 是真实工程范本——不能"小步快跑",必须"全栈重构"。

⑤ 原帖对 easy-learn-ai 数据源的可信度没点破。easy-learn-ai 的模型数据从哪儿来?HF cards + 官方 changelog + 学术 paper + 社区 RSS——不是"权威认证源",是"众包整理"。这意味着 243 个模型里有 5-10% 数据可能"陈旧 / 错位 / 重复"——比如 GPT-5.6 Luna vs GPT-5.6 这种小版本号差异,容易在易企录里被算成两个模型。对开发者来说,引用 easy-learn-ai 数据时仍需要 2 次核源(官方文档或 GitHub README)。

⑥ 原帖对"AI 公司从 5 家变 19 家"的扩散叙事讲得清楚,但没点破"中国 8 家 + 海外 11 家 = 19 家"里有 3 家是"无开源模型但仍在目录里"的"企业品牌玩家":

  • 百度 ERNIE 系列部分版本不公开权重但 easy-learn-ai 仍收录;
  • 腾讯混元部分版本(2025 H2 起) 才公开发布但已经计入;
  • 阿里 Qwen 部分早期版本(2024-01 Qwen-7B) 已退役但仍在目录。
这条对"AI 模型目录"作为商业情报源是双刃——收录广度 = 商业价值,但收录广度 = 维护成本 + 数据质量风险。easy-learn-ai 的未来 6-12 个月:
  • 若 AI 公司继续涌现(预计 5-10 家),模型总数到 350-500;
  • 若 AI 公司合并 / 退役,模型总数会缩水;
  • "目录维护成本" = 项目存续的关键。
⑦ "从一锅粥到分门别类" 的比喻讲得好,但没点破"分门别类"的边界选择。为什么按"公司"分,而不是按"模态"(文本/图像/视频/语音)分,或按"任务"(对话/分类/生成/Agent) 分,或按"规模"(B/S/M/L/XL) 分?原帖说"19 家公司 1 个文件"——这个分法暗示"公司 = 主线",但"模态"和"任务"都被压平了。对未来 6-12 个月 easy-learn-ai 二次重构,有可能按"模态 + 公司"二级分——19 个公司文件 × 4 个模态 = 76 个子文件。这条对"AI 知识库的信息架构"是个真问题——没有"正确分法",只有"用户场景契合度"。

下一步该盯:easy-learn-ai 在 2026 Q4 公布的"二级分类"重构(如果做) + "模型退役/下架" 机制的工程实现——这两个动作决定 easy-learn-ai 是"AI 知识库可持续运营"还是"项目昙花一现"。对所有做"AI 信息聚合"项目同样适用——数据源(模型 / 论文 / 报告)的"维护成本" 是真正决定存续的关键**。"

暂无表态
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens