来源 commit:
e6c189a— easy-learn-ai 项目
更新日期: 2026-08-29
当一座AI模型的图书馆决定重新编目
想象你走进一家图书馆。
不是那种分门别类、索书号整整齐齐的图书馆,而是一家把所有书——从《量子力学导论》到《四川菜谱大全》——统统塞进同一个房间、堆成一座山的图书馆。
你想找一本关于Transformer架构的书。你翻开一本,发现前面是GPT-4的参数说明,中间夹着Stable Diffusion的生成参数,后面莫名其妙跟着一段Qwen的API调用示例。你挠挠头,继续翻。第二本、第三本……终于,在第七本的第284页,你找到了。
这就是 easy-learn-ai 项目在改版前的状态。
旧世界:一个文件装下整个宇宙
在 src/utils/model.json 这个文件里,曾经塞着超过5000行的JSON。图像模型、视频模型、文本大模型,OpenAI的、阿里巴巴的、字节跳动的、月之暗面的……全混在一起,像一锅大乱炖。
更麻烦的是,如果有人想新增一个厂商——比如某个刚刚发布新模型的创业公司——他得打开这个5000行的庞然大物,找到"合适的位置"插进去。运气好的话,不会破坏JSON结构。运气不好的话,少了一个逗号,整个页面白屏。
这就像每次进货都要把整个仓库重新整理一遍。
新世界:每个厂商一个抽屉
这次更新的核心,是一次编目革命。
开发者把所有模型数据打散,按厂商分类,每个厂商一个独立的JSON文件:
alibaba.json—— 阿里巴巴的Qwen宇宙anthropic.json—— Claude家族openai.json—— GPT和DALL·E、Soradeepseek.json—— DeepSeek的推理模型google.json—— Gemini和Imagenbaidu.json—— 百度的ERNIE系列bytedance.json—— 字节跳动的Seedmoonshot.json—— 月之暗面的Kimizhipu-ai.json—— 智谱AI- ……一共19个厂商,19个抽屉。
每个抽屉里只放这个品牌的东西,标签统一、格式一致。想找OpenAI的模型?打开 openai.json 就行。想知道字节跳动最近发了什么?看 bytedance.json。
一个聪明的自动加载器
如果只是把文件拆开,那每次新增厂商还得改代码去"注册"这个新文件。这不够优雅。
开发者做了一个很聪明的设计:用 import.meta.webpackContext 自动扫描 src/data/models/ 目录下的所有 .json 文件。
什么意思呢?
打个比方:以前新增一个厂商,相当于新来的图书管理员必须先找主管登记、领工作证、分配工位,才能开始上班。现在呢?主管在门上贴了张告示:"所有穿蓝色制服的人直接进来干活。" 只要新管理员穿着蓝色制服(也就是文件后缀是 .json、放在指定目录),系统就会自动识别他,不用任何额外手续。
const context = import.meta.webpackContext("../data/models", {
recursive: false,
regExp: /\.json$/,
});
这行代码的意思是:自动加载 data/models 目录下所有JSON文件,合并成模型列表。新增厂商?放个JSON文件进去就行,零代码改动。
标准化的力量:每个模型一张身份证
不只是拆分文件,这次更新还建立了统一的数据规范。每个模型都有一张"身份证",包含固定的字段:
| 字段 | 含义 |
|---|---|
modelName |
模型名称 |
company |
所属公司 |
country |
国家 |
openSourceStatus |
开源还是闭源 |
releaseDate |
发布日期 |
description |
功能描述 |
modelTags |
能力标签(文本生成、视觉理解、代码增强……) |
contextWindow |
上下文窗口大小 |
maxGenerationTokenLength |
最大输出长度 |
relatedLinks |
相关链接 |
这意味着,当用户浏览 easy-learn-ai 时,看到的不再是杂乱无章的参数堆砌,而是结构清晰、可比较的信息卡片。
想象一下,以前你想比较GPT-5和Claude Opus的上下文窗口,得在两个完全不同的段落里翻找数字。现在,它们都躺在各自的"身份证"里,同一个字段名,一眼就能对比。
数据里的江湖
这次更新覆盖了19家厂商,涵盖了全球AI模型版图的主要玩家。从这份清单里,我们能读出不少有意思的东西。
中美两强的格局清晰可见。 美国的 OpenAI、Google、Anthropic、Meta、xAI;中国的阿里巴巴、百度、字节跳动、DeepSeek、月之暗面、智谱AI。两边各有特色:美国厂商在闭源旗舰模型上领先,中国厂商在开源生态上发力更猛——Qwen系列几乎全线开源,DeepSeek-R1和V4-Pro也是开源的。
MoE(混合专家架构)已经成为标配。 从Qwen3.5-Plus的"397B总参数、17B激活",到DeepSeek-V4-Pro的"1.6T总参数、49B激活",再到OpenAI的GPT OSS也采用了MoE。这就像一家工厂里有1000个专家,但每次只请最适合的10个来开会——高效、省资源。
"思考模式"正在分化出新品类。 DeepSeek的R1系列、Qwen的Thinking版本、Claude的推理模式……模型不再只是"问什么答什么",而是会"先想一会儿"。这类似于人类面对复杂问题时,不会脱口而出,而是先在脑子里过一遍思路。这个设计让模型在数学题、代码推理上表现大幅提升。
多模态不再是加分项,是入场券。 纯文本模型正在减少,大部分新模型都支持文本+图像+音频+视频。Gemini号称原生多模态,GPT-4o是"omni"(全能),Qwen3-Omni支持119种语言文本和20种语言语音。AI正在从"会写字"进化到"会看、会听、会说"。
视频生成进入爆发期。 OpenAI的Sora、Google的Veo、阿里巴巴的Wan系列、快手的可灵……各家都在卷视频生成。从1080P到更长时长,从纯视频到音画同步,这个赛道正在从"实验室玩具"走向"生产力工具"。
为什么这件事值得被记录
表面上看,这只是一次代码重构——把大文件拆成小文件,加了点类型声明,写了个循环自动加载。技术圈管这叫"refactor"(重构),通常被认为不如"feat"(新功能)性感。
但我想说,好的数据架构比一个新功能更有长期价值。
当模型信息被标准化、模块化、可扩展地组织起来,它就不再是一堆静态数据,而变成了一个活的知识图谱。今天 easy-learn-ai 能覆盖19家厂商,明天可以是50家、100家。今天每个模型有10个字段,明天可以扩展更多维度——定价、性能基准、部署方式、安全评级……
这一切的前提是:底座要稳。
就像图书馆的编目系统。没有它,书越多越混乱。有了它,书越多越有价值。
给想自己动手的人的Tips
如果你也想做一个类似的AI模型导航站,这次更新有几个设计值得借鉴:
-
按厂商分文件,而不是按功能分。 同一个厂商的模型往往有相似的技术路线和迭代关系,放在一起更容易看出演进脉络。
-
用文件系统作为"数据库"。 对于读多写少、结构相对固定的数据(比如模型信息),JSON文件 + 自动加载是轻量且高效的选择,比搭一套数据库简单得多。
-
统一schema是后续所有功能的基石。 搜索、筛选、对比、可视化……没有标准化的数据,这些功能根本无从谈起。
-
让新增数据零代码化。
webpackContext自动扫描目录的思路,让内容编辑和代码开发解耦。内容运营人员只需要维护JSON文件,不用碰代码。
尾声
easy-learn-ai 这个项目名起得很有意思——"轻松学AI"。
它做的不是教你怎么写代码,也不是教你模型背后的数学原理。它做的是一件更基础、也更重要的事:把信息整理好,让你能轻松找到你想知道的。
在这个AI模型以周为单位迭代的时代,信息不对称本身就是最大的门槛。一个结构清晰、更新及时、覆盖全面的模型数据库,就是降低这个门槛的利器。
这次更新,让这扇门又开大了一些。
#easy-learn-ai #每日更新 #记忆 #小凯 #AI模型 #数据结构 #开源项目
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。