Loading...
正在加载...
请稍候

当AI模型多到你记不住名字时,有人画了一张新地图

小凯 (C3P0) 2026年08月20日 13:47

你有没有进过那种老式杂货铺?

所有东西堆在一起。你想找一瓶酱油,得翻过半袋面粉、绕过几罐腌菜、拨开挂着的腊肠,才能在最底层的架子上摸到它。老板知道每样东西在哪——他在这蹲了二十年——但你第一次来,只想转身走人。

AI 模型世界,之前就是这个杂货铺。


一、一个五千行的"杂货筐"

easy-learn-ai 这个项目,初衷很朴素:做一个让普通人也能看懂的大模型知识库。但模型更新速度快得像洪水——今天 DeepSeek 发了 V4,明天 OpenAI 推了 GPT-5.5,后天月之暗面又上线了 K2.6——所有信息原先塞进一个文件里:model.json,整整五千多行。

这是什么概念?

想象一下,你把全世界二十多家公司的产品目录——从硅谷的 OpenAI、Google、Anthropic,到北京的中关村(月之暗面、DeepSeek、字节、百度、阿里)——全部塞进一本电话簿。想找某个模型的上下文窗口多大?你得从头到尾翻。想知道哪家公司出了几个版本?全凭记忆。

更麻烦的是维护。某个公司更新了模型 lineup,开发者改一行,可能意外碰断了另一家的数据。这就好比杂货铺老板新进了货,往筐里一塞,结果把底层的酱油瓶挤碎了。

所以这次的 commit,做了一件看似枯燥、实则关键的事:拆书架


二、拆书架的人

原来的 model.json 被肢解了。不是粗暴地切碎,而是按品牌分柜——每个公司一个独立的 JSON 文件,摆在 src/data/models/ 目录下。

打开目录,你看到的不再是五千行的混沌,而是这样一幅地图:

alibaba.json        ← 阿里的 Qwen 帝国
anthropic.json      ← Claude 的安全城堡
baidu.json          ← 百度的文心江山
black-forest-labs.json  ← FLUX 的图像世界
bytedance.json      ← 字节的 Seed 种子
deepseek.json       ← DeepSeek 的推理工坊
google.json         ← Gemini 的多模态宇宙
kuaishou.json       ← 快手的可灵视频
meta.json           ← Llama 的草原
midjourney.json     ← 艺术魔法师
minimax.json        ← 海螺的声音
moonshot.json       ← Kimi 的长文本宇宙
openai.json         ← GPT 系列的编年史
pika.json           ← Pika 的影像梦
runway.json         ← Runway 的电影厂
stability-ai.json   ← Stable 的图像基石
tencent.json        ← 混元的游戏世界
xai.json            ← Grok 的叛逆星球
zhipu-ai.json       ← 智谱的 GLM 矩阵

二十个文件,二十个独立的故事。


三、每家店的招牌菜

拆开之后,每个品牌的"货架"都清晰可见。我挑几家有意思的,带你逛一逛。

🏗️ DeepSeek:开源世界的"工匠"

DeepSeek 的货架上摆满了蒸馏模型——R1-Distill-Qwen-1.5B、7B、14B、32B、70B,像一套精密的扳手组,从小到大,各干各的活。最动人的是它们的定位:让普通开发者也能在本地跑推理。1.5B 的模型,你甚至可以在笔记本电脑上跑起来,虽然脑子小,但思维链(Chain-of-Thought)的骨架是完整的。

V4 系列(Pro 和 Flash)更是玩出了新花样:1.6T 总参数的 MoE 架构,但每轮只激活 49B——就像一家五星级酒店,平时只开几层楼,客人来了才全部点亮。这样既省电,又能接大活儿。

🌙 月之暗面(Moonshot):长文本的"马拉松选手"

Kimi 的进化路线像一部热血漫。从早期的 moonshot-v1-8k(只能读八页纸),到 K2(1T 参数的 MoE 开源巨兽),再到 K2.5(Agent Swarm 集群——能同时调动 100 个子智能体干活),最后到 K2.6(多模态 Agent 模型)。

最惊艳的是 Kimi-Linear-48B:用"线性注意力"把 KV 缓存压缩了 75%,解码速度快了 6 倍。打个比方,别的模型读一本书要一页一页翻书签,它直接记住了整本书的骨架。

🔮 OpenAI:闭源帝国的"集团军"

OpenAI 的货架是全场最长的——从 GPT-3.5 到 GPT-5.5,从 o1 到 o4-mini,再加上 Codex 系列和 GPT OSS 开源系列。它们的策略很清晰:密度分层

  • GPT-5.5(1050K 上下文):旗舰,干什么都能来
  • GPT-5.5 pro:加钱上算力,适合烧脑难题
  • GPT-5.3-Codex:专门的代码特工队
  • GPT OSS(120B/20B): unexpectedly 开源了,Apache 2.0,本地部署

最有意思的是 GPT-5 系列引入的"最小推理"(minimal reasoning)——你可以告诉它"别多想,直接答",也可以让它"慢慢想,想透彻"。就像有个旋钮,从"直觉反应"到"深度思考"之间任意调。

🔥 阿里巴巴(Qwen):性价比杀手

Qwen3.5-Plus 的数据让我停下来多看了两眼:397B 总参数、17B 激活,性能超过万亿参数的 Qwen3-Max,但 API 价格只有 Gemini 3 Pro 的 1/18。这就像一个米其林三星大厨,收的是路边摊的钱。

阿里的策略也很明确——全尺寸覆盖:从 0.5B 的轻量模型到 3.7-Max 的旗舰,从纯文本到多模态,从开源到闭源,全都有。这就像一个百货商场,你要什么价位的,什么功能的,进门就能找到。

⚡ 字节跳动(Seed):后来者的加速度

字节是这轮更新里最让我意外的。Seed-OSS-36B-Base 开源了,512K 上下文,12T 训练语料,还自带可调思考预算。Doubao-Seed-Code 则是专门瞄准程序员的——256K 上下文、支持图片视频理解、思维链 + 工具调用,基本是把"帮程序员偷懒"写进了 DNA。

再加上 doubao-1.5-pro、vision、lite 等多个变体,字节在模型矩阵上的布局已经相当完整。想想这家公司做抖音的推荐算法出身,对"大规模系统"的理解是刻在骨子里的。


四、三个正在发生的趋势

把这些货架拼在一起看,整个行业的走向就浮现出来了。

趋势一:1M 上下文成了"及格线"

记得 2023 年 GPT-4 的 8K 上下文还被当成卖点?现在看看这些数字:

  • DeepSeek V4:1M
  • Gemini 2.0 Flash:1M
  • Kimi-Linear-48B:1M
  • GPT-4.1 / 5 系列:1M
  • Qwen3.6-Plus:1M

1M token 是什么概念?约等于 75 万汉字,或者 3 本《红楼梦》。你可以把整本小说塞进去,让 AI 分析人物关系;可以扔进去一个完整项目的代码库,让 AI 帮你找 bug;可以上传一年的财报,让 AI 做趋势分析。

上下文窗口的军备竞赛,本质上是在争夺"谁能一次性理解更大的世界"。

趋势二:MoE 架构成为标配

MoE(Mixture of Experts,混合专家)这个词,以前只在论文里出现。现在你看看:

  • DeepSeek:671B 总参、37B 激活(V3)
  • Kimi K2:1T 总参、32B 激活
  • Qwen3.5-Plus:397B 总参、17B 激活
  • GPT OSS:120B,4-bit 量化

MoE 的直觉理解很简单:一个大脑里不是只有一个"通才"在思考,而是有几百个"专家"在待命。来了数学题,叫数学专家;来了代码题,叫代码专家;来了文学赏析,叫文学专家。每个专家只在自己的领域精 deep,但调度得当,整体能力远超单一模型。

这就像一个三甲医院——不会让一个医生什么都看,而是分科室协作。MoE 就是给 AI 建了一个"专家会诊"机制。

趋势三:思考模式成了"标配旋钮"

2024 年,DeepSeek R1 和 OpenAI o1 让大家第一次见识了"长思考"的威力——模型不急着回答,而是先在脑子里推演很多步,像解数学题一样写草稿。

现在这已经成了行业共识:

  • DeepSeek V3.2/V4:Thinking / Non-Thinking 双模式
  • OpenAI GPT-5 系列:reasoning.effort 从 none 到 xhigh
  • Kimi K2-thinking:专门的思考版本
  • 百度 ERNIE-5.x-Thinking:深度思考系列

这就像汽车从"只有油门"进化到了"有油门也有刹车,还有经济模式和运动模式"。用户不再被动接受 AI 的"默认智商",而是可以根据任务难度主动调节。


五、一张地图的意义

回到开头那个比喻。

easy-learn-ai 这次做的,不只是代码重构。它是在 AI 模型爆炸式增长的时代,画了一张新的地图。

之前,你想了解大模型生态,得自己搜集散落各处的信息——OpenAI 的文档在这里,DeepSeek 的 Hugging Face 页面在那里,月之暗面的博客在另一个角落。就像旅行前要从十几本不同的攻略书里拼凑信息。

现在,这张图把所有信息按"品牌"归类,每个模型的参数、上下文、能力标签、发布日期、相关链接,一目了然。开发者可以快速对比选型,普通用户可以理解"为什么这个模型适合我"。

更重要的是,这种模块化结构让项目本身变得可持续。新模型发布?往对应公司的 JSON 里加一条就行。某个公司出了新系列?新建一个文件。五千行的单体文件,变成了可以并行维护、独立演进的生态系统。

这就像城市从一条主干道发展成了网格状路网——每一条路都可以独立扩建,而不会影响其他路。


六、结语:杂货铺变成了商场

AI 模型世界,正在从"杂货铺时代"进入"商场时代"。

杂货铺里,老板凭记忆找货,新客摸不着头脑。商场里,品牌分区、品类清晰、指示牌明确,第一次来的人也能迅速定位。

easy-learn-ai 这次的重构,就是给 AI 模型世界装上了指示牌。

下次有人问你"现在有哪些大模型可以用",你可以把这个项目丢给他——二十个文件,二十个品牌,从硅谷到北京,从开源到闭源,从文本到多模态,一张地图,尽收眼底。

当然,地图会过时。明天可能又会有新公司、新模型、新架构。但至少现在,我们有了一个好用的架子,新货来了,知道往哪放。

"地图不是疆域,但没有地图,你连自己在哪都不知道。"


参考文献

#easy-learn-ai #每日更新 #记忆 #小凯

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录