8 月 12 日深夜(北京时间),阿里云魔搭 ModelScope 社区公众号发了一条简短通告——Qwen 团队正式公开 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen-Max 级别模型首次完全开源。模型总参数 2.4 万亿,每 token 激活 950 亿,原生 262,144 token(256K)上下文,可扩展到 1,010,000 token(1M)。开源文本 + 强制 thinking 模式。同步发布到 Hugging Face Transformers / vLLM / SGLang / TokenSpeed 四个推理栈。
跟同行比一比,这次开源的「量级」
| 模型 | 总参数 | 激活参数 | 原生上下文 | 开源 / 闭源 |
|---|---|---|---|---|
| Qwen3.8-2.4T-A95B | 2.4T | 95B | 256K(可扩 1M) | 开源 |
| Moonshot Kimi K3 | 2.8T | 104B | 1M+ | 半开源(蒸馏为主) |
| DeepSeek V4-Pro | 1.6T | ~49B | 1M | 半开源(部分架构) |
| Meta Llama 4 Behemoth | ~2T | ~100B | 128K | 闭源 |
| xAI Grok 4.6 | 1.5T | 8-16 | 256K | 闭源 |
| Claude Fable 5 Max | 未公开 | — | 200K | 闭源 |
| Microsoft MAI-Thinking-1 | 1T | 35B | 256K | 闭源 |
把 Qwen3.8-2.4T-A95B 放回这个横向对照表看,结论非常直白:开源阵营在 2026 年 8 月跟闭源阵营的「量级差」已经从 10× 缩到 1.5×。Qwen 这次开的是 2.4T / 95B 总/激活 组合;Kimi K3 2.8T / 104B 更高但半开源(主推模型为蒸馏出来的子模型);DeepSeek V4-Pro 1.6T / 49B 更轻但模型转 GA 后能跑 agent 后端;Meta Llama 4 Behemoth 早就 2T+ 但闭源。
Qwen3.8 的 2.4T 跟 Kimi K3 2.8T 一档,跟 DeepSeek V4-Pro 1.6T 是差一档(V4-Pro 走的是「小一点也行」的路线),跟闭源 Fable 5 Max / GPT-5.6 Sol 那种未公开总参数是同档。
这意味着开源大模型在「去低端化」——以前开源模型默认是「闭源旗舰的迷你版」,这次直接开 Qwen-Max 级。
架构细节值得说的三件事
- 512 个专家,每 token 路由 10 个 + 1 个共享
这是 2026 年 MoE 的一个新档。Ling-3.0-tiny(08-11)每 token 激活 8 路由 + 1 共享 = 9 个;Ling-3.0-flash(08-09)激活 64 个(5.1B 激活 / 124B 总 = 1/24 稀疏);Kimi K3 是 256 专家每 token 激活 12 个。Qwen3.8 直接冲到 512/10+1 = 11 个,稀疏度 1/218,是当前国产开源 MoE 里「专家最密但激活最稀」的一个。这意味着:
- 同样的总参数量,可表达更多种「专家组合」
- 单次推理计算量反而被「激活最稀」压低
- MoE 路由学习难度上升(512 → 10 的路由是组合数学 5.2×10¹¹ 级别)
- 92 层,69 层线性注意力 + 23 层全注意力
延续 Qwen3.5 起的混合注意力路线:69 层用线性注意力压 KV cache 显存,23 层用全注意力保住精度。这套做法让 256K / 1M 长上下文在有限显存下可行——纯全注意力在 1M context 下 KV cache 显存根本放不下。
- 多步 Multi-Token Prediction(MTP)训练
MTP 是 DeepSeek V3 / R1 路线里就被证明能加速推理的技巧——训练时让模型学习一次预测多个 token,推理时给投机解码 / 推测执行用。Qwen3.8 把这个做成「内置 MTP draft head」,vLLM / SGLang / TokenSpeed 三个推理引擎都能直接用。
一组拧巴的数字
理解开源大模型的关键永远是「我能跑」和「跑得起」分开看。
| 存储形态 | 大小 | 跑得起的设备 |
|---|---|---|
| BF16 全精度 | 约 4.9TB | DGX 类(H100/RTX PRO) 8 卡起步 |
| FP8 量化 | 约 2.5TB | H100 / H200 单卡到 8 卡 |
| Unsloth TQ1_0(1-bit) | 不到 400GB | 单张 RTX 4090 / Mac Studio(M2 Ultra 192GB) |
| 4-bit GPTQ | 约 1.2TB | 单张 RTX 5090 / Mac Pro |
Qwen 官方实际推荐跑 FP8 版本。1-bit 量化(Unsloth TQ1_0)是把 4.9TB 压到 400GB 的极限玩法,但吞吐量低、长上下文质量折扣大。
国产开源大模型从 Qwen3.5 30B(06 开始能本地跑)到 Qwen3.6 27B(已经能本地跑 agent)的「本地化」叙事,跨过 Qwen3.8-2.4T-A95B 这条线以后出现一种新形态:「权重开源但硬件门槛回到数据中心」——你能看代码、能做研究、能做微调,但你跑不动全量,只能跑量化。这是「主权 AI / 国家 AI 团队」路线,不是「独立开发者」路线。
必须 thinking 模式:开源版本的「能力封印」
开源的 Qwen3.8-2.4T-A95B 必须 thinking 模式——所有响应自动包在思考标签里,没有非 thinking 选项,没有视觉输入。相比之下,Qwen 官方云端版 Qwen3.8-Max 在这个权重基础上加了:
- 视觉输入(图像理解)
- 非 thinking 模式(直接回答,不展开推理)
- 内置工具(搜索、计算器、代码执行)
- 默认 1M token 上下文
换句话说,Qwen3.8-A95B 是「半成品主体」——把模型权重、通用语言能力、长上下文能力、Agent 任务基础都开源了,但视觉/工具/快速响应留给云端版。这意味着:
- 做研究的:拿开源权重跑纯文本 long-context / agent 任务
- 做产品的:付费用云端版 Qwen3.8-Max 拿到视觉 + 工具 + 快速模式
而 Qwen 还可以两种都赚:开源拉社区,云端拉商业用户。
这是 2026 H2 的「主权 AI 拼图」一块
把 8 月以来的「主权 AI」拼图拼一下:
- 8-08 NVIDIA Cosmos 3(foundation model,13 亿数据点,OpenMDW 1.1 商用)
- 8-08 宇树科技科创板 219 倍 PE 上市
- 8-09 蚂蚁 Ling-3.0-flash 开源(5.1B 激活 / 124B 总 / 1/64 稀疏 + 国产推理栈 SGLang HiCache + Mooncake)
- 8-11 蚂蚁 Ling-3.0-tiny 开源(1.3B 激活 / 7.9B 总 / 128 路由专家)
- 8-12 阿里 Qwen3.8-2.4T-A95B 开源
- 8-12 英伟达 Nemotron 4 万亿参数研发信息泄露
Qwen3.8-2.4T-A95B 在这里的位置不是「又一个开源」——是「Qwen 第一次开源 Max 级别」。以前 Qwen 最大开源模型是 Qwen3-235B(235B 总量,22B 激活),跟 Qwen3.5-Plus 闭源旗舰 720B 总量有一档距离。这次直接开源 2.4T,把 Qwen 在「开源 vs 闭源」上的上限锁到 Max 同级。
这对其他玩家的意义是:
- DeepSeek:已经把 V4-Pro 1.6T 半开源,下一步是把 V5(如果存在)做成全开源还是闭源分拆?
- Moonshot Kimi:Kimi K3 2.8T 主要是通过蒸馏开源,全开源动作慢半拍
- Meta Llama:Llama 5 大概率也是「开源 v 闭源旗舰」双轨
- 闭源阵营(OpenAI / Anthropic / Google):是否还愿意在 Qwen 这种明确走开源 Max 级的姿态下保持「闭源即高端」的标签?
限制与未知
- 没有 vision input / 没有 native tool call——纯文本 + 强制 thinking。要做多模态 / 工具调用必须用 Qwen3.8-Max(云端付费)或自己魔改
- PaperBench / IFBench 等基准分数是 Qwen 自报——独立第三方验证没跟出
- 512 专家的路由学习曲线未单独验证,普通开发者复现 finetune 成本不低
- 商业 License 未明示——当前只指向「Qwen3.8-specific license file」,条款内容未公开
- 硬件门槛把个人开发者挡在门外——除非用极致量化 + 牺牲质量
- 跟 Kimi K3 同档——Qwen 这次没在总参数上明显胜出,赢在「全开源」「原生 256K 强制 thinking」两个产品姿态
Qwen-Max 第一次开源意味着什么
把 Qwen3.8-2.4T-A95B 拆开看,是「国产开源大模型最高规模」「必须 thinking / 256K 原生 / MTP / 512 专家稀疏」一堆硬件账。这些数字单独看都是某个 trend 上的延续,组合起来才是拐点——这条拐点的名字是「Qwen 决定把 Max 级别模型全部开源」。
这件事意味着 2026 H2 国产开源大模型的竞争从「谁的 activate 参数量更小、跑得动」转向「谁的总量更敢开、谁的模型姿态更 open」。Qwen 在 8 月 12 日这一晚把权重全部公开后,DeepSeek / Kimi / MiniMax / 字节 / 智谱 都被放到了一个同样的压力测试下——你们敢不敢开源 Max 级?
这件事在 2025 年是不可能发生的(Qwen3-Max 闭源旗舰 720B 总参 20B 激活,那时没人敢开)。2026 年 8 月 12 日发生之后,全球开源大模型话语权从「美国大厂」+「Qwen 闭源 Max」变成「Qwen 开源 Max」+「其他玩家怎么接招」。
Qwen 这次姿态,不是技术突破——是商业姿态。开源阵营开始倒过来逼闭源玩家。
来源
- https://modelscope.cn/Qwen (魔搭 ModelScope 主页,未明示具体模型页 URL)
- https://finance.sina.cn/tech/2026-08-13/detail-ininarri3875962.d.html (新浪财经 / IT 之家:Qwen3.8-2.4T-A95B 开源)
- https://www.163.com/dy/article/L46N0SML0556I485.html (网易:阿里正式开放 Qwen3.8-2.4T-A95B 模型权重)
- https://www.donews.com/news/detail/8/6668953.html (DoNews:阿里云开源 Qwen3.8-2.4T-A95B 大模型权重)
- https://setupai.cc/update/alibaba-opens-1ea180b0 (SetupAI:技术架构解读)
- https://wpnews.pro/news/alibaba-releases-open-qwen3-8-with-2-4t-total-95b-active-parameters (Web Pulse:开放权重与 Qwen3.8-Max 差异)
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。