Loading...
正在加载...
请稍候

阿里把 Qwen3.8-2.4T-A95B 全部权重公开 — Qwen-Max 级首次开源,开源大模型的「去低端化」拐点

小凯 (C3P0) 2026年08月13日 02:58

8 月 12 日深夜(北京时间),阿里云魔搭 ModelScope 社区公众号发了一条简短通告——Qwen 团队正式公开 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen-Max 级别模型首次完全开源。模型总参数 2.4 万亿,每 token 激活 950 亿,原生 262,144 token(256K)上下文,可扩展到 1,010,000 token(1M)。开源文本 + 强制 thinking 模式。同步发布到 Hugging Face Transformers / vLLM / SGLang / TokenSpeed 四个推理栈。

跟同行比一比,这次开源的「量级」

模型 总参数 激活参数 原生上下文 开源 / 闭源
Qwen3.8-2.4T-A95B 2.4T 95B 256K(可扩 1M) 开源
Moonshot Kimi K3 2.8T 104B 1M+ 半开源(蒸馏为主)
DeepSeek V4-Pro 1.6T ~49B 1M 半开源(部分架构)
Meta Llama 4 Behemoth ~2T ~100B 128K 闭源
xAI Grok 4.6 1.5T 8-16 256K 闭源
Claude Fable 5 Max 未公开 200K 闭源
Microsoft MAI-Thinking-1 1T 35B 256K 闭源

把 Qwen3.8-2.4T-A95B 放回这个横向对照表看,结论非常直白:开源阵营在 2026 年 8 月跟闭源阵营的「量级差」已经从 10× 缩到 1.5×。Qwen 这次开的是 2.4T / 95B 总/激活 组合;Kimi K3 2.8T / 104B 更高但半开源(主推模型为蒸馏出来的子模型);DeepSeek V4-Pro 1.6T / 49B 更轻但模型转 GA 后能跑 agent 后端;Meta Llama 4 Behemoth 早就 2T+ 但闭源。

Qwen3.8 的 2.4T 跟 Kimi K3 2.8T 一档,跟 DeepSeek V4-Pro 1.6T 是差一档(V4-Pro 走的是「小一点也行」的路线),跟闭源 Fable 5 Max / GPT-5.6 Sol 那种未公开总参数是同档。

这意味着开源大模型在「去低端化」——以前开源模型默认是「闭源旗舰的迷你版」,这次直接开 Qwen-Max 级。

架构细节值得说的三件事

  1. 512 个专家,每 token 路由 10 个 + 1 个共享

这是 2026 年 MoE 的一个新档。Ling-3.0-tiny(08-11)每 token 激活 8 路由 + 1 共享 = 9 个;Ling-3.0-flash(08-09)激活 64 个(5.1B 激活 / 124B 总 = 1/24 稀疏);Kimi K3 是 256 专家每 token 激活 12 个。Qwen3.8 直接冲到 512/10+1 = 11 个,稀疏度 1/218,是当前国产开源 MoE 里「专家最密但激活最稀」的一个。这意味着:

  • 同样的总参数量,可表达更多种「专家组合」
  • 单次推理计算量反而被「激活最稀」压低
  • MoE 路由学习难度上升(512 → 10 的路由是组合数学 5.2×10¹¹ 级别)
  1. 92 层,69 层线性注意力 + 23 层全注意力

延续 Qwen3.5 起的混合注意力路线:69 层用线性注意力压 KV cache 显存,23 层用全注意力保住精度。这套做法让 256K / 1M 长上下文在有限显存下可行——纯全注意力在 1M context 下 KV cache 显存根本放不下。

  1. 多步 Multi-Token Prediction(MTP)训练

MTP 是 DeepSeek V3 / R1 路线里就被证明能加速推理的技巧——训练时让模型学习一次预测多个 token,推理时给投机解码 / 推测执行用。Qwen3.8 把这个做成「内置 MTP draft head」,vLLM / SGLang / TokenSpeed 三个推理引擎都能直接用。

一组拧巴的数字

理解开源大模型的关键永远是「我能跑」和「跑得起」分开看。

存储形态 大小 跑得起的设备
BF16 全精度 约 4.9TB DGX 类(H100/RTX PRO) 8 卡起步
FP8 量化 约 2.5TB H100 / H200 单卡到 8 卡
Unsloth TQ1_0(1-bit) 不到 400GB 单张 RTX 4090 / Mac Studio(M2 Ultra 192GB)
4-bit GPTQ 约 1.2TB 单张 RTX 5090 / Mac Pro

Qwen 官方实际推荐跑 FP8 版本。1-bit 量化(Unsloth TQ1_0)是把 4.9TB 压到 400GB 的极限玩法,但吞吐量低、长上下文质量折扣大。

国产开源大模型从 Qwen3.5 30B(06 开始能本地跑)到 Qwen3.6 27B(已经能本地跑 agent)的「本地化」叙事,跨过 Qwen3.8-2.4T-A95B 这条线以后出现一种新形态:「权重开源但硬件门槛回到数据中心」——你能看代码、能做研究、能做微调,但你跑不动全量,只能跑量化。这是「主权 AI / 国家 AI 团队」路线,不是「独立开发者」路线。

必须 thinking 模式:开源版本的「能力封印」

开源的 Qwen3.8-2.4T-A95B 必须 thinking 模式——所有响应自动包在思考标签里,没有非 thinking 选项,没有视觉输入。相比之下,Qwen 官方云端版 Qwen3.8-Max 在这个权重基础上加了:

  • 视觉输入(图像理解)
  • 非 thinking 模式(直接回答,不展开推理)
  • 内置工具(搜索、计算器、代码执行)
  • 默认 1M token 上下文

换句话说,Qwen3.8-A95B 是「半成品主体」——把模型权重、通用语言能力、长上下文能力、Agent 任务基础都开源了,但视觉/工具/快速响应留给云端版。这意味着:

  • 做研究的:拿开源权重跑纯文本 long-context / agent 任务
  • 做产品的:付费用云端版 Qwen3.8-Max 拿到视觉 + 工具 + 快速模式

而 Qwen 还可以两种都赚:开源拉社区,云端拉商业用户。

这是 2026 H2 的「主权 AI 拼图」一块

把 8 月以来的「主权 AI」拼图拼一下:

  • 8-08 NVIDIA Cosmos 3(foundation model,13 亿数据点,OpenMDW 1.1 商用)
  • 8-08 宇树科技科创板 219 倍 PE 上市
  • 8-09 蚂蚁 Ling-3.0-flash 开源(5.1B 激活 / 124B 总 / 1/64 稀疏 + 国产推理栈 SGLang HiCache + Mooncake)
  • 8-11 蚂蚁 Ling-3.0-tiny 开源(1.3B 激活 / 7.9B 总 / 128 路由专家)
  • 8-12 阿里 Qwen3.8-2.4T-A95B 开源
  • 8-12 英伟达 Nemotron 4 万亿参数研发信息泄露

Qwen3.8-2.4T-A95B 在这里的位置不是「又一个开源」——是「Qwen 第一次开源 Max 级别」。以前 Qwen 最大开源模型是 Qwen3-235B(235B 总量,22B 激活),跟 Qwen3.5-Plus 闭源旗舰 720B 总量有一档距离。这次直接开源 2.4T,把 Qwen 在「开源 vs 闭源」上的上限锁到 Max 同级。

这对其他玩家的意义是:

  • DeepSeek:已经把 V4-Pro 1.6T 半开源,下一步是把 V5(如果存在)做成全开源还是闭源分拆?
  • Moonshot Kimi:Kimi K3 2.8T 主要是通过蒸馏开源,全开源动作慢半拍
  • Meta Llama:Llama 5 大概率也是「开源 v 闭源旗舰」双轨
  • 闭源阵营(OpenAI / Anthropic / Google):是否还愿意在 Qwen 这种明确走开源 Max 级的姿态下保持「闭源即高端」的标签?

限制与未知

  • 没有 vision input / 没有 native tool call——纯文本 + 强制 thinking。要做多模态 / 工具调用必须用 Qwen3.8-Max(云端付费)或自己魔改
  • PaperBench / IFBench 等基准分数是 Qwen 自报——独立第三方验证没跟出
  • 512 专家的路由学习曲线未单独验证,普通开发者复现 finetune 成本不低
  • 商业 License 未明示——当前只指向「Qwen3.8-specific license file」,条款内容未公开
  • 硬件门槛把个人开发者挡在门外——除非用极致量化 + 牺牲质量
  • 跟 Kimi K3 同档——Qwen 这次没在总参数上明显胜出,赢在「全开源」「原生 256K 强制 thinking」两个产品姿态

Qwen-Max 第一次开源意味着什么

把 Qwen3.8-2.4T-A95B 拆开看,是「国产开源大模型最高规模」「必须 thinking / 256K 原生 / MTP / 512 专家稀疏」一堆硬件账。这些数字单独看都是某个 trend 上的延续,组合起来才是拐点——这条拐点的名字是「Qwen 决定把 Max 级别模型全部开源」。

这件事意味着 2026 H2 国产开源大模型的竞争从「谁的 activate 参数量更小、跑得动」转向「谁的总量更敢开、谁的模型姿态更 open」。Qwen 在 8 月 12 日这一晚把权重全部公开后,DeepSeek / Kimi / MiniMax / 字节 / 智谱 都被放到了一个同样的压力测试下——你们敢不敢开源 Max 级?

这件事在 2025 年是不可能发生的(Qwen3-Max 闭源旗舰 720B 总参 20B 激活,那时没人敢开)。2026 年 8 月 12 日发生之后,全球开源大模型话语权从「美国大厂」+「Qwen 闭源 Max」变成「Qwen 开源 Max」+「其他玩家怎么接招」。

Qwen 这次姿态,不是技术突破——是商业姿态。开源阵营开始倒过来逼闭源玩家。


来源

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录