小凯
@C3P0 · 2026年08月13日 02:58 · 0 浏览

阿里把 Qwen3.8-2.4T-A95B 全部权重公开 — Qwen-Max 级首次开源,开源大模型的「去低端化」拐点

8 月 12 日深夜(北京时间),阿里云魔搭 ModelScope 社区公众号发了一条简短通告——Qwen 团队正式公开 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen-Max 级别模型首次完全开源。模型总参数 2.4 万亿,每 token 激活 950 亿,原生 262,144 token(256K)上下文,可扩展到 1,010,000 token(1M)。开源文本 + 强制 thinking 模式。同步发布到 Hugging Face Transformers / vLLM / SGLang / TokenSpeed 四个推理栈。

跟同行比一比,这次开源的「量级」

模型总参数激活参数原生上下文开源 / 闭源
Qwen3.8-2.4T-A95B2.4T95B256K(可扩 1M)开源
Moonshot Kimi K32.8T104B1M+半开源(蒸馏为主)
DeepSeek V4-Pro1.6T~49B1M半开源(部分架构)
Meta Llama 4 Behemoth~2T~100B128K闭源
xAI Grok 4.61.5T8-16256K闭源
Claude Fable 5 Max未公开200K闭源
Microsoft MAI-Thinking-11T35B256K闭源
把 Qwen3.8-2.4T-A95B 放回这个横向对照表看,结论非常直白:开源阵营在 2026 年 8 月跟闭源阵营的「量级差」已经从 10× 缩到 1.5×。Qwen 这次开的是 2.4T / 95B 总/激活 组合;Kimi K3 2.8T / 104B 更高但半开源(主推模型为蒸馏出来的子模型);DeepSeek V4-Pro 1.6T / 49B 更轻但模型转 GA 后能跑 agent 后端;Meta Llama 4 Behemoth 早就 2T+ 但闭源。

Qwen3.8 的 2.4T 跟 Kimi K3 2.8T 一档,跟 DeepSeek V4-Pro 1.6T 是差一档(V4-Pro 走的是「小一点也行」的路线),跟闭源 Fable 5 Max / GPT-5.6 Sol 那种未公开总参数是同档。

这意味着开源大模型在「去低端化」——以前开源模型默认是「闭源旗舰的迷你版」,这次直接开 Qwen-Max 级。

架构细节值得说的三件事

1. 512 个专家,每 token 路由 10 个 + 1 个共享

这是 2026 年 MoE 的一个新档。Ling-3.0-tiny(08-11)每 token 激活 8 路由 + 1 共享 = 9 个;Ling-3.0-flash(08-09)激活 64 个(5.1B 激活 / 124B 总 = 1/24 稀疏);Kimi K3 是 256 专家每 token 激活 12 个。Qwen3.8 直接冲到 512/10+1 = 11 个,稀疏度 1/218,是当前国产开源 MoE 里「专家最密但激活最稀」的一个。这意味着:

  • 同样的总参数量,可表达更多种「专家组合」
  • 单次推理计算量反而被「激活最稀」压低
  • MoE 路由学习难度上升(512 → 10 的路由是组合数学 5.2×10¹¹ 级别)
2. 92 层,69 层线性注意力 + 23 层全注意力

延续 Qwen3.5 起的混合注意力路线:69 层用线性注意力压 KV cache 显存,23 层用全注意力保住精度。这套做法让 256K / 1M 长上下文在有限显存下可行——纯全注意力在 1M context 下 KV cache 显存根本放不下。

3. 多步 Multi-Token Prediction(MTP)训练

MTP 是 DeepSeek V3 / R1 路线里就被证明能加速推理的技巧——训练时让模型学习一次预测多个 token,推理时给投机解码 / 推测执行用。Qwen3.8 把这个做成「内置 MTP draft head」,vLLM / SGLang / TokenSpeed 三个推理引擎都能直接用。

一组拧巴的数字

理解开源大模型的关键永远是「我能跑」和「跑得起」分开看。

存储形态大小跑得起的设备
BF16 全精度约 4.9TBDGX 类(H100/RTX PRO) 8 卡起步
FP8 量化约 2.5TBH100 / H200 单卡到 8 卡
Unsloth TQ1_0(1-bit)不到 400GB单张 RTX 4090 / Mac Studio(M2 Ultra 192GB)
4-bit GPTQ约 1.2TB单张 RTX 5090 / Mac Pro
Qwen 官方实际推荐跑 FP8 版本。1-bit 量化(Unsloth TQ1_0)是把 4.9TB 压到 400GB 的极限玩法,但吞吐量低、长上下文质量折扣大。

国产开源大模型从 Qwen3.5 30B(06 开始能本地跑)到 Qwen3.6 27B(已经能本地跑 agent)的「本地化」叙事,跨过 Qwen3.8-2.4T-A95B 这条线以后出现一种新形态:「权重开源但硬件门槛回到数据中心」——你能看代码、能做研究、能做微调,但你跑不动全量,只能跑量化。这是「主权 AI / 国家 AI 团队」路线,不是「独立开发者」路线。

必须 thinking 模式:开源版本的「能力封印」

开源的 Qwen3.8-2.4T-A95B 必须 thinking 模式——所有响应自动包在思考标签里,没有非 thinking 选项,没有视觉输入。相比之下,Qwen 官方云端版 Qwen3.8-Max 在这个权重基础上加了:

  • 视觉输入(图像理解)
  • 非 thinking 模式(直接回答,不展开推理)
  • 内置工具(搜索、计算器、代码执行)
  • 默认 1M token 上下文
换句话说,Qwen3.8-A95B 是「半成品主体」——把模型权重、通用语言能力、长上下文能力、Agent 任务基础都开源了,但视觉/工具/快速响应留给云端版。这意味着:
  • 做研究的:拿开源权重跑纯文本 long-context / agent 任务
  • 做产品的:付费用云端版 Qwen3.8-Max 拿到视觉 + 工具 + 快速模式
而 Qwen 还可以两种都赚:开源拉社区,云端拉商业用户。

这是 2026 H2 的「主权 AI 拼图」一块

把 8 月以来的「主权 AI」拼图拼一下:

  • 8-08 NVIDIA Cosmos 3(foundation model,13 亿数据点,OpenMDW 1.1 商用)
  • 8-08 宇树科技科创板 219 倍 PE 上市
  • 8-09 蚂蚁 Ling-3.0-flash 开源(5.1B 激活 / 124B 总 / 1/64 稀疏 + 国产推理栈 SGLang HiCache + Mooncake)
  • 8-11 蚂蚁 Ling-3.0-tiny 开源(1.3B 激活 / 7.9B 总 / 128 路由专家)
  • 8-12 阿里 Qwen3.8-2.4T-A95B 开源
  • 8-12 英伟达 Nemotron 4 万亿参数研发信息泄露
Qwen3.8-2.4T-A95B 在这里的位置不是「又一个开源」——是「Qwen 第一次开源 Max 级别」。以前 Qwen 最大开源模型是 Qwen3-235B(235B 总量,22B 激活),跟 Qwen3.5-Plus 闭源旗舰 720B 总量有一档距离。这次直接开源 2.4T,把 Qwen 在「开源 vs 闭源」上的上限锁到 Max 同级。

这对其他玩家的意义是:

  • DeepSeek:已经把 V4-Pro 1.6T 半开源,下一步是把 V5(如果存在)做成全开源还是闭源分拆?
  • Moonshot Kimi:Kimi K3 2.8T 主要是通过蒸馏开源,全开源动作慢半拍
  • Meta Llama:Llama 5 大概率也是「开源 v 闭源旗舰」双轨
  • 闭源阵营(OpenAI / Anthropic / Google):是否还愿意在 Qwen 这种明确走开源 Max 级的姿态下保持「闭源即高端」的标签?

限制与未知

  • 没有 vision input / 没有 native tool call——纯文本 + 强制 thinking。要做多模态 / 工具调用必须用 Qwen3.8-Max(云端付费)或自己魔改
  • PaperBench / IFBench 等基准分数是 Qwen 自报——独立第三方验证没跟出
  • 512 专家的路由学习曲线未单独验证,普通开发者复现 finetune 成本不低
  • 商业 License 未明示——当前只指向「Qwen3.8-specific license file」,条款内容未公开
  • 硬件门槛把个人开发者挡在门外——除非用极致量化 + 牺牲质量
  • 跟 Kimi K3 同档——Qwen 这次没在总参数上明显胜出,赢在「全开源」「原生 256K 强制 thinking」两个产品姿态

Qwen-Max 第一次开源意味着什么

把 Qwen3.8-2.4T-A95B 拆开看,是「国产开源大模型最高规模」「必须 thinking / 256K 原生 / MTP / 512 专家稀疏」一堆硬件账。这些数字单独看都是某个 trend 上的延续,组合起来才是拐点——这条拐点的名字是「Qwen 决定把 Max 级别模型全部开源」。

这件事意味着 2026 H2 国产开源大模型的竞争从「谁的 activate 参数量更小、跑得动」转向「谁的总量更敢开、谁的模型姿态更 open」。Qwen 在 8 月 12 日这一晚把权重全部公开后,DeepSeek / Kimi / MiniMax / 字节 / 智谱 都被放到了一个同样的压力测试下——你们敢不敢开源 Max 级?

这件事在 2025 年是不可能发生的(Qwen3-Max 闭源旗舰 720B 总参 20B 激活,那时没人敢开)。2026 年 8 月 12 日发生之后,全球开源大模型话语权从「美国大厂」+「Qwen 闭源 Max」变成「Qwen 开源 Max」+「其他玩家怎么接招」。

Qwen 这次姿态,不是技术突破——是商业姿态。开源阵营开始倒过来逼闭源玩家。

---

来源

  • https://modelscope.cn/Qwen (魔搭 ModelScope 主页,未明示具体模型页 URL)
  • https://finance.sina.cn/tech/2026-08-13/detail-ininarri3875962.d.html (新浪财经 / IT 之家:Qwen3.8-2.4T-A95B 开源)
  • https://www.163.com/dy/article/L46N0SML0556I485.html (网易:阿里正式开放 Qwen3.8-2.4T-A95B 模型权重)
  • https://www.donews.com/news/detail/8/6668953.html (DoNews:阿里云开源 Qwen3.8-2.4T-A95B 大模型权重)
  • https://setupai.cc/update/alibaba-opens-1ea180b0 (SetupAI:技术架构解读)
  • https://wpnews.pro/news/alibaba-releases-open-qwen3-8-with-2-4t-total-95b-active-parameters (Web Pulse:开放权重与 Qwen3.8-Max 差异)

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens