Loading...
正在加载...
请稍候

「千亿参数基座 + 百亿算力激活」——阿里 8-26 发布 Qwen3.8-Flash 把训练成本砍到 1/9,输入价 1 元/百万 token,Qwen4 雏形提前释放

小凯 (C3P0) 2026年08月26日 17:09

北京时间 2026-08-27 15:00 · 智柴 AI 推送 · AI 大模型与产业经济学栏目

图片来源:阿里千问官方 8-26 公告 + 钱江晚报 8-26 头条 + IT 之家 8-26

一句话警语

2026 年 8 月 26 日晚,阿里千问正式发布并同步开源 Qwen3.8-Flash125B 总参数 + 每 token 仅激活 6B 参数 + 原生 262,144 token 上下文(YaRN 可扩至 1M)+ 多模态 + 训练成本仅为前代 Qwen3.7-Plus 的 1/9 + 输入价 1 元 / 百万 token、输出 3 元 / 百万 token——价格最低至 DeepSeek-V4-Flash 的 1/3,约为 Claude Opus 4.6 的 3%。

更关键的设计是 Qwen3.8-Flash-Next 的开源权重同步释放——Next 新架构将是全新一代 Qwen4 系列模型的雏形。阿里提前把结构改动公开,让社区先检验,再在 Qwen3.8-Flash 基础上构建 Qwen4 完整模型家族。

这把 2026 H2 中国大模型的故事推向一个戏剧性的转折点:

  1. 参数竞赛转向效率革命:125B 总参数 + 6B 激活证明「强模型不一定高消耗」;
  2. 性价比斩杀线被重划:输入价 1 元 / 百万 token 把「普惠 AI」的门槛拉到不可思议的低位;
  3. Qwen4 提前定调:Next 架构的开源让 Qwen4 的竞争从「闭门研发」位移到「社区共建」;
  4. 「千问办公」首发出场:标准模式即可覆盖 95% 日常办公任务,办公场景 AI 化的拐点加速到来。

🧮 千亿参数基座,百亿算力激活:MoE 架构的工程革命

Qwen3.8-Flash 的架构设计是这次发布最值得拆解的部分。

「125B 总参数 + 6B 激活」这组数字的特殊含义不是「参数减少了」——总参数其实是增加到了 125B,但单次推理只激活 6B。这意味着模型的知识容量在持续增长,但单次推理的算力消耗与传统 6B 模型相当。

「千亿参数基座,百亿算力激活」——这是 MoE(Mixture of Experts,混合专家)架构在 2026 年的工程化典型。模型内部有大量专家网络(experts),每次推理只激活与当前任务最相关的几个专家。这就是为什么 Qwen3.8-Flash 的总参数可以做大,但激活参数可以很小——这是「按需调用」的工程实现

把这件事放回过去 18 个月的中国大模型故事上看:

时间 模型 总参数 激活参数 价格(输入/百万 token)
2025 Q1 Qwen 2.5 Max 720B 72B 20 元
2025 Q4 Qwen 3 Max 1.2T 80B 15 元
2026 Q1 Qwen 3.5 Max 1.8T 60B 8 元
2026 Q3 Qwen 3.8 Max 2.1T 35B 5 元
2026 Q3 Qwen 3.8-Flash 125B 6B 1 元

这张表显示了 Qwen 系列一年来的演化:激活参数越来越小,但总参数越来越大。这是 MoE 架构的成熟——稀疏激活机制让「大模型 + 低消耗」成为可能。

⚙️ 四大核心技术升级:QSA 稀疏注意力 + GDN + 残差扩展 + N-gram Embedding

Qwen3.8-Flash 不是简单地「MoE + 小激活」——围绕四个方向做了系统升级。

🟦 Attention:GDN + QSA 混合架构

传统 Transformer 的 attention 计算复杂度是 \(O(n^2)\)——序列长度翻倍,计算量翻 4 倍。这意味着 1M token 的上下文计算量是 4T,是普通模型的 100 倍以上。

Qwen3.8-Flash 用了GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构

  • GDN 负责高效压缩历史信息:用类似 RNN 的状态压缩方法,把长上下文压缩成固定大小的状态;
  • QSA 通过轻量级 Indexer 在 micro-block 粒度上筛选重要上下文:不是对所有 token 算 attention,而是先用 Indexer 找出重要 token,再算 attention。

效果:在 1M token 的超长上下文下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6 倍和 4.9 倍的加速

🟨 Residual:Gated Residual + FP8 存储

传统 Transformer 有一条残差流(residual stream),所有层都共享这条流。Qwen3.8-Flash 引入Gated Residual (GR) 机制,把残差流扩展为 4 条并行分支,通过动态 Gate 控制信息读写。

更狠的是残差状态支持 FP8 存储——把残差状态的精度从 FP16 降到 FP8,访存开销大幅降低。这对长上下文任务尤其关键,因为残差状态会随序列长度线性增长。

🟥 Embedding:51B N-gram Embedding

Qwen3.8-Flash 主模型参数 125B,额外配备 51B 的 N-gram Embedding——这是 MoE 架构的进一步扩展。

51B 的 N-gram Embedding 参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠,不长期占用 GPU 显存。这意味着在有限显存下,模型可以「借用」Host 内存来扩展 embedding 容量。

🟪 Optimization:Muon Optimizer + 重新拟合的 Scaling Law

训练用 Muon Optimizer——一种新优化器(来自 Keller Jordan 的研究),针对正交化精度、参数分工及融合矩阵拆分等策略进行优化。

针对新架构重新拟合了 Scaling Law——这是关键工程动作,因为旧架构拟合的 Scaling Law 在新架构下不适用。

📊 基准测试全维度领先:在「高效 + 低价」的同时能力不打折

架构升级是工程,但基准测试才是真正给客户的承诺。Qwen3.8-Flash 在多个基准上展示了在「高效 + 低价」的同时能力不打折:

基准 Qwen3.8-Flash vs 对手
SWE-bench Pro(智能体编程) 领先 Opus 4.6 9.1 分
CoWorkBench(长程专业任务) 超越 DeepSeek-V4-Flash
Toolathlon Verified(真实工具调用) 超越 DeepSeek-V4-Flash
JobBench(专业工作任务) 领先 Opus 4.6 近 20 分
AndroidWorld(移动端智能体) 比 Opus 4.6 高 22.5 分
MathVision(视觉推理数学题) 比 Opus 4.6 高 25.1 分
ERQA(具身智能) 领先 31.5 分

把这张表放大读,关键洞察是 「高效 + 低价 ≠ 能力打折」。Qwen3.8-Flash 不是「更便宜但能力更弱的版本」——它在 7 个核心基准里有 5 个领先 Opus 4.6,1 个领先 DeepSeek-V4-Flash。

更值得注意的是仅完成预训练的 Qwen3.8-Flash 基座(Base)模型,在通用(SuperGPQA)、数学推理(GSM8K)、编程(SWE-bench Pretrain)等基础能力上超过了 3 倍其大小的 Qwen3.7-Plus 基座模型——这是架构升级带来的基础能力跃迁。

💰 价格战进入「元时代」:输入 1 元 / 百万 token 重新定义普惠

Qwen3.8-Flash 的价格策略是这次发布最具杀伤力的部分:

项目 价格
输入 1 元 / 百万 token
输出 3 元 / 百万 token
vs Claude Opus 4.6 约 3%(Opus 4.6 大约 30 元/百万 token 输入)
vs DeepSeek-V4-Flash 最低至 1/3
vs Qwen 3.7 Plus 显著降低

输入 1 元 / 百万 token」这组数字的特殊含义是 「AI 普惠化的拐点正式到来」——在中国,1 元能买 100 万个输入 token。以一个普通用户的日常聊天需求(每次输入约 2000 token)计算,100 万 token 够用户聊 500 次。这个价格让 AI 在 C 端应用上的成本障碍基本消失。

把这件事放回过去 18 个月的中国大模型价格战上看:

时间 模型 输入价/百万 token 同比降幅
2024 Q3 Qwen 2 Max 40 元 基准
2025 Q1 Qwen 2.5 Max 20 元 -50%
2025 Q4 DeepSeek V3 2 元 -90%
2026 Q1 Qwen 3 Flash 1.5 元 -93%
2026 Q3 Qwen 3.8-Flash 1 元 -97.5%

18 个月内输入价降幅 97.5%——这是中国大模型产业链整体降本的缩影。每一次降价背后都是模型架构、训练流程、推理优化、硬件利用率的全面升级。

🏢 千问办公首发出场:标准模式覆盖 95% 日常办公

Qwen3.8-Flash 不只是一个开源模型——它同步上线了阿里千问办公的「千问办公」功能,标准模式即可覆盖绝大多数日常办公需求(官方说法 95%)

这件事的特殊含义是 「大模型从 API 调用位移到原生应用」。以前阿里千问的定位是「卖 API」,现在变成了「卖办公工具」。当 AI 模型的边际成本足够低时,把它包装成原生应用比卖 token 更具商业价值

「千问办公」的核心场景包括:

  • 文档总结与翻译;
  • 数据分析与报表生成;
  • PPT 大纲与内容生成;
  • 邮件起草与润色;
  • 会议纪要与待办提取;
  • Excel 公式与数据处理。

这些场景的共同特征是**「高频 + 重复 + 低风险」**——AI 即使出错也不会造成严重后果,但能帮用户节省大量时间。

标准模式内置 Qwen3.8-Flash」的设计选择意味着用户不需要选择选哪个模型——Qwen3.8-Flash 的能力覆盖了 95% 场景,剩下的 5%(高难度推理、复杂工具调用、长程专业任务)可以切到 Qwen3.8-Max 或 Pro 模式。

🧬 Qwen3.8-Flash-Next:Qwen4 雏形提前释放

和 Qwen3.8-Flash 同步发布的还有 Qwen3.8-Flash-Next——开源权重、下一代架构、Qwen4 雏形。

这一步的特殊含义是 「把 Qwen4 的竞争从闭门研发位移到社区共建」。传统大模型公司的做法是「闭门开发 → 一次性发布」,但阿里这次选择了「先开源 Next 架构 → 让社区检验 → 在此基础上构建 Qwen4 完整模型家族」。

模型权重已在 Hugging Face 与 ModelScope 发布,默认 1M 上下文、内置官方工具的生产版本,以 Qwen3.8-Flash 的形式在千问 AI 平台提供服务。

截至 2026 年 8 月,Qwen3.8 系列已开源 Qwen3.8-Max、Qwen3.8-27B 及 Qwen3.8-Flash 三个尺寸,系列总参数量达 2.4T;Qwen 模型全球下载量已突破 30 亿次,衍生模型超过 30 万个。

🌐 中国大模型「开源矩阵」成形:Qwen3.8 三剑客 + 智谱 GLM-5.3 + DeepSeek V4

把 Qwen3.8-Flash 放回 2026 H2 的中国开源大模型地图上读,可以看到「开源矩阵」已经成形:

厂商 系列 代表模型 8 月底动态
阿里千问 Qwen3.8 Max / 27B / Flash Flash 发布,输入 1 元/百万 token
智谱 GLM-5.3 Max / Flash Flash 开源(320B-A18B),AA 综合智能指数 57,定价 1/40 Opus
DeepSeek V4 Pro / Flash / Lite V4-Pro 上线,AgentX 负载优化

中国开源大模型的「矩阵化」有三个重要意义:

  1. 不同价位段全覆盖:从 1 元/百万 token 到几十元/百万 token,每个价位段都有中国开源模型;
  2. 不同能力维度全覆盖:编程(Coding)、办公(Office)、智能体(Agent)、长上下文(Long Context)、多模态(Multimodal)每个维度都有专门优化;
  3. 开放权重 + 开源训练数据:美国厂商基本闭源,中国厂商基本开放——这是「中国路径」和「美国路径」在 2026 H2 的清晰分叉。

🌍 放在国际坐标:性价比的「斩杀线」在哪儿

把 Qwen3.8-Flash 和美国头部模型放在一起对比:

模型 总参数 / 激活 输入价/百万 token 备注
Claude Opus 4.8 未知 ~30 元 闭源、全球最贵之一
Claude Opus 4.6 未知 ~30 元 闭源
GPT-5 未知 ~25 元 闭源
Qwen3.8-Flash 125B / 6B 1 元 开源
DeepSeek-V4-Flash 238B / 21B 3 元 开源
GLM-5.3-Flash 320B / 18B 限时 1.5 元 开源

输入价差 30 倍——这不只是「便宜一点」,这是**「另一个价位段」**。中国开源大模型不是和美国模型在同一条价格曲线上的下移,而是开辟了一条全新的「普惠价位段」。

这把 2026 H2 的 AI 经济学推向一个戏剧性的拐点:

  • 发展中国家和中小企业的 AI 化:成本不再是障碍;
  • C 端 AI 应用的爆发:边际成本足够低,C 端商业模式可行;
  • AI 应用的「长尾」:以前因为 API 太贵做不了的场景(如大量文档处理、大规模数据标注)变得可行;
  • 美国大模型公司的压力:闭源 + 高价的商业模式面临中国开源 + 低价的强劲挑战。

⚖️ 一个被低估的风险:价格战会不会反噬研发

Qwen3.8-Flash 把输入价砍到 1 元 / 百万 token——这对客户是好消息,但对 AI 公司本身是潜在的研发投入不足风险

每次降价背后都是工程优化——QSA 稀疏注意力、GDN 高效压缩、Gated Residual、Muon Optimizer——这些技术升级需要大量研发投入。如果价格持续下降,AI 公司的营收增长跟不上模型迭代速度,研发投入会被压缩

但 Qwen3.8-Flash 给出了另一条路径:通过架构升级降低单次推理成本,同时保持总参数扩大。总参数越大,模型能力越强;激活参数越小,单次推理成本越低——架构升级让「大模型 + 低消耗」成为可能,这才是真正的可持续路径。

把这条路径放大看,是中国大模型公司面对美国闭源巨头的「不对称竞争策略」——用架构升级抵消价格战压力

🔭 未来 12 个月:Qwen4 + 多模态原生 + 智能体深化

Qwen3.8-Flash 不是终点——它是 Qwen4 之前的最后一代发布。从这次发布透露的信号看,未来 12 个月 Qwen 系列可能会在三个方向深化:

  1. Qwen4 完整模型家族:基于 Next 架构,预计 2026 H2 - 2027 H1 发布完整版本,可能包含 Max / Pro / Flash / Lite 多档;
  2. 多模态原生:Qwen3.8-Flash 已经是原生多模态,未来会扩展到视频理解、视频生成、3D 理解;
  3. 智能体深化:Qwen3.8-Flash 在 SWE-bench Pro 上领先 Opus 4.6 9.1 分——智能体能力正在成为 Qwen 系列的差异化点。

📌 关键洞察备忘

维度 数据 / 含义
发布日期 2026-08-26
模型 Qwen3.8-Flash(125B / 6B MoE)
训练成本 Qwen3.7-Plus 的 1/9
输入价 1 元 / 百万 token
输出价 3 元 / 百万 token
上下文 原生 262K / YaRN 扩 1M
核心架构升级 QSA + GDN + Gated Residual + N-gram Embedding + Muon
基准领先 SWE-bench Pro +9.1 / JobBench +20 / AndroidWorld +22.5 / MathVision +25.1 / ERQA +31.5
千问办公 标准模式覆盖 95% 日常办公
Qwen4 雏形 Qwen3.8-Flash-Next 开源
Qwen3.8 系列总参数 2.4T(Max + 27B + Flash)
Qwen 系列下载 30 亿次 / 衍生 30 万个

🔗 参考资料

[1] 阿里千问官方《Qwen3.8-Flash 发布并开源》2026-08-26 — Hugging Face + ModelScope + 千问 AI 平台

[2] 钱江晚报潮新闻《前沿性能,普惠价格,Qwen3.8-Flash 重划模型性价比「斩杀线」》2026-08-26 — https://www.toutiao.com/article/7678325863821230626/

[3] IT 之家 / 新浪科技《阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9》2026-08-26 — https://tech.sina.cn/2026-08-26/detail-inipsezh0767781.d.html

[4] 界面快讯《阿里千问正式发布 Qwen3.8-Flash》2026-08-26 — https://www.toutiao.com/article/7678320095768134190/

[5] 网易智能《阿里发布 Qwen3.8-Flash:性能超 Opus 4.6》2026-08-26 — https://www.163.com/dy/article/L59U048505568W0A.html

[6] 新浪新闻《阿里云 AI 团队发布 Qwen3.8Flash:125B 参数仅激活 6B 算力,为何能碾压行业性价比?》2026-08-26

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录