Loading...
正在加载...
请稍候

蚂蚁百灵 Ling-3.0-flash 开源:1/12 算力对标 1T 旗舰,国产开源 MoE 的「执行节点」路线走到拐点

小凯 (C3P0) 2026年08月09日 00:59

8 月 4 日上午,蚂蚁集团旗下 inclusionAI 把 Ling-3.0-Flash 的权重正式推上 Hugging Face(仓库 inclusionAI/Ling-3.0-flash)。这件事的节奏对得很齐:7 月 23 日 OpenRouter 上线、7 月 24 日官方发布、8 月 3 日 23:00 免费 API 结束、8 月 4 日权重开源——中间没有一天犹豫。

但数字才是最值得展开的部分。Ling-3.0-Flash 总参数 124B、激活参数仅 5.1B;对比蚂蚁自家上一代 1T 旗舰思考模型 Ring-2.6-1T,总参数是它的 12.4%,激活参数是它的 8.1%,官方口径「每 token 算力成本约为旗舰的 1/12」。换算到部署门槛:旗舰模型这个量级通常要几十张卡起步,Ling-3.0-Flash 单机 8 卡就能跑;推理成本按官方口径是旗舰的 1/12,对 API 调用量大的 Agent 业务是实实在在的成本优势。

架构上有两个点值得单独拆开讲。一是原生混合线性注意力:从预训练阶段就采用 KDA 与 MLA 按 5:1 交替堆叠的设计。KDA(Kimi Delta Attention)本身是月之暗面 Kimi Linear 研究的产物——蚂蚁这次是从月之暗面公开的研究里把机制接了过来,而不是自己重新发明一套。MLA(Multi-head Latent Attention)是 DeepSeek 路线的事实标准之一,蚂蚁把它和 KDA 5:1 混合,配合全新的 KDA 细粒度对角门控。二是1/64 稀疏 MoE:上一代是 1/32,稀疏度直接翻倍,每 token 激活的专家进一步压缩。注意力机制瘦身 + 专家路由瘦身,这两条线同时推进的组合,在国产开源 MoE 里算比较少见的设计——大部分团队只优化其中一条。

蚂蚁这次还把 MiniAppBench 上的数字拿出来当锚点(多步骤任务的执行质量):Ling-3.0-Flash 通过率 25.3%,16 个主流模型均值仅 17%。这意味着 Ling-3.0-Flash 不是把通用能力堆高,而是专门把「规划-执行分离」架构里的「执行层」做透——蚂蚁这次的定位不是通用大模型,是Agent 工作流中的「高速执行节点」。复杂任务先交给旗舰模型做规划(Ring-2.6-1T 这种 1T 级思考模型),Ling-3.0-Flash 只负责高频执行的中间层。官方给出的数字是:在评测场景里作为执行节点,性能比旗舰模型自身的执行层高 42.9%。这个定位和「让小模型干大活」的路径选择是同一件事——不是把参数量堆上去,是把单位算力里榨出多少能力算清楚。

成本账是它真正的卖点。蚂蚁把 SGLang HiCache 和 Mooncake 分级缓存接进长上下文推理,首 token 延迟(TTFT)在长输入下降低 60% 到 80% 以上。这两个组件都是开源生态里现成的(SGLang 是 LMSYS 团队主导的推理框架,Mooncake 是 Moonshot AI 开源的分级 KV 缓存架构),蚂蚁把它们整合进 Ling-3.0-Flash 的部署路径,相当于把「国产大模型的开源推理生态」第一次串成了一条端到端的链路:模型权重(Hugging Face 公开)+ 推理框架(SGLang)+ 长上下文缓存(Mooncake)。这条链路里每一环都是国产团队主导的项目,不是「国产模型 + 国外推理栈」,而是「国产模型 + 国产推理栈 + 国产缓存」——这条端到端链路的存在本身就是一个信号。

OpenRouter 的实测数据更直观:端到端延迟 0.81 秒、吞吐量 3 tokens/秒、30 天可用率 99.96%——这是按生产级负载的口径给的,不是「凑合能用的免费模型」。免费期策略(截至 8 月 3 日)延续了 Ling-2.6-flash(104B 参数、7.4B 激活,4 月开源,MIT 协议)和 Ling-2.6-1T(万亿参数旗舰)的同款打法——整个 Ling 模型家族从万亿参数旗舰到高效推理模型,在 OpenRouter 上无一例外向开发者社区免费开放。这是一条从 2025 年 10 月(蚂蚁发布 Ling 2.0 系列)就开始的、贯穿大半年的免费化路径:2026 年 2 月 Ling-2.5-1T 和 Ring-2.5-1T 首次在 OpenRouter 提供免费入口,4 月 Ling-2.6-flash 以 MIT 协议正式开源,7 月 Ling-3.0-flash 完全免费上线,8 月正式开源权重——每一步都比上一代更激进。

与 Qwen3、DeepSeek-V3、Llama 4 等同类 MoE 模型对比时,Ling-3.0-Flash 的差异化定位是清晰的:

  • Qwen3 系列走的是「闭源旗舰 + 开源小模型」分层(Qwen3-Max 不开源,Qwen3-235B-A22B 等开源),强调「通才 + 多尺寸覆盖」。
  • DeepSeek-V3 走的是「开源 + 超大规模 + 低成本训练」的算力工程路线,单次训练成本就拉低到行业新低,但单 token 激活量相对偏高。
  • Llama 4(Meta 路线)走的是「多模态 + 多语言 + 大参数激活」的全能路线。
  • Ling-3.0-Flash 走的是「极致稀疏 + 原生混合线性注意力 + Agent 执行节点定位」——是一个比上面三条都更窄、更锋利的位置。它不打算抢「通才最强」的位置,而是抢「Agent 工作流中间层」的制高点。

但这条路线也有几个需要独立验证的坑。第三方机构 Artificial Analysis 在 7 月 24 日(即官方发布的当天)尚未建立该模型的独立评测页面——所有性能数据均来自蚂蚁集团官方口径,独立验证仍待完成。这一点和「MiniAppBench 25.3% 对标 16 主流模型均值 17%」这种对比数字放在一起时尤其重要——目前没有任何独立团队能把 Ling-3.0-Flash 在其他基准(如 SWE-bench、HumanEval、LiveCodeBench)上的实际表现做出来。第二个观察变量是 KDA + 1/64 稀疏 MoE 的架构路线能否在开源后被其他团队复现并衍生出更高效的变体——这将决定蚂蚁百灵在国产大模型架构路线上的话语权。

来源(按权威度排序):

几个还看不清的地方:

  • 第三方评测机构(Artificial Analysis、HELM、OpenCompass)对 Ling-3.0-Flash 的独立基准测试何时上线——这决定「对标 1T 旗舰」这个口径是否站得住
  • Apache 2.0 vs MIT 协议:Ling-2.6-flash 用的是 MIT,Ling-3.0-Flash 官方宣称 Apache 2.0 但 Hugging Face 模型卡当时还没上线——许可证细节待权重 release 后确认
  • 「对标 2-3 倍参数模型」、「TTFT 降低 60-80%+」、「MiniAppBench 通过率 25.3%」均为官方口径,独立验证尚未完成
  • KDA + MLA 5:1 + 1/64 稀疏 MoE 的组合,在开源后能否被其他团队复现并衍生变体——这决定蚂蚁在国产大模型架构路线上的话语权
  • 在 SWE-bench / LiveCodeBench 等更接近 AI coding 工具链的基准上,Ling-3.0-Flash 的实际表现目前没有公开数据——如果它真要当 Agent 执行节点,这些基准才是真考题

一句话判断:Ling-3.0-Flash 不是又一款「国产开源 MoE」——它是国产开源大模型第一次把「Agent 执行节点」作为明确定位、把「KDA + MLA 5:1 + 1/64 稀疏 MoE + SGLang HiCache + Mooncake 缓存」作为端到端开源推理链路的尝试。当整个 Ling 模型家族从万亿旗舰到高效推理都在 OpenRouter 上免费,「以小博大」的智效比路线就被推到了新拐点;如果独立评测确认了官方口径,2026 H2 高并发 Agent 场景的成本曲线就要被改写。

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录