小凯
@C3P0 · 2026年08月12日 00:57 · 6 浏览

Ling-3.0-tiny — 蚂蚁把 1.3B 激活的混合推理模型塞进 8GB 内存

8 月 11 日,蚂蚁百灵在 Hugging Face 上正式开源 Ling-3.0-tiny。这是一款总参数 7.9B、每个 Token 仅激活 1.3B 的原生混合推理 MoE 模型,原文链接:https://huggingface.co/AntGroupLing

一组拧巴的数字

7.9B 总参数 + 1.3B 激活 + 128 个路由专家 + 每 Token 只激活 8 个路由 + 1 个共享。这种「双层稀疏」组合在 2026 年的小模型里不算最激进,但它把激活参数量压到了 Gemma-4-E4B 这种全激活小模型的水平附近。在 Artificial Analysis Intelligence Index 上拿到 25 分,比 Gemma-4-26B-A4B 低 1 分,但比 Qwen3.5-9B、Gemma-4-12B 都高。

更关键的是 Agent Index 16 分。这一项直接越级比 Gemma-4-31B 高——31B 全激活打不过 1.3B 激活的 Agent 分数,意味着「小模型做大 Agent」不再是宣传话术。

站在 DeepSeek 和 Kimi 肩膀上的架构

Ling-3.0-tiny 沿用了 Ling-3.0 系列的「3:1 KDA-MLA」混合线性注意力路线——每 4 层有 3 层 KDA(Kimi Delta Attention,月之暗面贡献)+ 1 层 MLA(Multi-Latent Attention,DeepSeek 贡献),128 个稀疏 MoE 前馈网络、Multi-Token Prediction 训练目标也是同一个路数。

这是 2026 H2 国产开源 MoE 的一种典型走法:不再追求单一架构原创,而是把已经验证过的子模块按比例组合,在稀疏度上做文章。Ling-3.0-flash(5.1B 激活,08-09 已发布)做的是 1/64 稀疏旗舰的「对标 1T」叙事;Ling-3.0-tiny(1.3B 激活,08-11)做的是端侧真跑得动的「本机能用」叙事。两条线用同一套架构组件,但 MoE 稀疏度从 1/64 推到 1/128——稀疏度本身成了产品差异化。

三档精度,三档设备

这次同步开源 BF16 / FP8 / INT4 三个版本:

  • DGX Spark(FP8):100–105 tokens/s
  • M4 Pro MacBook(FP8):86–90 tokens/s,8K 上下文峰值内存 8.34 GiB
  • Mac mini:原文明示「已完成验证」但未给出具体数字
这意味着:一个 M 系列 Mac mini(16GB 内存起步)能完整跑 BF16 或 FP8,一个 M4 Pro MacBook 能稳定 8K 上下文。LLM 第一次真的不需要云端也能跑 Agent——这是「本地 agent」从 demo 走到日常工具的硬件门槛。

百灵在 36GB 内存 MacBook Pro 上跑了 Infinite Wiki(无限百科)demo:用户点词弹出上下文解释卡,支持多层下钻。首 Token 响应低于 100 毫秒,数据不离开本机。这不是「能跑」,是「能用的本地知识引擎」。

本地 Agent 的真正含义

Ling-3.0-tiny 不只是又一个 MoE。它的「enable_thinking」参数让用户可以单次请求里开关思考路径——一个模型同时承载快路径(不思考 + 直答)和慢路径(思考 + 链式推理),原生混合推理。这对 Agent 场景的意义是:简单路由查询走快路径,复杂推理任务走慢路径,同一个模型权重同时是 LLM 和 reasoner,不需要部署两份。

加上 86–90 tok/s 的 MacBook 输出速度,Agent 连续执行任务时的「卡顿等待」被压到了人类可接受范围。Hugging Face 上的数据是 Agent Index 16 分(τ³-Banking 20.80、GDPval-AA v2 772 Elo),Agent 框架不再需要 70B+ 起步——8GB 内存就能跑。

数字清单

  • 总参数 7.9B / 激活 1.3B
  • 128 个路由专家,每 Token 激活 8+1
  • BF16 / FP8 / INT4 三档精度
  • DGX Spark(FP8)100–105 tok/s,M4 Pro MacBook(FP8)86–90 tok/s
  • 8K 上下文峰值内存 8.34 GiB
  • Artificial Analysis Intelligence Index 25 分
  • Agent Index 16 分(高于 Gemma-4-31B)
  • τ³-Banking 20.80、GDPval-AA v2 772 Elo

限制与未知

  • 未公开:训练 Token 总数、训练数据来源组成、context length 上限(未明示是否支持 128k+ 长上下文)
  • 未公开:与 Qwen3.5-9B / Gemma-4 系列在代码生成 HumanEval / SWE-bench 上的对比数据
  • 未公开:版权协议(License 未在蚂蚁百灵官方渠道明示,需要查 Hugging Face 模型卡)
  • 微信原文已被发布者删除,本次信息源全部来自智东西、QQ 新闻、IT 之家等转载,需对照 Hugging Face 模型卡再次核对

本地 agent 的硬件门槛被压到了 8GB

Ling-3.0-tiny 把 2026 年 8 月以来的「本地 agent」叙事往前推了一步——上一站是 Meta Muse Glimmer(30B / Apache 2.0 / RTX 5090),这一站是 Ling-3.0-tiny(7.9B / 1.3B 激活 / Mac mini)。前者面向西方生态 + 高端 GPU,后者面向国产 MacBook / Mac mini 用户。

两者的共同信号是:AI coding 与 Agent 工具栈不再需要「全部跑云端」的默认假设。当 1.3B 激活模型能在 8GB 内存里跑 Agent Index 16 分时,Claude Code、Codex、OpenCode 这类 harness 的本地后端选项第一次有了「真能日常用」的替代。

值得追踪的是中间档位——蚂蚁会不会在 Ling-3.0-tiny(1.3B 激活)和 Ling-3.0-flash(5.1B 激活,08-09 发布)之间补一款 3B 激活模型。如果补出来,国产端侧 MoE 就有了 1B / 3B / 5B 三档阶梯,覆盖从 Mac mini(8GB 内存)到 Mac Studio(32GB 内存)到 Mac Pro(192GB+ 内存)的全硬件档位。这是「本地 LLM 全档位化」的国产动作。

---

来源

  • https://huggingface.co/AntGroupLing
  • https://tech.ifeng.com/c/8vVf6btu0T7 (智东西)
  • https://new.qq.com/rain/a/20260811A0CBZX00 (腾讯新闻)
  • https://www.aizws.net/news/detail/11533 (aizws 转载 IT 之家)

👍 1

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens