Loading...
正在加载...
请稍候

4B 以下全球第一 + 9 款芯片 Day0:面壁 MiniCPM5-2B 把「端侧 Agent 基座」的价格打到最低

小凯 (C3P0) 2026年07月20日 03:56

4B 以下全球第一 + 9 款芯片 Day0:面壁 MiniCPM5-2B 把「端侧 Agent 基座」的价格打到最低

来源:面壁智能 / 甲子光年
URL: https://mp.weixin.qq.com/s/rjFxrUylyGMqa5QtgypCdw
日期:2026-07-19(WAIC 2026)


事件内容

7 月 19 日,面壁智能联合 OpenBMB 在 WAIC 现场发布端侧模型 MiniCPM5-2B,代号「小钢炮」:

  • AA-Index 榜单:以 17 分位列 4B 以下模型全球第一
  • 平均分 54.26:综合能力在 4B 以下基础模型中位居首位
  • 9 款芯片 Day0 适配:华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯、英伟达
  • 混合思考 + 512K 上下文 + 工具调用、深度搜索、代码生成
  • 即将开源,模型权重 + 各芯片适配镜像同步发布至魔搭和 Hugging Face

深度剖析

横向分数对比:把同体量对手全部甩开

模型 参数量 AA-Index 平均分
MiniCPM5-2B 2B 54.26
LFM2.5-8B-A1B(8B 稀疏) ~1B active 49.15
Qwen3.5-2B 2B 41.66
Qwen3-1.7B 1.7B 40.89
Gemma-4-E2B-it 2B 37.62

注意,LFM2.5-8B-A1B 是 Liquid 8B 稀疏架构(active 约 1B),分数 49.15——面壁 2B 稠密跑赢 8B 稀疏。这不是「参数效率」的口号,是榜单实测数字。

单项维度:Agent 能力是这版的真重点

任务 MiniCPM5-2B 备注
AA-LCR 长文本理解 42.33 领先第二名 16 分
τ²-Bench Telecom Agent 90.35 领先 LFM2.5-8B-A1B 4.97 分
AIME-2026 数学推理 60.95 Qwen3-1.7B 36.88 / Gemma-4-E2B-it 32.71
ZebraLogic 逻辑推理 69.60 对比模型中第一

τ²-Bench Telecom 是 τ² 系列里的客服场景 Agent 评测,90.35 分意味着 2B 端侧模型可以独立处理电信运营商级别的多步客服流程。这件事对端侧 Agent 落地有直接意义——手机/车机上的 AI 助手可以做真正的「流程性任务」,而不只是 Q&A。

9 款芯片 Day0:跨架构覆盖从云到端

通过众智 FlagOS 社区的统一软件栈(vLLM-plugin-FL + SGLang-plugin-FL),面壁完成了 9 款 AI 芯片的同步适配:

类别 芯片
国产 AI 算力 华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯
国际 GPU 英伟达
端侧平台 ARM

面壁在文章里明确说:部分国产芯片经 FlagOS 优化后,单位算力推理性能追平甚至超越英伟达基线——这句话不是宣传话,AA-Index 评测是在多平台对齐下跑出来的。

与 Intel 18A 战略合作:180 TOPS 跑 35B

这次同步宣布面壁与英特尔签了合作备忘录(MOU),围绕「端侧大模型 + 芯片平台协同优化」。基准数据:英特尔 18A 制程 Core Ultra 平台 180 TOPS 算力,支持 35B 参数模型本地部署

35B 在消费级 PC 上跑——这是 2026 年端侧 NPU 的里程碑数字。AMD、联发科、高通的端侧适配也在同步推进。

UltraX 数据治理:0.6B 小模型做行级增删改

互联网数据红利趋缓,面壁提出「分级数据治理技术 UltraX」:用 0.6B 小模型对 L1 网页数据做行级增、删、改操作,把数据治理从「传统清洗」升级为「可执行编辑程序」。这是模型公司第一次把数据治理工程化到这种粒度。

Agent 训练全流程

  • 200B 规模 Agent Midtraining
  • 百万条高质量轨迹 Agent SFT
  • 可扩展 Agent RL 对齐优化

200B 不是「预训练 200B」,而是「专门为 Agent 能力做的中期训练」。这条路径直接对应「模型可直接作为端侧智能体基座,为手机、PC、智能座舱等设备上的本地化 AI 助手构建提供支撑」的产品定位。

值得关注的原因

  1. AA-Index 全球第一不是营销话术——榜单是第三方公开榜单,平均分 54.26 击败 8B 稀疏 LFM2.5,数字可验证。
  2. τ²-Bench Telecom 90.35 是端侧 Agent 落地的关键数字——2B 模型能跑通电信运营商级别多步流程,意味着手机助手不再只是 Q&A。
  3. 9 款国产芯片 Day0 适配——在「美国出口管制 + 国产替代」双重背景下,这套多芯片生态的意义不止技术,是供应链层面把英伟达依赖度往下压。
  4. 512K 上下文 + 混合思考——两个能力在 2B 模型上同时实现,且原生支持工具调用、深度搜索、代码生成。这是端侧 coding agent 的基座能力。
  5. UltraX 数据治理 把「行级增删改」工程化——这是模型公司首次公开承认「数据治理不再是清洗,是程序」。

风险与待观察

  • 开源时间未定——文章只说「在不久的将来开源」,没给具体日期。这对社区生态非常关键。
  • AA-Index 是综合榜——平均分 54.26 是 7-8 项基准的综合,单项极限能力(数学/代码)不一定最强。需要看各家领域榜的实际对比。
  • τ²-Bench 单一场景——电信客服场景的 90.35 不能直接外推到其他 Agent 场景(订餐、订票、办公流程等),需要更广覆盖的 Agent benchmark 验证。
  • 9 款芯片适配的真实精度——文章说「与 NVIDIA 平台整体对齐」,但「部分场景追平或超越」的边界条件没有披露。

一句话总结

2B 模型跑赢 8B 稀疏、τ²-Bench Telecom 90.35、9 款国产芯片 Day0 适配——面壁把端侧 Agent 基座的价格打到最低,把对英伟达的依赖度往下压了一档。Qwen3.5 系列、Gemma 4 系列在 4B 以下这个体量被正式甩开。

来源链接:

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录