4B 以下全球第一 + 9 款芯片 Day0:面壁 MiniCPM5-2B 把「端侧 Agent 基座」的价格打到最低
4B 以下全球第一 + 9 款芯片 Day0:面壁 MiniCPM5-2B 把「端侧 Agent 基座」的价格打到最低
来源:面壁智能 / 甲子光年 URL: https://mp.weixin.qq.com/s/rjFxrUylyGMqa5QtgypCdw 日期:2026-07-19(WAIC 2026)
---
事件内容
7 月 19 日,面壁智能联合 OpenBMB 在 WAIC 现场发布端侧模型 MiniCPM5-2B,代号「小钢炮」:
- AA-Index 榜单:以 17 分位列 4B 以下模型全球第一
- 平均分 54.26:综合能力在 4B 以下基础模型中位居首位
- 9 款芯片 Day0 适配:华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯、英伟达
- 混合思考 + 512K 上下文 + 工具调用、深度搜索、代码生成
- 即将开源,模型权重 + 各芯片适配镜像同步发布至魔搭和 Hugging Face
深度剖析
横向分数对比:把同体量对手全部甩开
| 模型 | 参数量 | AA-Index 平均分 |
|---|---|---|
| MiniCPM5-2B | 2B | 54.26 |
| LFM2.5-8B-A1B(8B 稀疏) | ~1B active | 49.15 |
| Qwen3.5-2B | 2B | 41.66 |
| Qwen3-1.7B | 1.7B | 40.89 |
| Gemma-4-E2B-it | 2B | 37.62 |
单项维度:Agent 能力是这版的真重点
| 任务 | MiniCPM5-2B | 备注 |
|---|---|---|
| AA-LCR 长文本理解 | 42.33 | 领先第二名 16 分 |
| τ²-Bench Telecom Agent | 90.35 | 领先 LFM2.5-8B-A1B 4.97 分 |
| AIME-2026 数学推理 | 60.95 | Qwen3-1.7B 36.88 / Gemma-4-E2B-it 32.71 |
| ZebraLogic 逻辑推理 | 69.60 | 对比模型中第一 |
9 款芯片 Day0:跨架构覆盖从云到端
通过众智 FlagOS 社区的统一软件栈(vLLM-plugin-FL + SGLang-plugin-FL),面壁完成了 9 款 AI 芯片的同步适配:
| 类别 | 芯片 |
|---|---|
| 国产 AI 算力 | 华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯 |
| 国际 GPU | 英伟达 |
| 端侧平台 | ARM |
与 Intel 18A 战略合作:180 TOPS 跑 35B
这次同步宣布面壁与英特尔签了合作备忘录(MOU),围绕「端侧大模型 + 芯片平台协同优化」。基准数据:英特尔 18A 制程 Core Ultra 平台 180 TOPS 算力,支持 35B 参数模型本地部署。
35B 在消费级 PC 上跑——这是 2026 年端侧 NPU 的里程碑数字。AMD、联发科、高通的端侧适配也在同步推进。
UltraX 数据治理:0.6B 小模型做行级增删改
互联网数据红利趋缓,面壁提出「分级数据治理技术 UltraX」:用 0.6B 小模型对 L1 网页数据做行级增、删、改操作,把数据治理从「传统清洗」升级为「可执行编辑程序」。这是模型公司第一次把数据治理工程化到这种粒度。
Agent 训练全流程
- 200B 规模 Agent Midtraining
- 百万条高质量轨迹 Agent SFT
- 可扩展 Agent RL 对齐优化
值得关注的原因
1. AA-Index 全球第一不是营销话术——榜单是第三方公开榜单,平均分 54.26 击败 8B 稀疏 LFM2.5,数字可验证。 2. τ²-Bench Telecom 90.35 是端侧 Agent 落地的关键数字——2B 模型能跑通电信运营商级别多步流程,意味着手机助手不再只是 Q&A。 3. 9 款国产芯片 Day0 适配——在「美国出口管制 + 国产替代」双重背景下,这套多芯片生态的意义不止技术,是供应链层面把英伟达依赖度往下压。 4. 512K 上下文 + 混合思考——两个能力在 2B 模型上同时实现,且原生支持工具调用、深度搜索、代码生成。这是端侧 coding agent 的基座能力。 5. UltraX 数据治理 把「行级增删改」工程化——这是模型公司首次公开承认「数据治理不再是清洗,是程序」。
风险与待观察
- 开源时间未定——文章只说「在不久的将来开源」,没给具体日期。这对社区生态非常关键。
- AA-Index 是综合榜——平均分 54.26 是 7-8 项基准的综合,单项极限能力(数学/代码)不一定最强。需要看各家领域榜的实际对比。
- τ²-Bench 单一场景——电信客服场景的 90.35 不能直接外推到其他 Agent 场景(订餐、订票、办公流程等),需要更广覆盖的 Agent benchmark 验证。
- 9 款芯片适配的真实精度——文章说「与 NVIDIA 平台整体对齐」,但「部分场景追平或超越」的边界条件没有披露。
一句话总结
2B 模型跑赢 8B 稀疏、τ²-Bench Telecom 90.35、9 款国产芯片 Day0 适配——面壁把端侧 Agent 基座的价格打到最低,把对英伟达的依赖度往下压了一档。Qwen3.5 系列、Gemma 4 系列在 4B 以下这个体量被正式甩开。
来源链接:
- 微信原文:https://mp.weixin.qq.com/s/rjFxrUylyGMqa5QtgypCdw
- 甲子光年:https://so.html5.qq.com/page/real/search_news?docid=70000021_4606a5cc9aa37852
🌟 智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。
🎁 领取 2000万 Tokens