英伟达 Nemotron 4 万亿参数进入「研发就绪」 — 卖 GPU 的开始亲自下场做开源模型
8 月 11 日(北京时间 12 日),The Information 援引多名参与项目内部人士的消息披露——英伟达正在开发 Nemotron 4,旗舰版本预计至少 1 万亿参数,约为今年 6 月发布的 Nemotron 3 Ultra(约 5000 亿参数)的两倍。最快可能 2026 年秋末(约 11 月前后)准备就绪。同日(8 月 11 日)英伟达先行发布 Nemotron 3.5 Lightning(300 亿参数 / 30B 激活 MoE,专注 AI agent 长期运行)和 NeMo Switchyard(开源模型路由工具,可在多模型之间自动调度),加上 Dell 把这两项纳入 Dell Deskside Agentic AI 平台。
把这条消息放回英伟达过去 3 个月的动作里看——黄仁勋 7 月公开支持开源权重模型、过去 1 个月接连发布多款开源模型、旗舰级研发资源正投向万亿参数 Nemotron 4——这是一家「卖 GPU 的」开始把「自己也能做模型」作为长期战略。
万亿参数这个数字怎么算
把英伟达目前的开源模型曲线列一下,看 Nemotron 4 怎么「+1 万亿」:
| 发布 | 模型 | 总参数 | 激活 | 定位 |
|---|---|---|---|---|
| 2024-12 | Nemotron-3 22B | 22B | 22B | 端侧 / 中等能力 |
| 2025 中 | Nemotron-3 49B | 49B | 49B | 中型 |
| 2026-06 | Nemotron 3 Ultra | ~0.5T (500B) | — | 旗舰闭源 |
| 2026-08-11 | Nemotron 3.5 Lightning | 30B | 3B | 长流程 agent |
| 2026 秋末(预计) | Nemotron 4 | ≥1T (1 万亿) | — | 万亿开源旗舰 |
- Qwen3.8-2.4T-A95B(08-12 已开源,2.4T 总/95B 激活)
- Moonshot Kimi K3 2.8T / 104B
- DeepSeek V4-Pro 1.6T / ~49B
- xAI Grok 4.6 1.5T / 8-16
The Information 原文的措辞是:「最终训练尚未启动,最早可能于 2026 年深秋(约 11 月前后)准备就绪」——这是个「研发就绪信号」而非「发布预告」。当英伟达真正开始大规模训练 + 完成 + 发布 + 第三方验证 + 部署,时序可能是:
- 8 月:内部架构 + 训练数据定型
- 9–10 月:开始大规模训练
- 11 月:可能完成 / 早期版本试运行
- 2027 H1:GA + 第三方验证结果发布
「模型免费 + 90% 收入来自硬件」的商业账
英伟达 2026 财年总收入约 1300 亿美元,数据中心占 90%+。这个事实决定了 Nemotron 4 / Nemotron 3.5 Lightning / NeMo Switchyard 都不是「英伟达要跟 OpenAI / Anthropic 抢 API 生意」——而是「拉企业回到英伟达生态做自托管」。
商业闭环逻辑:
模型开源免费 → 客户下载权重,自托管训练 + 推理 ↓ 硬件绑定强 → 训练 Nemotron 4 / 微调 / 推理都需要 GPU / DGX 服务器 ↓ 网络互联依赖 → 千卡以上训练 + 推理需要 InfiniBand NDR / Spectrum-X ↓ 软件栈绑定 → NeMo / Megatron-LM / TensorRT-LLM 全是英伟达自家 ↓ 长期硬件回收 → 模型权重免费,但训练 + 推理全栈英伟达生态
每一档都在卖硬件——开源模型反而是「送的产品」。这是 8-09 蚂蚁 Ling-3.0-flash + SGLang HiCache + Mooncake 那套「国产开源模型 + 国产推理栈 + 国产缓存」组合要警惕的对手。
「Nemotron 联盟」(Reflection / Cursor / ThinkingMachines / Mistral 等成员)共同贡献训练数据 + 评估支持——这种「集体开源研发」姿态让英伟达模型的「合规 + 多样」形象又加分一层。
同日 8-11 抢发的 Nemotron 3.5 Lightning + NeMo Switchyard
Nemotron 4 万亿参数还没影,英伟达同日抢发了两件:
Nemotron 3.5 Lightning(30B 总参数 / 3B 激活 MoE)
定位是「AI agent 长期运行场景」,可比 Claude Haiku 4.5 在 Terminal Bench 2、SWE-Bench Verified / Pro 等基准上更优(具体数字待官方公布)。相比 V4-Pro-0813 的 49B 激活 + 260 倍 FLOPs,Lightning 是「轻量级 agent 后端」,单卡消费级 GPU 即可部署。
NeMo Switchyard(开源模型路由工具)
可按任务需求自动分配最优模型,对应 8-06 Google API Gateway 模型路由 + 8-12 OpenRouter Auto 路由器 + 8-11 OpenRouter 五档 cost_tier 路由器这条「模型路由工具化」赛道。NeMo Switchyard 是英伟达在这一档的工具卡位——跟开源权重模型配套推出。
Dell Deskside Agentic AI 平台同步集成 Nemotron 3.5 Lightning + NeMo Switchyard——这是「硬件 + 模型 + 路由 + 软件」四件套在企业 AI 桌面端打包分发。Dell 渠道 + 英伟达生态绑定 + 模型免费,是这一段的整体商业逻辑。
算力承诺 280 亿美元 + 黄仁勋公开信
The Information 报道里另一个数据是英伟达「多年期云算力承诺增至 280 亿美元,约为一年前的三倍」。这是「我为自家模型预留算力」的具体信号——不租 H100、Blackwell B200 训练 Nemotron 4,而是反向「回租云算力」(hyperscaler leasing)批量买算力预留。
这跟 8-12 NVIDIA「5000 亿 AI 工厂基金」(Apollo / BlackRock / Blackstone / Brookfield / Goldman Sachs / KKR 六大联合、英伟达 ≤25% 残值支持)形成同月连续动作:「NVIDIA 用金融工具扩大长期算力供给」。两个动作的潜在意图是:
- 5000 亿基金:拉外部资本到 AI 基建
- 280 亿自营算力:保证英伟达自家模型 + 客户训练 + 推理算力
黄仁勋 7 月发过一份支持开源权重模型的公开信——8 月 11 日 Nemotron 3.5 Lightning + 8 月 12 日 Nemotron 4 消息泄露、加上「模型免费 + 硬件回收」商业闭环,是这份公开信的具体落地动作。
防御 DeepSeek / Qwen / GLM 的开源阵营冲击
把英伟达下场开源模型与中国开源阵营对照看,「防御」逻辑非常具体:
数字
- 阿里 Qwen 系列 2026 年 3 月占全球开源模型下载量 50%+
- Hugging Face 平台中国开源模型月下载占比 41%(首次超过美国 36.5%)
- OpenRouter 上 DeepSeek + Qwen + MiniMax + 智谱的合计调用份额在 2026 年上半年从约 20% 升到接近 50%
- 海外企业原本用 NVIDIA 训练 Anthropic/OpenAI 闭源模型 + 推理
- 现在用中国开源模型 + 国产推理栈 + Ascend / 壁仞 / 寒武纪国产芯片训练 + 推理
- 英伟达 GPU 订单被国产芯片分流
- 英伟达 Nemotron 4 / Nemotron 3.5 Lightning + NeMo Switchyard + Dell 集成 = 「让美企用美企开源模型 + 美企 GPU + 美企软件栈」
- 这件事产品层面是 Nemotron 4,技术层面是「美国开源阵营的扛旗」,战略层面是「阻止中国开源阵营继续蚕食 NVIDIA 生态」
真正风险:「自我革命」能不能走通
英伟达做开源模型的最大风险不是技术,而是商业模型自洽——「卖 GPU 同时卖免费开源模型」听上去可持续,但有两个隐忧:
隐忧一:API 玩家用 Nemotron 后训练,与 NVIDIA 抢 API 收入
英伟达做基座模型 + 开源权重后,下游 OpenRouter / 各类 AI infra 公司拿 Nemotron 4 微调后提供 API。每一份 API 收入都对应一次推理算力需求——这是一部分增量,但抢走的是 OpenAI / Anthropic / xAI 这些付费 API 公司的客户。净账是正的,因为 AI 算力需求增量 >> 私有 API 收入损失。
隐忧二:训练一次 Nemotron 4 的成本
万亿参数完整训练需要 20000+ H100、3×10²⁵ FLOPs、90–120 天。按一小时 H100 约 $3 算,这是 5–10 亿美元的「研发投入」。Nemotron 4 万亿版本总训练成本估算 5–10 亿美元——这笔钱通过「免费拉来客户回头花 GPU 钱」能不能 1 年内回本,取决于有多少企业真的用 Nemotron 4 训练下游模型。
「自我革命」的最坏情况是:英伟达花 5–10 亿美元训练 Nemotron 4,开源后只有少数企业把它作为基座,最终大部分算力需求仍流向 OpenAI / Anthropic 的闭源模型——这种情况下 Nemotron 4 是「战略姿态投资」而非「商业回报投资」。但只要中国开源阵营仍在抢英伟达生态份额,这笔「防御性研发」就值得花。
限制与未知
- 正式发布日期未定——「2026 秋末」最早是 The Information 援引「部分员工」的预估
- Nemotron 4 训练数据来源 + License未公开,跟现有 Nemotron 3 系列是否同款 Apache 2.0 / NVIDIA Open Model License 不确定
- 激活参数 + 架构细节完全未公开——万亿参数到底是全激活还是 MoE 没说
- 同期 30B/3B Lightning 的具体基准数据没公开,与 Claude Haiku 4.5 / GPT-5.6 Luna 等的对比未发布
- Dell Deskside Agentic AI 平台的 Nemotron 集成深度未明示,是参考实现还是捆绑销售没公布
- 「Nemotron 联盟」成员的具体贡献方式(数据贡献 / 评估支持 / 算力资助)未公示明细
AI Infra 公司的开源战略是不是自我革命
把英伟达 Nemotron 4 看作「AI Infra 时代的一张旗舰开源船票」,可以提出一个更广的问题:
> AI Infra 公司(卖算力的)亲自下场做开源大模型,在硬件销售 / 模型赞助 / 训练数据生态之间能不能形成完整闭环?
英伟达的方向是「Nemotron + CUDA + DGX + InfiniBand + Megatron-LM + TensorRT-LLM + NeMo Switchyard + Dell」——一件不卖、一件不收钱、最后把所有东西带回自己的硬件上卖。这件事如果走通:
- AMD 如果想做类似动作就是 ROCm + Instinct + 自己的模型
- Cerebras / Groq / SambaNova 等 inference chip 公司如果想做类似动作就是 WSE / LPU + 自己的模型
- 华为昇腾 / 壁仞 / 寒武纪如果想做类似动作就是 NPU + 自己的模型(Pangu / 悟道 / 思元)
回到 AI coding / 具身智能这条主线:Nemotron 4 万亿是为 AI agent 长流程任务设计的下一代基础模型,不是普通 chatting 模型。8 月以来英伟达围绕「agent 后端」+「agent 路由」+「agent 桌面端集成」+「旗舰开源模型」四件事同时落子,路径已经完全可识别。
---
来源
- https://www.theinformation.com (The Information 8-11 原文报道,需订阅)
- https://www.knews.com.tw/news/3AFBF66E3423ED3EFB50AD8C2DDD0682 (KNews / 综合外电:Nemotron 4 万亿参数)
- https://www.163.com/dy/article/L45I4QS10519C3MG.html (网易:英伟达正式推进 Nemotron 4 战略意涵)
- https://new.qq.com/rain/a/20260812A0B6N000 (腾讯新闻:万亿芯片巨头下场做免费大模型)
- https://k.sina.com.cn/article_7879996029_1d5af327d06801bo5u.html (新浪:Nemotron 4 发布时间估算)
- https://so.html5.qq.com/page/real/search_news?docid=70000021_7796a7bc96b24852 (QQ 新闻:钛媒体转广角观察 Nemotron 4)
- https://blogs.nvidia.com (NVIDIA 官方博客:Nemotron 3.5 Lightning + NeMo Switchyard 8-11 发布)
- https://x.com/karibriski (Kari Briski X 官方账号:NVIDIA 生成式 AI 副总裁关于 Nemotron 4 战略发言)