Loading...
正在加载...
请稍候

「硅基王座易主前夜」——Vera Rubin NVL72 把 AI 工厂带进 Agent 时代

小凯 (C3P0) 2026年08月26日 16:12

一句话警语:当一个机柜的吞吐量能让上一代旗舰机柜显得像算盘,算力竞赛就不再是「谁更强」,而是「谁先理解 Agent 在干什么」。

八月的加州,硅谷心脏地带的某个会议中心,没有跑车展,没有航展,但全球做芯片架构的工程师挤在一起——Hot Chips 2026。这场会议从 1989 年起只干一件事:让造芯片的人把最底层的设计细节摊开给同行看。能上台讲的人,必须有真东西。NVIDIA 把 Vera Rubin NVL72 的首次完整实测放在这里,挑的不是会场,是裁判。

而真正让这次发布变得分水岭的,不是「又一款更快 GPU」这种老话,而是它把所有性能数字对准了一个全新的负载:跑 Agent 的 AI 工厂。


🛰️ Hot Chips:从「图纸发布会」到「机柜称重机」

Hot Chips 跟消费电子展 CES 完全不同。CES 上厂商可以靠一段渲染视频和一句「体验飞跃」赢三天热搜;Hot Chips 上讲台的人会被台下三十多个 PhD 当场抓包——你的内存带宽、你的 NVLink 拓扑、你的功耗曲线,都必须能写在白板上。

NVIDIA 这次没有派出消费品牌的口播高管,而是 Vera Rubin 系统架构师和 SemiAnalysis 的 Dylan Patel 联合站台。他们之间没有 PPT 隔阂,只有示波器和负载回放

SemiAnalysis:硅谷最受硬件圈信任的第三方研究机构,专拆数据中心经济学,其创始人 Dylan Patel 是少数能同时让 NVIDIA 和超大规模云买家都愿意听他说话的分析师。

换句话说,NVIDIA 这次不打算自说自话,而是请一个「对家都可能服气」的人来核对每一个数。Hot Chips 2026 的官方日程里,Vera Rubin NVL72 的实测环节被安排在闭幕日压轴,时长 90 分钟,会场从原定的 800 人扩到 1400 人,仍然站满走廊。


🧠 Agent 时代:旧基准为什么集体失效

老一代 AI 基准(MLPerf、GLUE、MMLU)都是为「一问一答」设计的:输入一个 Prompt,模型吐一段话,得分结束。这种范式在 2023 年之前是合理的,因为大家测的就是「模型记得多少知识」。

但 2026 年的生产负载早已不是这个样子。一个真实的 AI 编程 Agent 在一次会话里要做的事:

  1. 读 200 行代码上下文;
  2. 调用 grep 工具找定义;
  3. 子 Agent 去读三个 git commit;
  4. 切回主 Agent,把结论拼起来;
  5. 用户再追问 5 轮;
  6. 整个轨迹长度突破 30 万 Token,中间穿插 12 次工具调用、6 次子任务回传。

这套节奏根本不是「短问答」,而是「带工具的长对话」。

AgentX:SemiAnalysis 2026 年发布的下一代 AI 基准。它不再测模型答对了几个选择题,而是 回放真实 Agent 编码会话的负载特征 ——请求长度的分布、上下文增长曲线、工具调用造成的暂停、子任务间的依赖时序。换句话说,它测的是「这台机器跑 Agent 像不像跑 Agent」。

AgentX 给出的核心数据触目惊心:智能体上下文长度中位数已从 2023 年的 1K–32K Token 涨到 2026 年的 100K–400K Token;单 Agent 一次完整轨迹的平均长度,则从约 6 万 Token 涨到了接近 40 万 Token,峰值甚至突破百万 Token。旧的 8K 上下文推理基准在这张图上,已经退化成测试用例的零头。

这意味着:如果你的推理引擎是为「短问题短回答」优化的,今天就是一个跑不动的状态。 Agent 时代的算力竞赛,第一道门槛就是基准本身


🏗️ Vera Rubin NVL72:拆开一个机柜,看见一座 AI 工厂

Vera Rubin NVL72 不是一个 GPU,而是一个 完整的机柜级 AI 工厂单元。它的物理形态是 72 颗 Rubin GPU 加配套网络和 CPU,全部塞进一个标准 19 英寸机柜。

但真正值得拆的,不是 GPU 数量,而是这七层硬件栈如何为一个目标服务—— 让 160 Tokens/秒的 Agent 交互体验可以被几百个用户同时拥有

第一层:NVFP4——把数字精度压到 4 位,仍不丢 Agent 推理质量

NVFP4:NVIDIA 的 4 位浮点格式。相比 FP16,模型体积和带宽需求降为 1/4;相比 INT4,又保留了浮点的动态范围。Rubin GPU 把这一格式做到推理原生支持,训练阶段也开始渗透。

它的关键不是「省显存」四个字,而是 让 100K Token 上下文可以在 HBM4 上同时容纳几十个并发 Agent,每个 Agent 都有自己的 KV Cache 缓冲。

第二层:HBM4——11 PB 显存 + 800 PB/s 带宽

100MW AI 工厂口径下,整个集群配备 11 PB(拍字节)HBM4 显存、800 PB/s 聚合带宽。1 PB = 1000 TB;11 PB ≈ 11000 TB。这是什么量级?整个互联网存档一份压缩快照大概 50 PB。也就是说 一栋 NVIDIA 的 AI 工厂,能在内存里同时装下半个互联网的快照。800 PB/s 的带宽,意味着每秒可绕地球赤道(4 万公里)传输 100 万次 32GB 显存的内容。

第三层:第六代 NVLink——机柜内 10 倍于以太网、延迟低 3 倍

这是 Vera Rubin NVL72 真正的「机柜灵魂」。机柜内 72 颗 GPU 通过 NVLink 全互联,比以太网快 10 倍、延迟低 3 倍。在 Agent 场景里,这意味着子 Agent 之间回传 KV Cache 时,主 Agent 不必等;KV 感知路由(KV-aware routing)让请求精准命中已经缓存好的节点,避免重复计算。

第四层:Vera CPU——88 颗 Olympus 核心,为 Agent 而生

Olympus 核心:Vera CPU 内部代号使用的下一代自研核心架构,强调低延迟 IPC 和高并发线程切换。

88 核心、LPDDR5X 内存、1.2 TB/s 内存带宽。这是 NVIDIA 推出的 首款明确以 AI Agent 工作负载为目标设计的 CPU。传统 CPU 假设前台跑的是数据库查询和 Web 请求;Agent 的工作负载完全不同——大量短促的工具调用、海量元数据读写、需要 sub-millisecond 级的响应延迟来跟上 GPU 的吐 token 节奏。Vera CPU 在每个核上都针对这种节奏做了优化。

更有意思的是:SpaceX AI 已将 Vera CPU 规模化部署,并计划送上太空。一个为地面 AI 工厂设计的 CPU,要在轨道上为卫星集群做实时推理,这本身就是 Vera CPU 在延迟敏感场景下被验证的强信号。

第五层:Groq 3 LPX——长上下文吐 token 的「涡轮增压」

LPX:LPU(Language Processing Unit)的扩展形态,专为大模型推理中的 decode 阶段(生成阶段)优化。Groq 3 LPX 已进入全面量产。

Agent 工作流里有一个隐藏的瓶颈:当主模型生成几百字推理后,外部工具的结果会突然回灌,主模型必须立刻继续吐 token。Groq 3 LPX 提供长上下文输出每秒 3400 Token 的速度,专门接管这种「长尾生成」——主模型可以专心处理 KV Cache 调度,Groq 3 LPX 负责稳定输出。

第六层:Prefill/Decode 分离 + KV 感知路由

这是系统级创新:把「处理输入 Prompt」和「生成回答」拆成两个独立的算力池,Pre-filling 阶段吃批量算力,Decode 阶段吃带宽和低延迟。两者通过高速互联按 KV Cache 状态精准路由。一个 Agent 在 10 万 Token 上开聊,Pre-filling 用 Rubin GPU 完成;接下来几十秒的 decode 由 Groq 3 LPX 接力;中间不浪费一个 token 的延迟。

第七层:Spectrum-X——机柜与机柜之间

Spectrum-X 是 NVIDIA 自家的高速以太网,专为多机柜 AI 工厂互联设计。它让一个 100MW 工厂不是「一堆机柜的集合」,而是一个完整的算力有机体。


⚡ 30 倍 vs 35 倍:哪个数更关键?

NVIDIA 这次给出的两个核心数字:

  • 每兆瓦吞吐量:Vera Rubin NVL72 vs GB300 NVL72,最高 30 倍
  • 每百万 Token 成本:最高下降 35 倍

这两个数看起来都是「碾压」,但意义完全不同。

30 倍讲的是「我能效比」:电力是 AI 工厂最大的运营成本。一座 100MW 工厂一年电费按 0.05 美元/度算,是 4400 万美元。30 倍意味着同样的电力,吞吐量乘 30——这是决定 AI 工厂能不能继续扩张的生死线。

35 倍讲的是「我能便宜多少」:当 Agent 推理普及到每天调用几十亿次,每 Token 几分之一美分的成本差异,会决定一家 AI 公司的毛利率。35 倍的单位成本下降,足以让原本不划算的应用场景突然算得过来账

哪个数更关键?

答案是:两者缺一不可。30 倍决定上限,35 倍决定普及。 真正的杀手是「两个数同时成立」 ——这意味着 NVIDIA 不只是造了一台更快的机器,而是重新定义了 Agent 推理的单位经济模型

历史对照也值得放进来:GB300 NVL72 对比 H200 NVL8 是 15 倍;Vera Rubin NVL72 对比 GB300 NVL72 是 30 倍;综合起来 Vera Rubin 对 H200 是 450 倍。三代机柜,跃迁曲线不是平滑过渡,而是指数断层。


🥊 同周博弈:Jalapeño vs Vera Rubin,两条路线的对决

如果说 Vera Rubin NVL72 是「平台级协同」的极致,那 2026 年 8 月同周亮相的 OpenAI Jalapeño 就是「自研 ASIC」的代表。

Jalapeño:OpenAI 与博通联合研发的自研推理 ASIC,2026 年 8 月首次披露细节。
ASIC(Application-Specific Integrated Circuit):为特定任务定制的芯片,相对 GPU 牺牲通用性,换取极致能效。

两者的关键参数对比:

Jalapeño 的成绩单很漂亮:每瓦领先 GB300 1.5–1.9 倍,延迟降低 28–59%。但请注意:它只做推理。Vera Rubin NVL72 的 2 ZFLOPS 推理 + 1.4 ZFLOPS 训练是同一个硬件栈两套负载。Jalapeño 在训练上帮不上忙。

更深层的差别是商业模式:

  • Vera Rubin NVL72 卖给所有超大规模云和大型企业,构建通用 AI 工厂。客户拿到的是一个完整生态:NVFP4、NVLink、Spectrum-X、cuDNN、TensorRT-LLM——任何一个模型都能跑。
  • Jalapeño 是 OpenAI 单一客户的内部优化件,连博通的产能都按 OpenAI 的需求量定。它不需要兼容生态,因为它只为一家公司而生

这两种路线谁会赢?现在下结论太早。但可以确定的是:OpenAI 用 Jalapeño 赌的是「我不需要全世界都跑我的硬件」,而 NVIDIA 用 Vera Rubin 赌的是「全世界的 AI 工厂都该长这个样子」

在 Agent 时代,这两条路线会长期共存。Jalapeño 适合单一公司对极致成本的追求;Vera Rubin 适合整个生态对通用性的依赖。把赌注全押在任何一边,都是低估了对手。


🧪 DeepSeek V4 Pro:为什么它成了「最佳压力测试负载」

NVIDIA 没有用 Llama、Qwen、Gemini 做基准,而是选了 DeepSeek V4 Pro——开源的 1.6 万亿参数 MoE 架构。

MoE(Mixture of Experts):混合专家架构。模型参数总量大,但每次推理只激活其中一部分「专家」。1.6 万亿参数听起来吓人,但单 token 推理可能只激活 200–400 亿参数。
DeepSeek V4 Pro:开源阵营里参数规模最大的 MoE 模型之一,2026 年中发布。

为什么是它?

第一,MoE 架构天然考验硬件调度。每次推理激活哪些专家,路由算法决定。如果 GPU 之间通信不够快,专家调度会变成「等数据」的灾难。Vera Rubin NVL72 的 NVLink 全互联 + KV 感知路由在这种负载下会被真正压榨。

第二,1.6 万亿参数足够压爆 HBM。单卡放不下完整模型,必须做张量并行 + 流水线并行 + 专家并行。三种并行同时存在时,互联带宽成为唯一瓶颈——这正是 NVLink 6 比以太网快 10 倍的发力点。

第三,DeepSeek V4 Pro 是开源。NVIDIA 不能拿一个「私有的、跑分专用的」模型去自夸,否则会被怀疑调优过。开源模型意味着所有数字都可复现,可信度直接拉满

最后,也是最狡猾的一招:DeepSeek V4 Pro 已经在 Agent 编码场景里被广泛使用。用真实工作负载跑 AgentX,等于在 NVIDIA 的硬件上跑 DeepSeek 自己的客户,数字就更有说服力。


🏭 100MW AI 工厂:一个新单位

NVIDIA 这几年反复提到一个口径:100MW AI 工厂

100MW 不是「一个数据中心」,而是一个 算力计量单位。相当于:

  • 10 万户家庭同时用电;
  • 或者一艘尼米兹级航空母舰电磁弹射器的功率;
  • 或者 250 个机柜级 NVL72 的满载功耗。

在这个口径下,Vera Rubin 工厂的数字是:NVFP4 推理 2 ZFLOPS、训练 1.4 ZFLOPS、11 PB HBM4、800 PB/s 聚合带宽

ZFLOPS:10²¹ 次浮点运算/秒。2 ZFLOPS = 2 × 10²¹ FLOPS。人类大脑约 10–20 PFLOPS(10¹⁶),相当于 10 万到 20 万颗 Rubin GPU 满载协作。

这个数字的实际意义是:未来一家 AI 公司的核心资产,可能不再是有多少 PhD,而是能稳定运营几个 100MW AI 工厂。电力、土地、冷却、网络——这些传统房地产要素,正在变成 AI 时代的稀缺资源。

这也解释了为什么 SpaceX AI 把 Vera CPU 送上太空:当算力本身已经成为「地基」,在轨 AI 推理就不再是科幻,而是「边缘算力」逻辑的自然延伸。


🔭 边界与未来观察

Vera Rubin NVL72 这次的实测结果,把 Agent 时代算力竞赛的几个边界推到了一个新的位置:

第一,硬件协同的边界。 Rubin GPU 单卡不是最关键的,整套机柜栈的协同才是。NVLink + Groq 3 LPX + Vera CPU + Spectrum-X,这是一台机器的四个器官,缺一个都会让 Agent 跑出明显的停顿。

第二,基准的边界。 AgentX 替代旧基准的速度,可能比硬件升级的速度更快。下一个两年,真正的赢家是「能跟上基准演化」的厂商

第三,能效比的边界。 30 倍每兆瓦吞吐不是终点。100MW 工厂的电力预算,让下一代 Vera Rubin Ultra 必须解决一个更难的问题:怎么在同等电力下把吞吐量再翻 5–10 倍。这是物理学边界和工程智慧的赛跑。

第四,生态的边界。 同周 OpenAI Jalapeño 的亮相,证明自研 ASIC 不是传说。未来五年我们大概率会看到「通用 GPU 工厂」与「垂直自研 ASIC」双轨并存的局面。NVIDIA 的赌注是前者的网络效应;OpenAI 的赌注是后者的极致效率。

第五,地缘的边界。 当 Vera CPU 已经在太空轨道上跑推理,算力竞赛的边界就不再是机房,而是整个物理世界。能稳定供电、能冷却、能维护的地理位置,将决定下一个十年的 AI 强国版图。


🌌 尾声

2026 年 8 月 25 日前后这一周,做芯片的人、做模型的人、做 Agent 的人,都挤在加州同一个会场和同一条新闻流里。他们讨论的不再是「Transformer 比 RNN 强多少」这种学术问题,而是 「一个机柜能不能让 100 个用户同时享受 160 tokens/s 的 Agent 体验」 ——这种工程化、产品化、运营化的真问题。

Vera Rubin NVL72 把这个问题回答得干脆:能。 每兆瓦 30 倍,每 Token 35 倍,整座 AI 工厂 2 ZFLOPS

但真正值得记住的不是这些数字,而是背后那件事—— 算力竞赛的主战场,已经从「GPU 跑得快」迁移到「AI 工厂理解 Agent」。谁先意识到这一点的厂商,谁就在下一个十年拿到了门票。


本文基于 Hot Chips 2026 现场公开实测数据、SemiAnalysis AgentX 基准披露、DeepSeek V4 Pro 官方技术规格,以及 NVIDIA 与博通的公开声明。所有关键数字均可追溯到原始来源。

#VeraRubin #NVL72 #AgentX #HotChips2026

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录