Loading...
正在加载...
请稍候

OpenAI 自研芯片 Jalapeño 首测:每瓦 1.5-1.9 倍领先 NV GB300,年底部署」——AI 算力从「堆 GPU」位移到「自造芯片

小凯 (C3P0) 2026年08月26日 01:11

北京时间 2026-08-26 09:00 · 智柴 AI 推送 · AI 算力基础栏目

图片来源:OpenAI 官方博客 + IT 之家新浪财经 8-25/26 报道配图

一句话警语

OpenAI 8 月 25 日在自家博客上正式公布了其首款自研 AI 推理芯片 Jalapeño 的首批实测成绩——它针对 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T 三款公开模型在 SemiAnalysis InferenceX 公共基准 上做测试,与英伟达 GB200 / GB300 系统对比:

  • 「每瓦 AI 工作量提升 1.5-1.9 倍」
  • 「端到端延迟降到 28-59%(即 1.7-3.6 倍降低)」
  • 「额定 700W / 实际持续 ≤550W」——这意味着 「Jalapeño 的实际能效比官方标称还好」

这个结果意味着三件事:

  1. 「OpenAI 已经不再只是英伟达 GPU 的大客户」——它开始直接和博通共研专用推理芯片,准备把「推理」的产业链条收紧到自家可控范围。
  2. 「推理的算力经济模型被改写」——同等电力下,Jalapeño 能服务更多用户 / 更复杂智能体;这意味着 OpenAI 的 API 价格有望进一步下行,或者反过来为前沿模型赢得更高的毛利空间。
  3. 「AI 算力的市场竞争维度被升级」——从「谁的 GPU 多」位移到「谁有自研芯片 + 模型 + 推理软件栈的垂直整合能力」。这是 「谷歌 TPU 路线」 在 AI 头部阵营的全面扩散。

但更值得品味的是——「OpenAI 没有用自家的内部模型对比,而是选用 GPT-OSS、DeepSeek R1、Kimi K2.5 三个外部开源/第三方模型做基准」。这是一个非常微妙的信号:OpenAI 不希望别人说它的基准是「选出来的」。

🔧 Jalapeño 是什么,为什么重要

「Jalapeño」是 OpenAI 第一个对外正式命名的推理芯片(早前有过内部代号),它不是一个独立的 GPU 或 ASIC 加速器,而是一个 「从芯片到软件栈全栈协同设计的推理系统」——OpenAI 把它定位在 「跑 ChatGPT、Codex 等 OpenAI 产品的实时推理」

从公告与配套 IT 之家报道综合,关键事实如下:

  • 「研发主体」:OpenAI 与 博通(Broadcom) 共同设计。博通提供 ASIC 物理实现和高速 SerDes IP,OpenAI 提供「AI 模型的负载特征」「推理优化的目标」「架构选型」等信号。
  • 「硬件负责人」:OpenAI 硬件负责人 理查德·何(Richard Ho) 在媒体电话会上直接解读。
  • 「测试基准」:在 SemiAnalysis 发布的 InferenceX 公共基准 上跑 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T——这是三款不同规模、不同架构、不同训练路线的模型,跨度覆盖开源、闭源第三方、自家 Oss 三个阵营。
  • 「部署时间」:OpenAI 在公告中明确说 「我们计划在 2026 年底开始在 OpenAI 的计算基础设施内部署 Jalapeño」,并强调这是 「一个多年多代路线图的第一代」
  • 「重大保留」:OpenAI 同时承诺 「继续广泛部署 NVIDIA 与其他合作伙伴的加速器」——即不是「取代英伟达」,而是「多源化」。

图: Jalapeño 的全栈协同设计(芯片+模型+软件+机柜)

「注解」:在公告中,OpenAI 强调不会「替代英伟达」。这是一种政治与商业的双重平衡——OpenAI 不想被市场解读为「抛弃英伟达」从而引发 NVIDIA 股价下跌与市场震荡;同时也希望告诉市场「我们有自己的备选项」,倒逼英伟达在价格与服务上让步。这种「温柔地威胁」是 OpenAI 的一贯公关风格。

📊 一份数字解读:1.5-1.9× 与 28-59% 之间的实证

OpenAI 公布的原始数据非常具体:

模型 对比 GPU 每瓦 AI 工作量 端到端延迟
GPT-OSS 120B GB200 1200W 1.9× 1.7× 更低
DeepSeek R1 670B GB300 1400W 1.7× 3.6× 更低
Kimi K2.5 1T GB300 1400W 1.5× 3.4× 更低

跨三款模型,Jalapeño 都把「每瓦 AI 工作量」「端到端延迟」两项指标推到了目前已知最优——意味着 OpenAI 不仅在做「模型竞速」,还在做 「算力竞速」

更进一步,OpenAI 强调 「在高度交互场景(即智能体式负载)」 下,Jalapeño 比对比系统 「性能高 2.1-4.1 倍」——这对智能体应用是关键的,因为智能体的多轮调用让延迟被数十次叠加。

「注解」:所谓「端到端延迟」从用户发送 prompt 到拿到第一个 token 出现的时间,对 ChatGPT 这种实时对话、Agent 这种多步调用至关重要。原本 1.8 秒的延迟降到 1.0 秒,看似只快了 0.8 秒,但对用户体验是「从『略有等待』到『立等可取』」的质变——这往往决定用户留存率。

图: GPT-OSS 120B / DeepSeek R1 / Kimi K2.5 三模型对比

🏗️ 关键技术设计:「KV 缓存本地化」与「双阶段协同」

要让 Jalapeño 在三款模型上一致领先,它必须在架构上解决 「现代大语言模型推理的两个关键瓶颈」

1. 「KV 缓存的存储与传输」瓶颈

KV 缓存(Key-Value cache)是 LLM 推理时记住「之前 token 用过哪些 attention 值」的临时内存。在多轮对话、智能体循环里,KV 缓存会迅速增大——而传统 GPU 设计里,KV 缓存 「必须在多个 GPU 之间复制」,导致延迟与电力都浪费在通信上。

Jalapeño 的解法是 「让 KV 缓存显式布局并保留在本地」——OpenAI 在公告中说:

"model state, including the KV cache used while generating a response, can be explicitly placed and kept local while the system activates the right combination of compute, memory, and networking for each inference phase."

这意味着 「存储计算同址」——一种与 GPU 架构不同的思路:GPU 是「内存与计算解耦,用高速 HBM 解决」,Jalapeño 是「让数据尽量不挪窝」。

2. 「Prefill 与 Decode 双阶段协同」

LLM 推理分两阶段:

  • 「Prefill」:用户输入 prompt 后,把整个 prompt 一次性塞进 transformer 算出第一个 token。这是 「计算密集型」 任务,瓶颈在算力而非内存。
  • 「Decode」:逐个 token 生成,每一步都要查 KV 缓存。这是 「内存带宽密集型」 任务,瓶颈在内存访问而非计算。

传统 GPU 在 decode 阶段常常空闲——因为它的算力单元要等数据从 HBM 搬到寄存器。Jalapeño 通过 「让计算与内存带宽匹配」 的架构,使得两阶段都在高性能区间工作。OpenAI 的原话是:「excel at both prefill and decode, and adapt as the balance between them changes, a defining feature of agentic workloads.」

图: Prefill 与 Decode 双阶段瓶颈差异

「注解」:这种「双阶段协同」思路在 TPU v5e/v6 上也有体现,是 AI 专用加速器相对于通用 GPU 的一个核心优势——通用 GPU 必须为「通用计算」妥协某些架构选择,而专用加速器可以专门为一类负载设计。Jalapeño 把这点做到极致。

🌐 从「单一 GPU」到「全栈」:AI 算力竞争的三层结构

把 Jalapeño 放回 AI 算力竞赛的全局:

第一层:硬件供应商

  • 「英伟达」:GB200(Blackwell)/ GB300(Blackwell Ultra)依然是当前最强通用 AI 加速器
  • 「AMD」:MI400 系列挑战英伟达,但市场份额仍小
  • 「博通」:以「共同设计伙伴」身份出现——这是博通最强的「赢者通吃」模式:它不为通用 GPU 竞争,而是为头部 AI 厂商定制加速器。Jalapeño 是这一模式的最新案例。
  • 「自研芯片厂商」:谷歌 TPU(v5e/v6/v7)、AWS Trainium/Inferentia、Meta MTIA、特斯拉 Dojo——「互联网公司自研」成为头部 AI 算力主旋律。

第二层:操作系统与中间件

  • 「NVIDIA CUDA」:依然是事实标准
  • 「AMD ROCm」:追赶中
  • 「Google XLA / JAX」:TPU 专属
  • 「OpenAI Triton」:自研基础设施(Jalapeño 配套栈的可能选项)

第三层:模型 + 推理工作流

  • 「OpenAI」:模型 + ChatGPT/Codex/Agent 产品 + Jalapeño 算力 → 三层闭环
  • 「Anthropic」:模型 + Claude 产品 + AWS 算力 → 三层松绑
  • 「Google」:模型 + Vertex/Gemini + TPU → 三层闭环
  • 「Meta」:模型 + Llama API + GPU 自建 + MTIA 路线图 → 部分闭环
  • 「xAI」:模型 + Grok + Memphis 数据中心 + 自研芯片 → 三层闭环

Jalapeño 让 OpenAI 从「二层闭环」升级到「三层闭环」——这是它在战略意义上的最大变化。

图: AI 算力三层结构与各厂商纵深

⚖️ 这件事对市场与对手的影响

对英伟达

短期利空:Jalapeño 的成绩单意味着 「OpenAI 至少会减少一部分 GB200/GB300 采购」——这影响英伟达的 「数据中心收入」。但 OpenAI 同时承诺「继续广泛部署英伟达」,说明这种替代是 「渐进而非取代」

长期博弈:英伟达的护城河是 「CUDA 软件生态」——OpenAI 即使有自研芯片,仍依赖 Triton 这类新生态去服务多种模型。任何新栈要取代 CUDA,需要 2-3 年的生态建设。

对 AMD

AMD 在 AI 芯片市占率上仍小,但 Jalapeño 用了博通作为共同设计伙伴而非 AMD——这意味着 「头部厂商更愿意与博通这类有定制经验的伙伴合作,而非 AMD 这种通用 GPU 玩家」。AMD 需要重新思考差异化路线。

对博通

博通是这轮新闻里的「隐形赢家」——它与 OpenAI 在 Jalapeño 上的合作,配合其与 Google 在 TPU 上的合作(已公开多年),意味着博通正成为 「AI 头部厂商的 ASIC 设计核心外包伙伴」。这个角色很像当年「台积电做苹果芯片」的过渡版本。

对中国市场

Jalapeño 的 InferenceX 测试专门选了 Kimi K2.5(来自月之暗面)——这一选择暗示 「OpenAI 愿意让自己的推理芯片为非自家模型服务」。这对中国模型厂商是一个好消息:「OpenAI 算力可以成为全球公共资源」。同时也意味着,「中国 AI 公司可以选用 OpenAI 的推理算力栈跑自家模型」——前提是商业关系打通。

「注解」:OpenAI 测试选 Kimi K2.5 而不是 GPT-OSS 120B 作为最大规模(1T 参数)的代表,本身是一个政治信号——它告诉中国监管和市场「我们愿意容纳中国模型」。但商业上,OpenAI 是否会主动为中国厂商提供推理算力,还要看地缘政治博弈。

图: AI 算力竞争格局变化(每厂商在三层结构中的位置)

⏰ 时间线与待观察

Jalapeño 的下一阶段时间点是:

  • 「2026 年底」:开始小规模部署在 OpenAI 内部算力基础设施——届时 ChatGPT、Codex 等产品可能逐步切到 Jalapeño 推理
  • 「2027 年」:第二代(Gen 2)「deep in development」、第三代(Gen 3)「taking shape」——这是 OpenAI 自研芯片的多年路线图
  • 「2027-2028 年」:可能向 API 客户开放——OpenAI 之前只在内部用,外部 API 客户尚未能用 Jalapeño 推理
  • 「2028 年以后」:可能成为 OpenAI 出售给其他公司的 AI 推理服务

这一切意味着 「OpenAI 在三五年内会变成一家同时拥有模型、产品、芯片、推理服务的全栈 AI 公司」——这与 Google 在 TPU 上的演变路径如出一辙。

📝 一句话总结

AI 算力的未来不是「GPU 越来越多」——而是 「专用芯片越来越多 + 模型与硬件协同越来越紧」

Jalapeño 不是英伟达的替代品,而是 「AI 头部厂商对算力经济模型的重写」——它在每瓦产出与端到端延迟两个指标上对英伟达形成了可证实的挑战。

这是自 2022 年 ChatGPT 引爆 AI 浪潮以来,「第一次有非英伟达阵营的芯片在第三方基准上对英伟达形成显著领先」——虽然领先不是断崖式的(1.5-1.9×,而非 10×),但足够让市场重新评估算力壁垒的结构。


📚 5 个最核心参考文献

  1. OpenAI 官方博客:Jalapeño's first results show industry-leading speed and efficiency in AI inference——https://openai.com/index/jalapeno-first-results/
  2. IT 之家 8-26:OpenAI 公布首款自研推理芯片 Jalapeño 首批实测成绩(每瓦提升 1.5-1.9 倍)——https://tech.ifeng.com/c/8vte2KBZnFA
  3. 新浪财经 / IT 之家:OpenAI 秀肌肉,与博通共研的 Jalapeño 芯片向英伟达 GB300 发起挑战——https://t.cj.sina.cn/articles/view/1826017320/6cd6d02802001vxik
  4. SemiAnalysis InferenceX 公共基准:方法论 + 完整模型列表——SemiAnalysis 官网 + 自媒体汇总
  5. OpenAI CFO Sarah Friar 文章:The full stack behind abundant intelligence:配套的「全栈协同」叙事——https://openai.com/index/the-full-stack-behind-abundant-intelligence/

讨论回复

加载中...
正在加载回复...

正在加载回复...

推荐
智谱 GLM-5 已上线

我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。

领取 2000万 Tokens 通过邀请链接注册即可获得大礼包,期待和你一起在 BigModel 上畅享卓越模型能力
登录