OpenAI的Jalapeño推理芯片挑战英伟达
TECH

OpenAI的Jalapeño推理芯片挑战英伟达

40+
Signals

战略概览

  • 01.
    OpenAI与博通(Broadcom)联合发布了Jalapeño,这是OpenAI首款定制AI芯片,一种专为大语言模型推理而非训练设计的‘智能处理器’。
  • 02.
    据称,该芯片从早期招聘和电路设计到完成流片准备仅用了大约九个月,另一种说法是约十六个月——对于一个半导体项目而言,这一速度异常之快。
  • 03.
    OpenAI声称,在GPT-OSS 120B、DeepSeek R1和Kimi K2.5模型上,基于SemiAnalysis的InferenceX基准测试套件,Jalapeño相比英伟达Blackwell/GB300系统实现了1.5倍至1.9倍的每瓦性能提升,以及1.7倍至3.6倍的端到端延迟降低。
  • 04.
    Jalapeño采用HBM4内存,带宽达15.4TB/s,其架构避免了将prefill(提示处理)和decode(解码生成)拆分到不同硬件池中。
  • 05.
    博通贡献了芯片实现和Tomahawk网络技术;Celestica协助完成了板卡、机架和系统集成以支持部署。
  • 06.
    部署计划:2026年底进行小批量原型部署,更大规模的量产和部署预计在2027年展开。
  • 07.
    该芯片在推理测试中功耗为700瓦,其对比对象是英伟达的GB300,而非更新的Vera Rubin代产品。
  • 08.
    第二代Jalapeño芯片已在高级开发阶段,预计很快完成流片。

深度分析

谁的Blackwell?尚未决出的基准之争

OpenAI的核心主张非常明确:在运行GPT-OSS 120B、DeepSeek的R1和月之暗面AI的Kimi K2.5时,Jalapeño相比英伟达Blackwell代GB300系统每瓦AI工作量高出1.5倍至1.9倍,延迟低1.7倍至3.6倍[1]。特别是在DeepSeek R1上,OpenAI报告在低并发下每位用户每秒可输出超过700个token,在GPT-OSS上接近每秒1,400个token——值得注意的是,这并未使用多token预测这一常见提速技巧,而竞争对手在其对比数据中据称使用了该技术[2]

但这些数据的来源也正是最响亮质疑的出处。提供InferenceX基准测试套件的SemiAnalysis在其自己的通讯中写道,将Jalapeño与Blackwell比较是‘某种程度上不完整且不公平的’,因为英伟达当前实际的继任产品Rubin才是更合适的对手[2]。社区基准测试讨论进一步指出,Jalapeño自身的测试据称排除了推测性解码(speculative decoding)——即提前预测多个token以节省时间的技术——而OpenAI对Rubin的比较却似乎包含了该技术。如果属实,这种不对称会低估Jalapeño的真实优势,一旦方法论统一,差距可能更大。这也意味着目前除OpenAI外无人真正执行过这种标准化测试。SemiAnalysis自身也承认,它尚未独立运行完整的InferenceX套件,也未看到用于反映真实生产级代理工作负载的AgentX基准结果[2]。在外部机构未在相同条件下对相同模型发布数据前,‘击败英伟达’这一说法完全依赖于主张方自身的测试框架。

九个月,而非九年

定制AI芯片通常需要数年才能从概念变为可用硬件。据报道,Jalapeño从早期招聘和电路设计到成为可用于制造、光罩尺寸的ASIC,仅用了大约九个月[3],若从初始招聘算起则约为十六个月,这是较为保守的说法[2]。无论哪种计算方式,这在行业中都属于异常紧凑的周期。

这种速度源于一种激进的软硬件协同设计方法,即在开发过程中直接使用OpenAI自身的模型,甚至通过其编码工具生成内核代码[4]。在架构上,该芯片跳过了行业常见模式——即将prefill(处理输入提示)和decode(逐token生成响应)分配到不同硬件池中——而是将两者保留在统一资源上[2],专门用于减少通常在大规模推理中造成瓶颈的数据移动和通信延迟[1]。这一设计选择表明,OpenAI认为避免硬件专业化带来的开销比分别优化每个阶段更重要,而这种赌注只有在同时掌控模型工作负载和芯片设计的情况下才可能做出——这是向多种客户销售产品的通用芯片供应商难以轻易复制的优势。

并非英伟达杀手——而是一种利润防御系统

关于Jalapeño存在的最直白解释来自OpenAI自身的硬件负责人:‘我们对算力的需求实在太大了’[5]。正是这种短缺,而非战略上彻底取代英伟达的意图,才是其公开宣称的驱动力——OpenAI的算力需求已超出通用GPU市场按自身节奏所能提供的范围。Greg Brockman从经济角度阐述了回报,称之为‘真正的性能提升……在每瓦性能和每美元性能方面’[4],多家媒体报道称效率提升使推理成本降低了约50%[4]

但其范围比表述有时暗示的要窄。Jalapeño仅处理推理任务,不涉及训练,而OpenAI的整体算力堆栈至少到2027年仍依赖英伟达GPU(及其他供应商)进行训练和大量推理工作负载[1]。有报道将该芯片描述为‘向英伟达定价权发出警告’[6],这比‘英伟达杀手’更为准确:Jalapeño为OpenAI提供了在谈判中可引用的可信替代方案,并对冲GPU供应限制风险,但并未真正取代其从英伟达采购的大部分产品。这是一种选择权,而非独立性。

2027年的执行鸿沟

即使按照OpenAI自己的说法,Jalapeño的近期影响也很有限。公司描述称,2026年底将以极小规模启动初步部署,更大规模的部署要到2027年才有望实现[1],而第二代芯片已在高级开发中,预计很快流片[5]——这表明OpenAI的迭代速度远超其规模化出货能力。

线上质疑集中于2027年的量产目标是否现实,原因在于持续的HBM内存短缺,以及英伟达在先进封装和晶圆厂产能上的牢固控制,任何竞争性芯片项目都必须依赖这些资源。这种质疑还伴随着更深层的结构性问题:当英伟达真正的护城河可能是其软件与网络生态系统(如CUDA、互联技术、工具链),而不仅仅是芯片能效时,一款每瓦性能更强的ASIC能否真正撼动其地位?无论Jalapeño的基准数据在独立审查下如何变化,都无法回答这个问题;它们只是提高了赌注——OpenAI能否真正实现其所承诺的大规模制造与部署。

历史背景

OpenAI与博通正式宣布建立芯片开发合作伙伴关系。
OpenAI与博通首次公开发布Jalapeño芯片,作为OpenAI首款定制AI推理芯片。
OpenAI通过SemiAnalysis的InferenceX套件发布了Jalapeño的首批基准测试结果,声称相比英伟达Blackwell/GB300实现1.5倍至1.9倍的每瓦性能提升和1.7倍至3.6倍的更低延迟。

关键关系图

关键玩家
主题

OpenAI的Jalapeño推理芯片挑战英伟达

OP

OpenAI

设计芯片架构并推动全栈算力战略,以减少对英伟达在推理方面的依赖,尽管在训练方面仍依赖英伟达及其他供应商——如果OpenAI不推进此项目,它将在最高频的工作负载上完全受制于GPU市场的价格。

BR

Broadcom

联合开发并制造芯片,提供芯片实现和Tomahawk网络技术——博通的制造能力将OpenAI的芯片设计转化为可部署的物理硬件。

NV

Nvidia

仍是基准比较对象(GB300/Blackwell),同时也是OpenAI在训练和其他推理任务上的供应商;Jalapeño仅威胁到英伟达在部分推理需求上的定价权,而非其核心训练业务。

CE

Celestica

负责Jalapeño部署中的板卡、机架和系统集成——这是连接芯片设计与实际数据中心部署之间虽不显眼但必要的环节。

SE

SemiAnalysis

独立分析机构,其InferenceX基准测试套件产生了头条数据,而其通讯又同时质疑了比较的公平性——使其既成为OpenAI证据的来源,也是其最可信的怀疑者。

事实来源

6 条引用
  1. [1] OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks show
  2. [2] OpenAI Jalapeño: Better Than Nvidia?
  3. [3] Broadcom and OpenAI Unveil Custom-Built Jalapeño Inference Processor
  4. [4] OpenAI Unveils First Custom AI Inference Chip Jalapeño With Broadcom, and Its Development Was Sped Up With OpenAI's Own Models
  5. [5] OpenAI Jalapeño vs Nvidia GB300 Benchmarks
  6. [6] OpenAI and Broadcom Unveil OpenAI Jalapeño, a Custom Inference Chip That Puts Nvidia's Pricing Power on Notice

来源文章

Top 5

THE SIGNAL.

Analysts

将基准测试结果视为一次重大且可信的性能飞跃,同时提升了吞吐量和降低了延迟,并将该项目与OpenAI算力需求超过现有供应的能力联系起来。

Richard Ho
OpenAI芯片/硬件部门负责人

从具体经济角度解读结果,称其为真正的性能提升而非边际改进,特别强调每瓦性能和每美元性能的提升。

Greg Brockman
OpenAI总裁兼联合创始人

提醒称,将Jalapeño与Blackwell而非英伟达即将推出的Rubin进行比较是不完整的。

SemiAnalysis (newsletter analysis)
独立半导体/AI基础设施分析机构
The Crowd

Since announcing Jalapeño, our first custom inference chip, we've been testing it and the system around it. The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency.

@@OpenAI3187

OpenAI Jalapeno is spicy Usually first generation chips aren't competitive, but OpenAI is beating Nvidia Blackwell and even Rubin This is huge news! We got to go into OpenAI's lab to dissect their new chip and dive into the software, architecture, and performance Incredible work!

@@dylan522p1095

Holy: OpenAI says its first custom inference chip is already beating Nvidia GB200 and GB300 systems on speed and efficiency. Across GPT‑OSS 120B, DeepSeek R1 670B, and Kimi K2.5 1T, Jalapeño delivered 1.5–1.9× more AI work per watt at peak throughput and 1.7–3.6× lower end-to-end latency in OpenAI's own InferenceX testing! For highly interactive workloads, OpenAI reports 2.1–4.1× higher performance. The chip is rated at 700 watts, but remained at or below 550 watts during the tested workloads. OpenAI plans to begin deploying Jalapeño by the end of 2026. Gen 2 is already deep in development, with Gen 3 taking shape.

@@kimmonismus1000

OpenAI's new chip is better than Vera rubin on benchmark

@u/Wonderful_Buffalo_32102
Broadcast
OpenAI’s Jalapeño Chip Could Change LLMS Forever

OpenAI’s Jalapeño Chip Could Change LLMS Forever

OpenAI launched Jalapeno, their own AI chip!

OpenAI launched Jalapeno, their own AI chip!

OpenAI’s first AI chip is called Jalapeño #Vergecast

OpenAI’s first AI chip is called Jalapeño #Vergecast