
OpenAI发布自研推理芯片Jalapeño完整架构:联手博通、台积电3nm,700W能效比肩英伟达1400W系统
OpenAI在Hot Chips 2026大会上公布与博通联合开发的首颗自研AI推理芯片Jalapeño完整架构与首批基准测试:台积电3nm工艺、700W额定功耗(实测≤550W)、FP4算力13.4 PFLOPS、216GB HBM4内存带宽15.4TB/s,单机架128颗、最高2048颗互联。在SemiAnalysis公开基准InferenceX上对比英伟达GB200/GB300,每千瓦吞吐量高1.5至1.9倍,端到端时延低1.7至3.6倍,极致低时延点优势最高超百倍。架构采用空间设计:64核心各配专属HBM接口、专用集合通信网络直连,KV缓存保留芯片本地,按推理阶段动态激活计算、内存与网络资源。芯片开发仅9个月流片,OpenAI大量使用自家模型辅助设计。该芯片专用于推理,训练仍依赖英伟达GPU,计划2026年底小规模部署、2027年放量,第二代每瓦性能再提升约25%的产品已在制造中,OpenAI未来数年计划部署10GW自研加速器。
【新闻原文】
在Hot Chips 2026大会上,OpenAI首次完整公开了与博通(Broadcom)联合开发的自研AI推理芯片Jalapeño的架构细节与首批基准测试结果,这是OpenAI走向自研芯片的首个正式成果。Jalapeño采用台积电3nm级工艺,单芯片额定功耗700W(实测负载下通常不超过550W),FP4算力最高13.4 PFLOPS,配备216GB HBM4内存、带宽达15.4TB/s,并配备大容量SRAM缓存。单机架集成128颗芯片,提供1.7 EFLOPS的4bit算力与27.5TB HBM4,最多16个机架可互联为2048颗芯片的单一系统。
在SemiAnalysis公开的InferenceX基准测试中,Jalapeño在GPT-OSS 120B、DeepSeek R1、Kimi K2.5等模型上对比英伟达GB200(1200W)与GB300(1400W)系统,每千瓦吞吐量高出1.5至1.9倍,端到端时延低1.7至3.6倍,在极致低时延工作点上每千瓦吞吐优势最高达8.6至104倍。架构上,Jalapeño采用空间架构设计,64个计算核心各自配备专属HBM接口,核心间通过专用集合通信网络直连;KV缓存保留在芯片本地,按推理阶段动态激活计算、内存与网络资源,避免数据搬运瓶颈。
OpenAI硬件副总裁Richard Ho表示,该系统在设计时就以用户可感知的响应速度(首Token时延、Token间隔、总请求时长)倒推硬件指标,而非追求纸面算力。芯片开发仅用约9个月完成流片,OpenAI大量使用自家模型辅助设计、验证与优化。Jalapeño专用于推理,训练仍将依赖英伟达等合作伙伴的GPU;芯片计划2026年底在其数据中心小规模部署,2027年逐步放量,第二代产品(每瓦性能再提升约25%)已在制造中。OpenAI计划未来数年部署10GW规模的自研加速器与配套网络系统。
【企服观察】
OpenAI把一颗700W的芯片对标英伟达1400W的系统,还敢于把第三方公开基准的测试数据摆上台面,这件事对IT企服行业的冲击,比"又一家公司做芯片"要深远得多。它本质上宣告:推理时代的算力竞争,主战场已经从"通用算力军备赛"切换为"系统级效率战",而效率战的入场券,是模型、芯片、网络、软件栈的一体化协同设计。对于企业服务市场的从业者来说,这里有三个必须看懂的趋势。
第一,推理成本曲线的下坠速度会超出多数企业的预算假设。Jalapeño每千瓦吞吐高出1.5到1.9倍、时延低1.7到3.6倍,如果这些数字哪怕只兑现一半,也意味着同样一笔算力预算能支撑数倍的业务流量。对企业CIO而言,现在签的多年期算力合同、按Token计费的长约,都需要重新审视价格锚点——今天觉得合理的推理单价,一年后可能被头部厂商的内化成本击穿。企服采购决策应该尽量保留弹性:优先选择按量付费、可随时切换模型的供应商条款,避免被单一模型的长周期折扣锁死。
第二,"全栈自研"会成为头部AI厂商的标配,而中小厂商的差异化空间在应用层。谷歌有TPU、亚马逊有Trainium、微软有Maia,现在OpenAI补上了最后一块拼图。当模型层和芯片层的利润都被超级玩家垂直整合之后,中国的IT服务商真正的机会恰恰在于:把 inference 成本的下降转化为行业场景的深度落地——法律文书处理、工业质检、客服坐席、财务审核,每一个垂直场景都有"用一半的价格拿到两倍的吞吐"的改造红利。企服公司不要去卷基础模型,要卷的是场景数据、工作流理解和交付能力。
第三,AI辅助芯片设计9个月流片,这个速度本身就是行业信号。OpenAI公开承认用自家模型完成了两个核心计算模块的布局优化,尺寸比资深工程师手工调优还小8%到10%。这意味着"用AI造AI硬件、用AI优化AI服务"的递归循环已经闭环。对软件企业来说,谁先把自己的研发流程、测试流程、交付流程AI化,谁就能享受同样的复利效应。IT企服公司完全可以用智能体完成需求澄清、代码评审、回归测试,把交付周期压缩30%以上——这是当下就能动手、不需要等任何新芯片的事。
当然也要保持清醒:这些成绩是OpenAI自己报告的,SemiAnalysis做了现场验证但没有完整复跑全套基准;真正的对手是同样采用HBM4的英伟达Vera Rubin,而不是上一代Blackwell。还有一个容易被忽略的细节:Jalapeño本次所有基准均基于单Token预测,尚未启用多Token预测与投机解码,OpenAI称这两项技术分别可带来3到5倍的提升空间——换句话说,今天的能效优势还不是它的上限,真正的竞争要看2027年放量之后与Rubin的正面交锋。对企业用户而言,这些芯片短期内不会出现在公开销售渠道,短期内能感知的变化主要是头部API厂商的推理价格与时延;中长期能感知的变化,则是整个推理硬件市场从"一家独大"走向"多元竞逐"后的价格重定价。对企业的务实启示是:不要迷信任何单一供应商的性能叙事,把工作量放到公开基准上自己测一遍,用自己业务的真实负载说话。算力民主化的窗口正在打开,窗口期属于那些现在就开始做架构评估、成本测算和供应商组合管理的团队。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。