
英伟达Groq 3 LPX全面量产:3400 tokens/s推理加速+Prefill/Decode分离,Vera Rubin开启双芯协同时代
8月24日Hot Chips 2026英伟达宣布Groq 3 LPX交互式AI推理加速器全面量产,单机柜256颗LPU/128GB片上SRAM/640TB/s互联,3400 tokens/s创Gemma 4 31B历史最快;Nebius首家采用,AI云推理成本结构性下降。
【新闻原文】8月24日,在Hot Chips 2026大会上,英伟达宣布其交互式AI推理加速器NVIDIA Groq 3 LPX全面量产,作为Vera Rubin平台的延伸,专为高响应Agent系统设计。Groq 3 LPX是面向代际Token生成的专用加速器——Agent完成一项任务可能需要连续数十次模型调用,每步又依赖前步结果,延迟随工作流逐步累积;更快Token生成速度对Agent实时推理、行动至关重要。
技术规格上,Groq 3 LPX单机柜配置256颗Groq 3 LPU加速器、128GB片上SRAM、640TB/s Scale-up互联带宽,采用英伟达MGX机柜架构与全液冷设计。在第三方AI模型评测机构Artificial Analysis测试中,以Gemma 4 31B模型在100K Context条件下运行,输出速度中位数达每秒3,431 Token、10K Context下每秒3,382 Token,创该模型有史最快记录;SPEED-Bench测试中P80达每秒5,520 Token。Groq 3 LPX可使编码等Agent任务在数分钟内完成(而非数小时),相比最接近的竞品平台提供4倍更快响应。AI云服务商Nebius成为首家采用者,将通过其Token Factory推理平台向开发者开放。
架构层面,Groq 3 LPX与Vera Rubin NVL72并非替代关系而是协同关系:Vera Rubin NVL72负责Prefill(处理长Prompt/上下文并建立KV Cache),Groq 3 LPX执行后续Decode(Token快速生成),形成GPU+LPU双芯协同的新范式。两套机架平台通过BlueField-4 DPU、Vera CPU机架、Spectrum-6 SPX以太网协同优化多Agent系统。
【企服观察】英伟达Groq 3 LPX全面量产、3400 tokens/s创纪录、与Vera Rubin NVL72形成GPU+LPU双芯协同——这是2026年AI基础设施最具颠覆性的一次产品升级,对IT企服行业的启示至少有五点。
第一,GPU+LPU双芯协同是AI基础设施架构的范式跃迁。传统AI推理完全依赖GPU(无论是英伟达、AMD还是其他),但GPU擅长Prefill+并行训练,对低延迟Decode并不友好。LPU(Language Processing Unit,Groq的LPU、英伟达的LPX)专为顺序Token生成+超低延迟优化,天然适合Agent的多步调用场景。Groq 3 LPX与Vera Rubin NVL72的Prefill/Decode分离架构,让两种芯片各司其职、整体效率最大化。对企服厂商的启示是:未来AI数据中心不会再是清一色GPU,而是GPU集群(训练+Prefill)+LPU集群(Decode+低延迟推理)+DPU(网络加速)+CPU(编排)的异构架构。提前布局异构AI Infra运维、跨芯片调度、GPU+LPU混合部署的企服公司,会在AI数据中心2.0时代拿到大单。
第二,3400 tokens/s+4倍响应速度提升对Agent体验是质的飞跃。过去Agent产品(如Devin、Cursor Composer、AutoGen)的痛点之一就是等——用户发出指令后,Agent可能需要等待10-30秒才能开始响应,多步任务累计延迟可能达到分钟级。Groq 3 LPX把单步响应时间压缩到亚秒级,让Agent交互接近实时对话。对企服厂商的启示是:未来企业级AI Agent产品的体验竞争点不是能不能干,而是干得多快。响应速度的微小提升,都会带来用户留存率的显著提升。
第三,Nebius首家采用+Token Factory推理平台标志着AI云服务商开始向垂直化推理平台分化。Nebius将Groq 3 LPX集成到其Token Factory平台,给开发者无需迁移到新API栈即可获得超快响应——这与Nebius自身定位(AI Cloud for builders)高度契合。对企服厂商的启示是:未来AI云市场会进一步分化——通用AI云(AWS/Azure/GCP/阿里云/腾讯云/字节火山)负责广度,垂直AI云(Nebius、CoreWeave、Lambda、Groq Cloud、阿里灵骏)负责深度。提前布局AI云中立调度+多云部署+垂直云集成的企服公司,会成为AI应用落地的关键中间层。
第四,单机柜256 LPU+128GB SRAM+640TB/s互联是LPU架构对传统GPU的工程化胜利。LPU把内存放在片上(而非HBM),通过超高速片上互连+近内存计算,把数据搬运延迟降到极致。对企服厂商的启示是:内存墙问题(GPU算力增长远快于内存带宽)已经成为AI芯片设计的核心矛盾,未来3-5年所有AI芯片公司都会在内存/带宽/互联三个方向做极致优化。提前布局AI芯片评测+AI Infra选型+AI性能调优咨询服务的公司,会成为企业AI采购的关键顾问。
第五,4倍响应速度提升+相比最接近竞品的措辞,说明英伟达正在用垂直加速器巩固生态护城河。Groq 3 LPX不会单独销售,而是和Vera Rubin NVL72打包卖给AI云服务商和企业客户——这种平台+加速器的捆绑销售策略,让英伟达从卖GPU升级为卖AI工厂全栈方案。对企服厂商的启示是:AI Infra巨头(英伟达、AMD、Intel、华为、寒武纪、海光)的竞争已经从单品性能转向全栈生态。中小AI芯片公司必须找到差异化场景(如超低功耗AI、端侧AI、特定行业AI)才能生存,单纯做通用AI芯片几乎没有机会。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。