英伟达Groq 3 LPX全面量产:Vera Rubin第七款芯片,推理速度3431 tokens/秒,Agent时代算力新底座
2026年8月25日,英伟达在Hot Chips大会上宣布交互式AI推理加速器Groq 3 LPX全面量产。这是Vera Rubin NVL72平台的第七款芯片,也是专门为AI推理解码阶段打造的加速器——决定单个用户能多快拿到token的关键部件。在Artificial Analysis的100K上下文基准测试中,搭载Gemma 4 31B模型的Groq 3 LPX跑出了3431输出tokens/秒的世界级成绩,在长上下文长度下保持高交互性能且不损失精度或模型质量。
Groq 3 LPX的核心技术路径是确定性编译器调度工作负载规划、细粒度计算通信重叠和预先规划的芯片间数据流。这种架构与传统GPU的调度方式完全不同——它不依赖运行时调度,而是在编译阶段就精确规划每个周期每个计算单元做什么,从而实现极低且可预测的延迟。这对于智能体(Agent)场景尤为关键:Agentic系统可以在数百到数千个推理步骤中生成巨量token,每个步骤的延迟叠加起来直接决定用户体验。如果每个思考步骤要等几秒,一个有10步推理的Agent任务就要几十秒——用户无法忍受。Groq 3 LPX的超低延迟正是为了解决这个问题。
部署方面,Nebius成为首个采用Groq 3 LPX的AI云服务商,Groq公司本身也是首批部署者,与戴尔科技合作将Groq 3 LPX部署到其专用AI推理云。这标志着AI算力市场的一个重要分化:训练算力和推理算力正在走向不同的硬件路线。训练需要大吞吐量和高算力密度(GPU主导),而推理特别是交互式推理需要低延迟和高token/s(专用推理芯片更有优势)。Vera Rubin平台同时包含GPU和LPX两种芯片,形成了"训练用GPU+推理用LPX"的组合架构。对AI应用开发者而言,这意味着智能体的响应速度将大幅提升——当推理延迟从秒级降到毫秒级,Agent才能真正做到"实时思考、实时响应"。