Groq 3 LPX全面量产,NVIDIA为Agent推理扩展Vera Rubin能力
AI推理的下个时代,将由AI工厂各层如何协同运作来定义,而非依赖某款突破性芯片、网络或系统。这正是NVIDIA为Vera Rubin NVL72扩展快速token生成能力、面向agentic系统打造推理底座的原因。
今日宣布,NVIDIA Vera Rubin机架级系统NVIDIA Groq 3 LPX已进入全面量产。在Artificial Analysis基准测试中,运行开源agentic模型Gemma 4 31B,针对agentic系统至关重要的10万token长上下文场景,实现每秒3400个输出token,速度比最近竞品快4倍。
全球行业合作伙伴正在加速采纳Vera Rubin平台方案。SpaceXAI宣布NVIDIA Vera CPU将为下一代agentic AI提供算力支持;CoreWeave已部署Spectrum-X Multiplane,通过多并行交换机连接Vera Rubin机柜,构建高带宽、平坦无损的AI网络;Nebius成为首个接入NVIDIA Groq 3 LPX的AI云厂商。
随着AI从训练转向推理与agentic应用,推理已成为新的前沿阵地。Agentic AI系统正生成更多token,处理规模呈指数级增长的上下文窗口,并日益与其他AI系统协作解决复杂问题。
https://blogs.nvidia.com/wp-content/uploads/2026/08/HotChips_DionHarris_v5_28MB.mp4这类工作负载亟需一类全新的基础设施——不仅追求性能,更要在前所未有的规模下兼顾吞吐量、响应速度与经济效益。
本周在加州帕洛阿尔托举行的Hot Chips大会上,NVIDIA展示了极限协同设计(extreme codesign)如何从端到端重塑AI工厂。通过将计算、网络和推理加速打造为统一系统架构,NVIDIA正在帮助客户构建专为长上下文推理和多智能体系统新兴需求量身打造的基础设施。
极限协同设计为性能而生
极限协同设计是NVIDIA平台的核心理念。Vera Rubin专为加速推理而生,当智能体逐步处理日益增长长的序列时,提供强劲支撑。
NVIDIA Spectrum-X 以太网 在 AI 工厂间高效吞吐海量数据流,NVIDIA Groq 3 LPX 则专为超高速 token 生成而生。两者共同展示了 NVIDIA 如何以单一集成的 AI 工厂架构,优化从上下文、通信到生成的整个 AI 流水线。
NVIDIA Groq 3 LPX 引入了全新的低延迟推理架构,专为与最灵活的 AI 工厂平台 Vera Rubin NVL72 协同工作而设计,帮助企业及云服务商交付智能体应用所需的低延迟、极高吞吐量和可扩展的经济效益。
突破性性能并非来自孤立优化各个组件,而是源于对整层架构的协同设计。从网络、上下文处理到大规模推理,NVIDIA 的全栈平台将 AI 工厂打造成集成化的智能引擎,把日益增长的 token 产量转化为实实在在的营收。
https://blogs.nvidia.com/wp-content/uploads/2026/08/HotChips2026_Sizzle_final_30MB.mp4太平洋时间 8月24日 周二 上午8:00 🔗
NVIDIA 合作伙伴采用 Vera Rubin 实现最低 Token 成本
领先的 AI 云服务商 Nebius 率先采用 NVIDIA Groq 3 LPX,为开发者提供顶级的 token 生成速度,打造高度响应的智能体 AI 应用。
在 Nebius Token Factory 中,NVIDIA Groq 3 LPX 与 NVIDIA Vera Rubin NVL72 强强联合,大幅提升推理性能,让开发者能够大规模构建高交互性智能体、编码系统及各类实时 AI 体验。
CoreWeave 正在为 NVIDIA Vera Rubin 机架部署 Spectrum-X Multiplane,为其 AI 云基础设施解锁全新突破。
太平洋时间 8月24日 周二 上午8:00 🔗
SpaceXAI 采用 NVIDIA Vera CPU 打造智能体 AI
SpaceXAI计划围绕NVIDIA Vera Rubin构建并扩展其未来AI架构,从地球数据中心延伸至轨道卫星。该公司计划部署NVIDIA Vera CPU,以加速Agentic AI背后的CPU密集型工作,包括编排、工具调用、代码执行、数据处理和仿真。
SpaceXAI 的合作将NVIDIA全栈AI平台延伸至SpaceXAI,整合Vera CPU、NVIDIA加速计算、网络与软件,以前所未有的规模推动AI发展。
为智能体时代而生,Vera Rubin提供领先的单核性能、卓越的内存带宽和高负载下的可预测性能,帮助智能体更快完成任务,同时确保宝贵的GPU基础设施保持充分利用。
8月24日(周二)上午8:00 PT 🔗
NVIDIA Groq 3 LPX:交互式AI推理加速器
NVIDIA Groq 3 LPX与Vera Rubin NVL72平台联合设计,助力AI工厂以最低延迟交付tokens,满足智能体负载需求。
智能体AI正在带来新的性能挑战:解码延迟。随着AI智能体进行推理、使用工具并与其他系统交互,它们一次生成一个token,导致微小的延迟在复杂的工作链中不断放大。为了让智能体以用户期望的速度运行,NVIDIA Groq 3 LPX在Vera Rubin NVL72平台基础上增加了针对token生成的专用加速能力。
NVIDIA Rubin GPU负责大规模上下文处理,而LPX则加速延迟敏感的解码负载。最终结果是更快、更可预测的token生成,帮助AI工厂提供更敏捷的推理、更流畅的智能体交互和更高的基础设施效率。

Rubin GPU与LPU协同设计,旨在消除传统设计中速度与吞吐量的权衡,帮助AI提供商为下一代智能体AI应用提供响应迅速的大规模推理服务。
构建Token工厂
随着行业重心从模型训练转向规模化智能服务,基础设施必须演进为NVIDIA所称的"token工厂"——同时提供高性能、高吞吐、智能保真与经济效益。Agent化AI系统正日益频繁地与其他AI系统进行交互、接入多种数据源、维持庞大的上下文,这催生了对极速推理的空前需求。 NVIDIA Groq 3 LPX正是为这些工作负载而生。作为Vera Rubin NVL72的延伸,它能在面对超大上下文窗口时依然实现极速响应,同时帮助服务提供商最大化吞吐量与基础设施利用率。面向推理的极致协同设计
有别于独立加速器,NVIDIA Groq 3 LPX通过极致协同设计将GPU与LPU的优势融为一体。Rubin GPU与LPU共同计算AI模型的每一层,为Agent化工作负载带来全新水平的推理性能。
在大规模部署中,LPU集群如同一个巨型处理器,专为确定性推理而优化。一个机架级NVIDIA Groq 3 LPX部署可容纳多达256个LP30加速器,通过芯片间直连构成高效推理引擎,专为现代AI工厂打造。
为Agent化AI时代而生
随着推理模型不断壮大、Agent工作流产生越来越多的token,支撑其运转的基础架构必须持续演进。NVIDIA Groq 3 LPX以专属推理架构拓展Vera Rubin NVL72平台,旨在最大化响应速度、吞吐量与效率,为下一代AI工厂注入动力。
而这仅仅是开始——更多优化、更多模型、更高性能,在与Vera Rubin NVL72协同后将持续释放,更高吞吐量与更强交互能力即将到来,敬请期待。
周二,8月24日,上午8:00 PT 🔗
NVIDIA Spectrum-X Multiplane赋能更扁平、更具韧性的网络,实现海量AI工厂级扩展
随着AI工厂规模不断膨胀,网络已成为性能提升的关键引擎。在Hot Chips大会上,NVIDIA重点展示了Spectrum-X Multiplane——这是硬件加速Spectrum-X以太网架构的最新进展,让以太网得以扩展到前所未有的规模,同时避免了引入额外网络层级所带来的延迟、抖动和成本问题。
NVIDIA Spectrum-X以太网是一个端到端、专为AI优化的以太网平台,通过整合NVIDIA Spectrum-X以太网交换机、SuperNIC和软件,提升AI工厂和云环境中基于以太网的AI基础设施的性能与效率。该平台相比商用以太网可实现1.6倍的AI网络性能提升,同时在多租户场景下提供稳定、可预期的性能表现。
Multiplane 在不妥协的前提下解锁规模化
将AI工厂扩展到超越当前最大集群的传统方案,需要引入第三个网络层级,而这会带来延迟增加、性能不可预测下降,以及布线、光器件和功耗成本的攀升。Spectrum-X Multiplane采取了更简洁的方案:将每台服务器的网络连接拆分为多条独立路径(即"平面"),每个平面各自运行轻量级的两层网络。最终构建出一个平坦、简单的网络结构,可扩展至512,000个GPU,无需承担第三层级的额外成本和复杂度。 这一切均由硬件自动完成。NVIDIA ConnectX SuperNIC内部的专用硬件引擎负责跨平面管理流量,并在任何故障发生时即时绕行,对应用和软件而言,它们始终看到的是一条高速、可靠的连接。在八平面拓扑中,即使某个平面发生故障,网络仍可保持约90%的总带宽,硬件级故障恢复速度比基于软件的多平面负载均衡快11倍,最终带来1.6倍的AI工厂产出提升。极限协同设计铸就
这种可靠性来自Vera Rubin NVL72的极致协同设计,覆盖交换芯片、SuperNIC与软件。基于102.4Tb/s Spectrum-6以太网ASIC与ConnectX-9 SuperNIC的Spectrum-X SN6000系列交换机,单GPU带宽可达1,600Gb/s,专为Vera Rubin NVL72 AI工厂定制。Spectrum-XGS以太网将同套协同设计延伸至数据中心全域,使多个设施能像单一AI超级工厂般协同运作,并将跨站点NCCL集合通信速度提升1.9倍。8月24日(周二)太平洋时间上午8:00 🔗
NVIDIA推出BlueField-4与DOCA加持的Agentic AI工厂Scale-In基础设施
NVIDIA正式推出NVIDIA Scale-In——AI networking的第五大支柱,以及专为Agentic AI工厂打造的全新加速网络基础设施。Scale-In将定制化加速能力覆盖至保障AI工厂安全、管理与运维的底层服务。

依托NVIDIA BlueField-4处理器与DOCA软件平台,并通过NVIDIA Spectrum-X以太网互联,NVIDIA Scale-In将传统的南北向网络重塑为统一的高效加速基础设施域。
云计算将软件定义网络、资源编排与弹性扩展引入数据中心,让用户、应用、数据与服务均可动态伸缩。
Agentic AI标志着下一轮平台演进。AI工厂将海量加速算力与激增的用户、应用及自主智能体紧密融合,它们持续与数据、存储及服务交互,从而彻底重构了驱动AI落地的基础设施需求。如今,网络、存储、网络安全与运维必须与AI算力同步加速,实现软件定义的灵活性、定制硬件加速与全栈协同设计的深度融合。
NVIDIA Scale-In 提供多租户网络、高性能存储访问、硅级安全、弹性供应和实时可观测性,同时保持基础设施处理与主机计算资源相互独立。通过将上述服务加速并作为 AI 工厂的一部分协同设计,Scale-In 帮助安全、数据访问和运维随 AI 算力同步扩展。最终结果是构建出安全、高效且易于管理的共享基础设施,用于以大规模部署和运行智能体 AI。
8月24日 周二 上午8:00 PT 🔗
NVIDIA NVLink Fusion 将 XPUs 连接至 NVIDIA 领先的 AI 平台
NVIDIA NVLink Fusion 将定制芯片引入 NVIDIA 全球领先的 AI 基础设施平台,帮助超大规模企业和 AI 原生公司以更高性能、灵活性和速度构建半定制 AI 工厂。
随着 AI 模型规模和复杂度的增长,仅靠算力已不够用。AI 工厂需要高带宽、低延迟的 scale-up 网络、成熟的机柜级架构,以及覆盖电源、冷却、管理软件和供应链的完整生态体系。NVLink Fusion 通过将定制 XPU 和 CPU 连接到 NVIDIA 的 scale-up 与 scale-out 技术栈来解决这些挑战。
该平台包括第六代 NVIDIA NVLink 和 NVLink Switch 专用 scale-up 网络,以及用于 XPU 与 CPU 之间节能互联的 NVLink-C2C。通过 NVIDIA MGX 生态,采用者还可使用经生产验证的机柜设计、组件、制造合作伙伴解决方案以及用于分布式计算、分离式工作负载和集群管理的开放可扩展软件。
通过在统一架构下标准化基于 GPU 和 XPU 的系统,NVLink Fusion 帮助数据中心建设与芯片就绪状态解耦。运营方可共享机柜 footprint、网络、冷却、供电和管理系统,随后根据供应和工作负载需求的变化灵活调整 GPU 与 XPU 的比例。
NVLink Fusion 延续了 NVIDIA AI 平台「纵向垂直整合、横向开放兼容」的定制芯片策略,让合作伙伴能在自身差异化领域自由创新,同时依托 NVIDIA 在计算、网络、基础设施和软件各层的技术能力,共同打造一家任何单家公司都无法独立建成的、灵活统一的 AI 工厂。