← 文章 / 芯片硬件
NVIDIA 开发者博客 5小时前 · 2026-09-16 01:02:31 · 3 阅读

NVIDIA Groq 3 LPX 确定性执行如何驱动 Vera Rubin 平台上高能效的高交互推理

功耗是 AI 工厂的核心限制因素。随着 AI 负载需要完整的计算平台支撑,平台中的每个组件都必须在工厂有限的功耗预算内最大化输出。因此,每瓦性能——而非未经归一化的原始吞吐量——成为衡量 AI 平台价值的终极指标。 NVIDIA Vera Rubin 平台旨在实现大规模、高效的 AI 算力输出。其核心是 NVIDIA Vera Rubin NVL72,它能在最广泛的 AI 计算需求范围内提供出色的每瓦性能——从追求吞吐量大批量任务,到高交互层级的少量任务,覆盖开源与闭源模型。 工厂级和机架级的功耗管理创新推动了 Vera Rubin 在此关键指标上的表现。在工厂层面,NVIDIA DSX MaxLPS 软件可根据负载需求变化在不同机架间调配电力,让运营方回收闲置电力,在相同的站点功耗范围内部署多达 40% 的 GPU,并实现 35% 更高的 Token 吞吐量。 在每个 Vera Rubin NVL72 机架内部,机架级电容器配合荷电状态智能电力平滑软件,吸收训练和推理负载产生的突发功耗尖峰,使工厂可依据持续需求而非最坏情况峰值进行规划。这意味着每兆瓦可部署更多算力。 最高交互层级面临独特挑战。为此,平台引入 NVIDIA Groq 3 LPX 作为低延迟加速器。本文解释了 LPX 机架内部的创新技术,说明它如何成为 Vera Rubin 平台中能效卓越的组件,包括其确定性执行模型。 NVIDIA Groq 3 LPX 机架包含哪些功耗效率技术?

Groq 3 LPX 的确定性执行模型让 LPU 编译器能够制定一份精确的执行计划:每份数据何时移动到哪个计算单元、每个操作具体在哪个时钟周期执行,都能精确到拍。这一模型可扩展到机架中的全部 256 颗 LPU 芯片,从而实现长上下文下的超高速交互,并支撑起一系列借助这种确定性实现的功耗管理技术。

LPU 编译器生成工作负载的执行计划后,就能预测该计划中每个时钟周期的电流消耗。这进而催生了两种互补的技术:

  • Preemptive Power(PEP,预判式供电):在功耗需求变化到来之前,提前让供电系统做好准备
  • Clock Period Synthesis(CPS,时钟周期合成):调控功耗需求上升和下降的陡峭程度

PEP 和 CPS 协同工作,可以缩小所有芯片都必须持续预留的“电压保护带”(即电气安全余量)——这部分功耗并不直接用于 AI 工作负载。缩小电压保护带,意味着宝贵的功率预算中能有更大比例真正花在工作负载上。

示意性堆叠柱状图(未按比例绘制),对比芯片在不启用确定性 PEP 和 CPS 与启用确定性 PEP 和 CPS 时运行同一 AI 工作负载的能耗情况。两者在 AI 工作负载本身上的能耗相同;启用 PEP 和 CPS 后,用于电压保护带的能耗更低,因此总能耗更低。图表还指出能耗随电压的平方缩放:电压高 10%,能耗将增加 21%。
图 1. Groq 3 LPX 的确定性使能技术如 PEP 和 CPS,助力同一工作负载实现更高能效

如何在需要时精确为 AI 工作负载供电,面临哪些挑战?

运行 AI 工作负载时,芯片会执行一系列指令,从简单的数据重排到复杂且耗能的矩阵乘法不等。几乎所有芯片都包含硬件特性,允许在工作负载运行期间,随着资源可用而在多种操作之间动态切换。这种灵活性意味着高计算强度的操作可能在任意时刻被调度执行。因此,向芯片供电的系统必须按此设计。

支撑 AI 工作负载的矩阵乘法和向量乘法涉及短时间内大量晶体管切换,从而在纳秒尺度上增加芯片的电流需求。芯片会从最近的可用电源——即紧邻芯片的去耦电容(或称去耦电容)——汲取额外电流。这些电容放电会导致芯片电压下降。

芯片所在电路板确实配备了电压调节器,其核心职责是将芯片供电电压稳定在设定目标上。但由于电感的存在,它无法即时响应电流的剧烈上升。不过,调节器输出的电流最终会跟上芯片的实际需求,使电压得以恢复。

这些短暂的电压跌落,归根结底是由 AI 工作负载引起的电流需求急剧变化所导致的,业内称之为“电压降”(voltage droop)。其幅度取决于电流变化量以及 di/dt(电流变化率)。在其他条件相同的情况下,di/dt 越大,电压降越明显;反之,若相同的电流绝对变化量发生在更长的时间跨度内,di/dt 会较低,电压降也随之减小。通常情况下,这些电压降不会造成问题。然而,所有芯片都有一个最低工作电压(Vmin),一旦低于此阈值,芯片将停止正常运作并产生错误结果。

动画演示了芯片电流阶跃上升导致附近去耦电容放电及芯片电压下降的过程。随后电压调节器响应,为电容充电并恢复电压,同时电压保持在 Vmin 之上;图示还给出了 dV_chip/dt = I_decap/C。
图 2. 当芯片快速提取功率时,去耦电容迅速放电,电压快速下降,而电压调节器尚未完成恢复,此时便发生电压降。

为降低出现这种最坏情况的概率,芯片通常会设置电压保护裕量(voltage guardband),即在瞬态及最恶劣条件下,依然能提供足够的供电电压余量,确保芯片获得所需的最低电压。大多数时候,为维持这一保护裕量而消耗的功率实际上是过剩的。此外,功耗与电压的平方成正比,因此电压高出 10% 意味着持续多消耗 21% 的功率。

NVIDIA Groq 3 LPX 的周期精确调度如何让当前算力需求变得可预测?

Groq 3 LPX 的确定性执行模型可以在 AI 负载开始运行之前,就为其制定好完整的执行计划,涵盖计算操作和数据搬运。单个 LPU 加速器包含的硬件模块种类不多,每种都能以可预测的高速度执行最常见操作:

  • MXM 负责矩阵乘法
  • VXM 负责向量运算
  • SXM 负责转置和形状变换

单个加速器还配备了让这些计算单元精确同步到时钟周期的硬件。内存方面,每颗芯片都采用无层级的片上 SRAM bank。在 LPX 系统层面,各 LPU 之间直接互联,不经过任何中间环节,数据传输时间因此更可预测。

确定性把这一切硬件能力串联起来:无论是单次计算、内存读取还是芯片间通信,每次运行所需的时钟周期数都完全一致。编译器可以利用这一点,提前规划数据在各个计算单元之间的搬运时机,让数据在需要的时间和地点准时到位。这份计算与数据搬运计划还让编译器能够提前化解常见的资源冲突,比如两个硬件单元同时写同一个内存 bank 的情况。

对比动态调度加速器与 LPU 的示意图。在动态调度系统中,执行前仅能获知计算指令的延迟;数据搬运时序与资源冲突需在运行时确定。而在 LPU 中,编译器提前确定上述三项,并生成逐周期精确的调度方案。
图 3. Groq 3 LPX 执行模型及其编译器输出,与动态调度加速器对比

这种逐周期精确的调度方案,使得计算负载随时间变化的电流需求成为可能。编译器可在时钟周期层面预估系统电流消耗。

展示 MXM、VXM、SXM 及 SRAM 存储在 50,000 个时钟周期内活动情况的示意时间轴,并配对展示由该调度方案推导出的电流需求曲线。当两个 MXM 平面同时流式传输时电流需求达到峰值;当仅 SXM 和存储器活跃时需求回落。
图 4. Groq 3 LPX 的逐周期精确调度方案,由其编译器在 AI 负载运行前生成。电流需求曲线可由该调度方案推导得出

执行模型如何实现主动电压和时钟控制?

周期精确的调度及其产生的电流需求曲线,使 Groq 3 LPX 能够减小电压跌落(voltage droop),并以更小的电压余量(guardband)运行。由于编译器能精确到时钟周期地预判电流需求何时上升、何时下降,它可提前对供电系统进行准备,并借助互补的 PEP 和 CPS 技术来平滑最剧烈的电流需求波动。

  • PEP 是芯片向供电网络(PDN,即为 LPU 提供电力物理电子系统)下发指令以改变输出电压的机制。因为编译器清楚电流会在哪些周期出现尖峰,它足够提前调度这些指令,使得在电流需求真正到来之前,供给电压已经处于调整状态。这样,去耦电容需要补偿的缺口更小,电流快速上升时芯片的电压下跌也更平缓。
  • CPS 允许编译器将工作负载中的单个时钟周期缩短或延长。之所以能做到逐周期调度,得益于 Groq 3 LPX 的伪同步时钟系统:该系统保持芯片间时钟同步,同时保持片内各计算单元同步。与 PEP 相比,CPS 能对电流最剧烈的变化实施更细粒度的控制。具体来说,电流尖峰最高的那些周期可以被拉长,从而降低 di/dt(电流随时间变化率)。
四条同步曲线的动画,分别展示芯片电流、供电电压、PEP 电压校正和 CPS 时钟频率。在电流上升之前,PEP 先提高芯片电压,CPS 短暂降低时钟频率,从而减缓电流上升的斜率,减少电压跌落,同时保证电压始终高于 Vmin。
图 5. PEP 和 CPS 分别通过调节电流的供需,让核心电压能够更接近 Vmin 运行,从而减少所需的电压裕量,实现功耗节省

PEP 和 CPS 相结合,让编译器能够调度电信号甚至时钟周期的长度,从而减少电压跌落。在 Groq 3 LPX 系统上的内部测试表明,这种方式可将电压跌落降低 60% 以上。据估算,电气系统为 AI 工作负载持续提供的基准电压可以降低高个位数百分比。由于功耗与电压的平方成正比,这将带来更高百分比的功耗下降——而且完全不影响工作负载。

两张随时间变化的曲线图:一张展示芯片的供电电压,另一张展示芯片功耗。图中对比了旧电压/旧功耗(黑色)与新电压/新功耗(绿色)。电压按比例降低,功耗曲线上的凹陷变小,表示功耗下降。高亮部分显示:电压降低 5%–10% 可带来约 8%–19% 的功耗节省。
图 6:更小的电压 guardband 可降低供电电压,且每个周期的功耗节省与电压降幅的平方成正比

在高交互场景下提升每瓦性能

与同规格的非确定性系统相比,Groq 3 LPX 确定性执行可将运行相同工作负载所需的功耗降低低个位到双位数的百分比。在功耗受限的 AI 工厂中,降低这部分开销可为 token 生成保留更多固定的电力预算。

Groq 3 LPX 将在 2026 年下半年把这些由确定性机制驱动的功耗控制功能带入 NVIDIA Vera Rubin 平台。它们在工厂层面与 NVIDIA DSX MaxLPS 以及 Vera Rubin NVL72 机架内的智能功耗平滑功能形成互补。这三者分别作用于平台的不同的层级,但目标一致:从每一兆瓦电力中榨取更多有用的 AI 推理输出。

在平台层面,将 Groq 3 LPX 与 Vera Rubin NVL72 搭配使用,在长上下文、高交互性场景下处理 2T+ 参数模型时,相比上一代 NVIDIA GB200 NVL72,每兆瓦吞吐量最高提升 35 倍。对于 AI 工厂而言,这意味着在相同功耗预算下,能在该严苛工况下服务更多的 token。

致谢

本工作得以完成,得益于 Aravind Vellora Vayalapra、Santosh Raghavan、Kibibi Moseley、Ashraf Essea、Graham Steele、Suhas Somnath、Sarah McKenney、Farshad Ghodsian 和 Eduardo Alvarez 的专业支持与工程贡献。

原始来源: NVIDIA 开发者博客

评论 (0)