NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,性能领跑
系统性能、高效的基础设施扩展以及持续的软件优化,是决定 AI 推理经济性的三大核心杠杆。更高的系统性能意味着生成更多的 token,直接带来更高的收入。高效的扩展则意味着随着硬件增加,吞吐量按比例线性增长,从而以更少的资源支撑大规模用户服务。而持续优化则意味着从既有基础设施投资中挖掘出更多价值。
这三者背后共同的基石是平台的通用性:同一套基础设施可以运行任何模型、任何工作负载,从训练到推理,从推荐到逻辑推理,从语言到视频,始终保持高利用率。
NVIDIA 平台专为在上述所有维度上进行优化而设计,今日发布的 MLPerf Inference v6.1 结果充分印证了这一点:
- NVIDIA Vera Rubin NVL72 系统首秀即领跑:在首次参加 MLPerf Inference 预览基准测试中,NVIDIA Vera Rubin NVL72 的吞吐量最高可达 GB300 NVL72 的 3.7 倍。
- NVIDIA GB300 NVL72 展现出卓越的扩展效率:由 4 个 GB300 NVL72 机架组成的 288-GPU 提交方案实现了 99% 的扩展效率,吞吐量相较于单机架基线呈近乎线性增长。
- 持续的软件优化驱动性能提升:NVIDIA 在 MLPerf Inference v6.1 提交中引入的软件优化,使性能较 v6.0 提升最高达 1.6 倍。且在 v6.1 提交后,优化工作仍在继续,带来进一步的性能增益。
对于正在制定 AI 基础设施决策的组织而言,性能、扩展效率和软件迭代速度是决定长期推理经济性的关键考量因素。
Vera Rubin NVL72 首战 MLPerf Inference 基准测试,性能表现领先
NVIDIA 在 MLPerf Inference v6.1 套件中两项要求最严苛的基准测试——DeepSeek-R1 和 Qwen3-VL——上提交了 Vera Rubin NVL72 的预览结果。
在 Qwen3-VL 上,采用基于 NVIDIA Dynamo 开源推理框架的 vLLM,Vera Rubin NVL72 在离线、服务器和交互式三种场景下,吞吐量最高可达 GB300 NVL72 的 3.7 倍。在 DeepSeek-R1 上,使用 NVIDIA TensorRT-LLM 库时,吞吐量最高可达 GB300 NVL72 的 2.5 倍。这些早期结果彰显了 NVIDIA 加速创新的步伐,并预示着通过持续的软件优化,性能还将进一步提升。

这意味着与 GB300 NVL72 相比,每个 Vera Rubin NVL72 机架能生成更多 token、服务更多用户、创造更多收入,同时降低单 token 成本。
这些成绩体现了软硬件全栈协同设计的成果。Vera Rubin 增强的 Tensor Core 和 Transformer Engine 可加速推理的 prefill 和 decode 两个阶段,而 NVFP4 精度降低了模型权重、注意力和 KV cache 的内存占用——在几乎不损失输出质量的前提下提升吞吐量。
Vera Rubin 的提交大量采用了分离式服务,将 prefill 和 decode 拆分,并结合大规模专家并行,在驱动 DeepSeek-R1、Qwen3-VL 等模型的 mixture-of-experts 层上实现最大效率。
NVL72 纵向扩展域——由第六代 NVIDIA NVLink 和 NVLink Switch 驱动,比现成以太网提供 10 倍的包速率和 3 倍更低的延迟——为这些技术在机架规模上发挥作用提供了互联基础。
这种协同设计也延伸到 NVIDIA 的合作伙伴生态:Nebius 也提交了 Vera Rubin NVL72 预览版结果,展现出卓越性能。
能够跨多个步骤进行推理、规划和行动的 AI agent 正在改变推理性能的衡量方式。在旨在捕捉这一变化的基准测试(如 SemiAnalysis AgentX)中,Vera Rubin NVL72 在预览测试中的性能达到 GB300 NVL72 的 30 倍。此外,即将推出的 MLPerf Endpoints 基准将为 agentic 推理工作负载带来标准化测量,超越传统吞吐量基准的覆盖范围。
NVIDIA GB300 NVL72 以领先能效实现扩展
扩展效率——即增加的 GPU 能多大程度转化为吞吐量提升——是衡量 AI 基础设施生产力的关键指标。NVIDIA 通过在机架内部提供高带宽、低延迟的横向扩展互连,机架间的高带宽网络,以及跨节点的高效请求编排,实现了这一点。
NVIDIA 提交的 DeepSeek-R1(DSR1)方案从单台 GB300 NVL72 机架(72 个 GPU)扩展到四台机架(288 个 GPU),在离线场景下实现了 99% 的扩展效率。吞吐量随硬件增加而近乎线性增长。

扩展效率之所以关键,是因为 GPU 数量的增加并不自动意味着吞吐量的等比例提升。如果 GPU 数量近乎翻倍,吞吐量却仅提升个位数百分比,基础设施成本将远超性能收益。架构、互连和软件必须协同扩展。
GB300 NVL72 在 WAN 2.2 文生视频基准测试中也展现了机架级效率,达到每秒 0.65 个 720p 视频,每视频处理时间为 5.7 秒——吞吐量比单节点高 9 倍,延迟低 7.5 倍。
软件优化驱动持续性能提升
NVIDIA 平台经历持续的软件开发,不断带来性能和功能改进。
在 v6.1 中,GB300 NVL72 在 Qwen3-VL 上的性能相比 v6.0 提升了最多 1.6 倍。这得益于降低 KV cache 精度、增加内核融合、优化内核以及使用 vLLM 和 NVIDIA Dynamo 进行分离式服务。
软件优化在 v6.1 提交截止日期后仍在继续。尚未得到 MLCommons 验证的提交后结果显示,GPT-OSS-120B 和 DLRMv3 的性能进一步提升了。

各规模下的 AI 推理
除了 NVIDIA Grace Blackwell 和 Vera Rubin NVL72 平台的成果,NVIDIA 还使用 NVIDIA TensorRT Edge-LLM 提交了 Jetson AGX Thor 在新增的 Edge-Agentic 基准测试中的结果,该测试使用了 Qwen3.6-27B 模型。
NVIDIA 合作伙伴生态系统广泛参与,19 家合作伙伴(其中 8 家运行在多节点 Blackwell NVL72 系统上)展示了卓越的性能。参与方包括华硕、Azure、思科、CoreWeave、Crusoe、戴尔科技、富士通、Giga Computing、HPE、广达、Lambda、Mitac Computing、Nebius、Oracle Cloud Infrastructure、研华云科技、Red Hat、ScitiX、超微计算机和纬颖。
从紧凑型边缘设备到最大的 AI 工厂,NVIDIA 持续推进全技术栈的性能提升,每年更新平台架构,持续改进软件,并构建了一个能够大规模交付成果的生态系统。
了解更多关于 NVIDIA Vera Rubin 平台 的信息。