← 文章 / 芯片硬件
NVIDIA 博客 7小时前 · 2026-09-17 02:12:19 · 6 阅读

NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,性能领跑

系统性能、高效的基础设施扩展以及持续的软件优化,是决定 AI 推理经济性的三大核心杠杆。更高的系统性能意味着生成更多的 token,直接带来更高的收入。高效的扩展则意味着随着硬件增加,吞吐量按比例线性增长,从而以更少的资源支撑大规模用户服务。而持续优化则意味着从既有基础设施投资中挖掘出更多价值。

这三者背后共同的基石是平台的通用性:同一套基础设施可以运行任何模型、任何工作负载,从训练到推理,从推荐到逻辑推理,从语言到视频,始终保持高利用率。

NVIDIA 平台专为在上述所有维度上进行优化而设计,今日发布的 MLPerf Inference v6.1 结果充分印证了这一点:

  • NVIDIA Vera Rubin NVL72 系统首秀即领跑:在首次参加 MLPerf Inference 预览基准测试中,NVIDIA Vera Rubin NVL72 的吞吐量最高可达 GB300 NVL72 的 3.7 倍。
  • NVIDIA GB300 NVL72 展现出卓越的扩展效率:由 4 个 GB300 NVL72 机架组成的 288-GPU 提交方案实现了 99% 的扩展效率,吞吐量相较于单机架基线呈近乎线性增长。
  • 持续的软件优化驱动性能提升:NVIDIA 在 MLPerf Inference v6.1 提交中引入的软件优化,使性能较 v6.0 提升最高达 1.6 倍。且在 v6.1 提交后,优化工作仍在继续,带来进一步的性能增益。

对于正在制定 AI 基础设施决策的组织而言,性能、扩展效率和软件迭代速度是决定长期推理经济性的关键考量因素。

Vera Rubin NVL72 首战 MLPerf Inference 基准测试,性能表现领先

NVIDIA 在 MLPerf Inference v6.1 套件中两项要求最严苛的基准测试——DeepSeek-R1 和 Qwen3-VL——上提交了 Vera Rubin NVL72 的预览结果。

在 Qwen3-VL 上,采用基于 NVIDIA Dynamo 开源推理框架的 vLLM,Vera Rubin NVL72 在离线、服务器和交互式三种场景下,吞吐量最高可达 GB300 NVL72 的 3.7 倍。在 DeepSeek-R1 上,使用 NVIDIA TensorRT-LLM 库时,吞吐量最高可达 GB300 NVL72 的 2.5 倍。这些早期结果彰显了 NVIDIA 加速创新的步伐,并预示着通过持续的软件优化,性能还将进一步提升。

MLPerf Inference v6.1 封闭分区。结果取自 www.mlcommons.org,检索日期为 2026 年 9 月 16 日。NVIDIA 平台结果来自以下提交条目:6.1-0106 和 6.1-0074。MLPerf 名称和标识是 MLCommons Association 在美国及其他国家/地区的注册及未注册商标。版权所有,严禁未经授权使用。详情参见 www.mlcommons.org。

这意味着与 GB300 NVL72 相比,每个 Vera Rubin NVL72 机架能生成更多 token、服务更多用户、创造更多收入,同时降低单 token 成本。

这些成绩体现了软硬件全栈协同设计的成果。Vera Rubin 增强的 Tensor Core 和 Transformer Engine 可加速推理的 prefill 和 decode 两个阶段,而 NVFP4 精度降低了模型权重、注意力和 KV cache 的内存占用——在几乎不损失输出质量的前提下提升吞吐量。

Vera Rubin 的提交大量采用了分离式服务,将 prefill 和 decode 拆分,并结合大规模专家并行,在驱动 DeepSeek-R1、Qwen3-VL 等模型的 mixture-of-experts 层上实现最大效率。

NVL72 纵向扩展域——由第六代 NVIDIA NVLink 和 NVLink Switch 驱动,比现成以太网提供 10 倍的包速率和 3 倍更低的延迟——为这些技术在机架规模上发挥作用提供了互联基础。

这种协同设计也延伸到 NVIDIA 的合作伙伴生态:Nebius 也提交了 Vera Rubin NVL72 预览版结果,展现出卓越性能。

能够跨多个步骤进行推理、规划和行动的 AI agent 正在改变推理性能的衡量方式。在旨在捕捉这一变化的基准测试(如 SemiAnalysis AgentX)中,Vera Rubin NVL72 在预览测试中的性能达到 GB300 NVL72 的 30 倍。此外,即将推出的 MLPerf Endpoints 基准将为 agentic 推理工作负载带来标准化测量,超越传统吞吐量基准的覆盖范围。

NVIDIA GB300 NVL72 以领先能效实现扩展

扩展效率——即增加的 GPU 能多大程度转化为吞吐量提升——是衡量 AI 基础设施生产力的关键指标。NVIDIA 通过在机架内部提供高带宽、低延迟的横向扩展互连,机架间的高带宽网络,以及跨节点的高效请求编排,实现了这一点。

NVIDIA 提交的 DeepSeek-R1(DSR1)方案从单台 GB300 NVL72 机架(72 个 GPU)扩展到四台机架(288 个 GPU),在离线场景下实现了 99% 的扩展效率。吞吐量随硬件增加而近乎线性增长。

MLPerf Inference v6.1, Closed Division. Results retrieved from www.mlcommons.org on Sep 16, 2026. NVIDIA platform results from the following entries: 6.1-0073 and 6.1-0074. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use is strictly prohibited. See www.mlcommons.org for more information.

扩展效率之所以关键,是因为 GPU 数量的增加并不自动意味着吞吐量的等比例提升。如果 GPU 数量近乎翻倍,吞吐量却仅提升个位数百分比,基础设施成本将远超性能收益。架构、互连和软件必须协同扩展。

GB300 NVL72 在 WAN 2.2 文生视频基准测试中也展现了机架级效率,达到每秒 0.65 个 720p 视频,每视频处理时间为 5.7 秒——吞吐量比单节点高 9 倍,延迟低 7.5 倍。

软件优化驱动持续性能提升

NVIDIA 平台经历持续的软件开发,不断带来性能和功能改进。

在 v6.1 中,GB300 NVL72 在 Qwen3-VL 上的性能相比 v6.0 提升了最多 1.6 倍。这得益于降低 KV cache 精度、增加内核融合、优化内核以及使用 vLLM 和 NVIDIA Dynamo 进行分离式服务。

软件优化在 v6.1 提交截止日期后仍在继续。尚未得到 MLCommons 验证的提交后结果显示,GPT-OSS-120B 和 DLRMv3 的性能进一步提升了。

各规模下的 AI 推理

除了 NVIDIA Grace Blackwell 和 Vera Rubin NVL72 平台的成果,NVIDIA 还使用 NVIDIA TensorRT Edge-LLM 提交了 Jetson AGX Thor 在新增的 Edge-Agentic 基准测试中的结果,该测试使用了 Qwen3.6-27B 模型。

NVIDIA 合作伙伴生态系统广泛参与,19 家合作伙伴(其中 8 家运行在多节点 Blackwell NVL72 系统上)展示了卓越的性能。参与方包括华硕、Azure、思科、CoreWeave、Crusoe、戴尔科技、富士通、Giga Computing、HPE、广达、Lambda、Mitac Computing、Nebius、Oracle Cloud Infrastructure、研华云科技、Red Hat、ScitiX、超微计算机和纬颖。

从紧凑型边缘设备到最大的 AI 工厂,NVIDIA 持续推进全技术栈的性能提升,每年更新平台架构,持续改进软件,并构建了一个能够大规模交付成果的生态系统。

了解更多关于 NVIDIA Vera Rubin 平台 的信息。

原始来源: NVIDIA 博客

评论 (0)