← 文章 / 芯片硬件
NVIDIA 博客 4小时前 · 2026-09-03 01:54:38 · 5 阅读

每瓦算力提升最高30倍:NVIDIA Vera Rubin NVL72为AI Agent树立新能效标杆

根据 OpenRouter 数据,智能体 AI 工作负载消耗的词元量是简单对话请求的 15 倍。为什么?

以 AI 智能体为投资决策调研一家公司为例:它会查询金融数据库、搜索新闻和文件、调用子智能体进行同业对比和估值建模,最终综合所有信息给出推荐建议。智能体和子智能体持续推理直至任务完成,从而驱动词元需求的不断增长。每一步积累的词元都成为下一步的输入,这使得长上下文处理能力成为智能体 AI 性能的核心。

从软件开发、客户服务到深度研究,同样的模式贯穿于各类智能体应用场景。

随着智能体 AI 在各行各业投入生产使用,支撑它的基础设施必须高效满足词元需求。

新的实测性能数据显示,NVIDIA Vera Rubin NVL72 系统在智能体工作负载下的每兆瓦吞吐量比 NVIDIA GB300 NVL72 最高高出 30 倍。NVIDIA 采用 SemiAnalysis AgentX 工作负载测得上述推理吞吐量数据——该负载由真实智能体编程会话录制而成,保留了实际的上下文增长、工具调用和子智能体生成过程。对于受功耗限制的 AI 工厂而言,这意味着同等能耗下可处理 30 倍更多的智能体工作。

这些 Vera Rubin NVL72 的早期成果展示了 NVIDIA 快速迭代的创新节奏。随着软件优化持续进行,Vera Rubin NVL72 和 GB300 NVL72 的性能还将进一步提升。

Vera Rubin NVL72:每兆瓦吞吐量提升 30 倍,每个词元成本降低 35 倍

智能体工作负载与对话或文档摘要有本质区别:后者的输入和输出序列通常为 1K 至 8K 词元,而智能体会话中上下文随步骤不断累积,输入词元可达数十万,且不同请求的输入输出长度差异很大。性能衡量方式也需要随之演进,以捕捉完整的智能体工作流,而非单次推理请求。

以下为基于真实智能体编程轨迹测得的性能数据。

SemiAnalysis AgentX 基准测试中,NVIDIA Blackwell 平台在 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5 及 DeepSeek V4 Pro 等多个智能体模型上均展现领先性能。

以 DeepSeek V4 Pro 模型为例,GB300 NVL72 的每兆瓦吞吐量较 NVIDIA Hopper 架构最高提升 15 倍,为客户运行智能体工作负载奠定了高性能基础。这一突破源于更大规模的 GPU Scale-up 域与软硬件协同设计,大幅提升了推理效率。

Vera Rubin 进一步放大了这一优势,在帕累托前沿曲线上全面提升性能表现,在 DeepSeek V4 Pro 模型上每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍。上述早期数据基于 SemiAnalysis AgentX 工作负载测得,目前正待该机构审核,暂未涵盖 Vera CPU 在工具调用场景下的性能表现。

NVIDIA DSX MaxLPS 技术实现 GPU、机柜与工作负载三层级的统一供电调度,在同等兆瓦预算下可多部署 40% 的 GPU,进一步突破 AI 工厂规模化下的每兆瓦吞吐量上限。

每兆瓦吞吐量直接决定单个 token 的生成成本。Vera Rubin NVL72 每百万 token 的成本较 GB300 NVL72 最高降低 35 倍,可支撑客户全量工作负载下智能体的持续、规模化运行。

对受限于电力的 AI 工厂而言,每兆瓦吞吐量直接决定 AI 工厂营收,而每百万 token 成本则决定了这部分营收的利润空间。

面向智能体规模化运行的极限协同设计

现代推理优化涵盖多种技术,对智能体 AI 尤为关键。NVIDIA Vera Rubin NVL72 通过在平台各层进行极致协同设计,实现了所有这些技术乃至更多,带来数倍性能提升。
  • 解耦服务将上下文处理(prefill)与响应生成(decode)分离,使两者可独立扩展。
  • 速率匹配同步 prefill GPU 和 decode GPU 的 token 产出速度,最大化效率。
  • 大规模专家并行将 混合专家(MoE)模型 中的专家子网络分布在 scale-up GPU 域内。
  • 分布式 KV 缓存将显存扩展到 scale-up GPU 域,同时将较低活跃的上下文卸载至主机和存储,使已处理的上下文可直接访问而无需重新计算。
  • KV 感知路由将请求定向至已缓存相关上下文的 GPU,减少长会话中的冗余计算。
  • MegaMoE 等融合 CUDA 核函数将多种计算和 GPU 间通信操作合并为单次执行,保持 GPU 活跃而非等待数据。

NVIDIA Rubin GPU 增强版第五代 Tensor Core 与第三代 Transformer Engine 可同时加速推理的 prefill 和 decode 阶段。NVFP4 量化将模型权重压缩至 4-bit 精度,在不牺牲输出质量的前提下减少显存占用并提升吞吐量。

NVL72 scale-up 域是 Vera Rubin 和 Grace Blackwell 的标志性架构,支持大规模专家并行和分布式 KV 缓存等技术所需的高带宽、低延迟 GPU 间通信。为此专门打造的 NVIDIA NVLink 互连技术与 NVLink Switch(现已第六代)相比现成以太网方案,包速率提升 10 倍、延迟降低 3 倍。

从高度优化的 CUDA 内核,到 NVIDIA TensorRT-LLM 等推理运行时,再到 NVIDIA Dynamo 等服务框架,NVIDIA 的软件栈均与硬件协同设计,以实现推理优化。 上述结果反映的是当前 Vera Rubin NVL72 的性能表现,而完整的平台采用七芯片架构,还包括 NVIDIA Vera CPU、Groq 3 LPU、NVLink 6 Switch、BlueField-4 DPU、Spectrum-6 SPX 以及 ConnectX-9 SuperNIC,全部专为大规模部署 AI Agent 的智能工厂打造。 极致的协同设计同样延伸至 NVIDIA 与合作伙伴的联合工程。Vera Rubin 已全面投产,并正在生态系统中加速扩展。 了解更多关于 NVIDIA Vera Rubin 平台的信息。
原始来源: NVIDIA 博客

评论 (0)