← 文章 / 芯片硬件
NVIDIA 开发者博客 1小时前 · 2026-09-01 17:46:39 · 1 阅读

借助 NVIDIA Vera CPU 破解 Agentic AI 集群挑战

AI 工厂是相互连接的系统,其集群经济性取决于整个技术栈将电力和资本转化为已完成智能体任务的效率。GPU 负责运行模型,CPU 则承担编排、工具执行和沙箱计算。与运行特征相对稳定的传统计算不同,智能体工作负载具有不可预测性,且波动很大。对 163,594 个智能体会话的遥测数据分析显示,超过 97% 的会话呈现出独特的轨迹特征(图 1)。这种差异性使得通过多种专用 CPU 设计方案来合理配置集群规模变得并不现实。

Diagram of an agent request branching through tool calls, retries, parallel tasks, and completion paths.

图 1. 来自 163,594 个智能体会话的遥测数据,其中超过 97% 呈现独特的轨迹特征

生产环境的遥测数据还揭示了这些多样化轨迹的具体展开方式:在不同会话中,执行过程通常是一条漫长的串行推理链,期间穿插着零星的并行任务突发。实际数据表明,占主导地位的串行路径严格受延迟限制,决定了整个会话的完成时间;而短暂的扇出需求,则同时要求具备足够的线程并发能力和较低的单线程执行延迟。

AI 工厂不应围绕彼此孤立的工具调用场景进行规划,将集群拆分成多个专用部分,而应采用统一且均衡的 CPU 设计方案。NVIDIA Vera CPU 正是为此打造:针对典型智能体工作负载提供领先的单核性能,加速关键路径,同时应对间歇性出现的扇出突发。下面将分析这些智能体轨迹背后的遥测数据,并说明 Vera CPU 的均衡架构如何优化真实集群的经济性。

沿智能体轨迹的关键路径进行优化

智能体轨迹的形态由长度和宽度共同决定(图 2)。

  • 长度:智能体需要经过多少个推理步骤、工具调用、重试和子任务,才能完成一轮交互。
  • 宽度:每个阶段需要并发处理多少任务,例如并行工具调用、检索操作、沙箱或子 Agent。
Diagram showing an agent request branching through a sequence of tool calls, with labels for trajectory length and width.
图 2:Agent 轨迹在执行深度和并行宽度上各不相同

一次会话即使具有较高的并行宽度,大部分实际耗时仍可能花在等待串行链路上。这是因为并行任务只是短暂出现,而底层依赖链会贯穿整个运行过程。即便任务大规模并行展开,每个线程的延迟也依然至关重要。主 Agent 往往要等这些并行任务完成后,才能继续下一步。CPU 集群必须针对完整轨迹进行优化:既要提供足够的并发能力来应对并行任务的突发峰值,也要具备出色的单线程性能,加速最终决定端到端完成时间的串行路径。

因此,Agentic CPU 集群真正应该优化的指标,是完成的用户会话总数,而不是 CPU 核心数。高核心数系统表面上可能更高效,但往往需要做出取舍:为了达到核心密度目标,它们牺牲了降低 Agent 关键路径延迟所必需的单线程性能。

如果被迫让这些串行且对延迟敏感的任务运行在性能较低的核心上,或者在大规模并行的异构集群中承受较高的同步开销,Agentic 工作流就会受到影响。面向 Agent 工作负载的均衡型 CPU,既要有足够的核心来承载并发工具执行和子 Agent 的任务扩展,也要具备强劲的单线程性能,以加速那些主导 Agent 总体延迟的串行步骤。

真实 Agent 会话的运行方式

我们可以通过真实的 Agent 运行遥测数据验证这一点。在图 3 所示的真实 Claude Code 会话中,主 Agent 在整个 33 分钟的运行过程中,大部分时间都沿着一条较长的串行轨迹推进。

Line chart of input tokens over time showing a long main-agent trajectory and short, spiky bursts from parallel sub-agents.
图 3。Agentic 工作负载兼具长链路顺序执行和短暂的子 Agent 扇出突发

遥测数据展现了 Agentic 工作负载的两大特征:明显的扇出并行,以及漫长的依赖链。子 Agent 会产生必须快速处理的并行任务突发,但一次完整的用户请求仍需沿着有序的主链路推进,每一步都会解锁下一步。因此,CPU 集群既要具备足够的并发能力,及时消化扇出突发;又要在决定端到端完成时间的延迟敏感路径上,持续提供强劲的单线程性能。

Diagram of a generic 256-core CPU with 64 active cores and 192 cores idle, leaving 1.5 TB of attached memory at 8 GB per core.
图 4。关闭部分核心以提升单线程性能,可能导致最多 1.5 TB 的内存容量闲置

在任意时刻,CPU 都可以通过暂时关闭部分核心来提升单线程性能。但这样会让每个核心对应的 8 GB 内存处于闲置状态,并显著推高内存 TCO 成本(图 4)。均衡的 CPU 设计应针对完整的工作负载轨迹进行优化,而不是孤立地追求某个阶段的性能。通过结合出色的单线程响应能力、充足的并发度、较高的内存带宽和高效的功耗管理,这种设计能够在高效利用 CPU 核心、DRAM、GPU HBM 及整个内存层级的同时,最大限度地完成用户请求。

Vera CPU 如何实现这种平衡

Vera CPU 正是为这一工作点打造的,其 NVIDIA Olympus 核心经过专门设计,即使 CPU 处于满载状态,也能保持出色的单线程性能。宽前端、先进的分支预测、深度乱序执行以及高带宽内存子系统,帮助每个核心在大型代码规模、分支密集型控制流、动态运行时和依赖关系复杂的执行过程中持续推进。上面的 Claude Code 数据表明,Agentic 工作负载同样需要这种平衡:通过并发处理消化任务扇出,同时依靠单线程速度推动占主导地位的顺序路径。

图 5 中估算的 SPEC CPU® 2026 结果对这一设计目标进行了验证。该图展示了 Vera CPU 在典型 Agentic 工作负载下的满载单核性能,包括编译器、静态分析和 Python 基准测试;同时也表明,Olympus 能够在处理并发任务的同时,不牺牲 Agent 关键路径所需的性能。NVIDIA Vera CPU 的 Agentic 性能最高可达最新竞品的 1.5 倍。

Grouped bar chart comparing estimated per-core performance: AMD Venice 9996 is shown at 1× and NVIDIA Vera CPU at 1.5× for 723.lbm_r, 727.cpepcchk_r, 721.gcc_r, and 714.cpython_r.
图 5. 预计在四类 Agentic 工作负载中,NVIDIA Vera CPU 的单核性能将达到 AMD Venice 的 1.5 倍

打造理想的 Agentic 计算集群,只需一种 CPU 设计

Vera 为 Agentic AI 计算集群提供了更高效的 CPU 基础,因为它能够覆盖真实 Agent 执行轨迹的完整范围。在整颗插槽满载时,强劲的单线程性能可以持续推动对延迟敏感的顺序路径;而多核心并发能力和充足的内存带宽,则能吸收间歇性工具调用和子 Agent 扇出带来的负载。Vera CPU 的低延迟单体架构还可进一步减少由拓扑结构引起的停顿和各阶段性能波动。

这种均衡设计有助于避免资源闲置:无论是串行任务还是并行突发负载,CPU 核心都能保持高效工作;与核心绑定的内存也能得到充分利用,而不是因为计算资源利用率不足而被闲置。面对难以预测的工具调用模式,也无需将整支 CPU 集群拆分为多个专用设计点。

最终,这一 CPU 平台能够将计算能力、内存带宽和功耗转化为更多已完成的 Agent 交互轮次,从而提升 AI 工厂的产出和大规模集群的经济效益。

有关 NVIDIA Vera CPU 的架构与性能详情,请参阅 NVIDIA Vera CPU 白皮书

NVIDIA Vera 的 SPEC CPU® 2026 结果由 NVIDIA 于 2026 年 7 月在内部测得。有关性能测试与配置的详细信息,请参阅这份 NVIDIA Vera CPU 白皮书。AMD Venice 的结果基于此链接。Venice 的单项工作负载性能根据 SPECrate®2026_int_base 得分 2070 进行估算,其中各组件按照内部 Turin 测量结果完成归一化处理。实际结果可能有所不同。

SPEC®、SPEC CPU® 和 SPECrate® 是 Standard Performance Evaluation Corporation(www.spec.org)的注册商标。

致谢

本项目离不开 Ivan Goldwasser、Diana Aung、Hannah Coutand、Ian Finder、Benjamin Klieger、Arnav Jaiswal、Dylan Mitic 等众多同事的专业知识与宝贵见解。

原始来源: NVIDIA 开发者博客

评论 (0)