NVIDIA BlueField-4 驱动 Agentic AI 工厂的 Scale-In 网络基础设施
传统云基础设施是为可预测的通用工作负载和标准接口而设计的。Agentic AI工厂需要将各类用户、智能体、应用、数据源和存储系统连接起来,以每服务器多太比特带宽对接大规模加速计算,这使得DPU专用处理对于线速网络、存储和安全变得不可或缺。NVIDIA正在推出Scale-In网络基础设施——这是NVIDIA AI Networking的第五大支柱,为安全、管理和运营Agentic AI工厂提供专用加速。
Scale-In将南北向网络演进为AI工厂的统一基础设施域。基于NVIDIA BlueField-4和NVIDIA DOCA,并通过NVIDIA Spectrum-X以太网互联,Scale-In加速了保护整个AI技术栈的服务,并实现应用、数据和存储流量在AI工厂内的传输。专用且独立于主机的处理让这些基础设施服务从主机CPU上卸载,随着AI算力扩展,有效避免安全、数据访问和运维成为瓶颈。最终实现更安全高效的共享AI基础设施,随需求增长提供一致的AI服务与数据访问。
本文探讨BlueField-4架构,并说明Scale-In如何为Agentic AI工厂提供安全访问、高性能数据搬运、租户隔离、简化运维和更可预测的性能。
Scale-In加速南北向AI工厂基础设施
AI工厂在不同规模下有不同的基础设施需求:
- Scale-Up(向上扩展):NVIDIA NVLink将GPU整合为统一的加速器。
- Scale-Out(横向扩展):NVIDIA Spectrum-X以太网和NVIDIA Quantum InfiniBand连接AI工厂内的服务器。
- Scale-Across(跨域扩展):NVIDIA Spectrum-XGS以太网连接分布式AI工厂。
- 上下文内存:NVIDIA CMX基于NVIDIA STX模块化AI原生存储基础架构,在工厂内部提供共享KV缓存存储。
- Scale-In:NVIDIA BlueField-4、NVIDIA DOCA和NVIDIA Spectrum-X以太网协同加速AI计算周边的访问、安全、数据移动和基础设施运维。
南北向网络提供数据中心进出的访问路径,将用户、应用、数据源、存储系统和各类服务连接到各个独立系统。传统云数据中心基于软件定义基础架构、组合性和弹性来构建这些网络,以便随需求变化动态配置和扩展资源与访问能力。
Agentic AI对这类基础架构提出了更高要求。软件定义网络、组合性和弹性依然不可或缺,但已远远不够。AI工厂将海量加速计算与不断增长的用户、智能体、应用、企业数据源和存储系统汇聚在一起,实现持续的大规模交互。
基础架构需要作为AI工厂的一部分进行加速和协同设计。安全、多租户网络、数据与存储访问以及基础设施运维不能仅依赖通用宿主机CPU上运行的软件,也不能各自作为独立管理的层级运作。这些功能必须作为一个统一的基础设施域协同工作,让运维人员能够对整个AI工厂的访问、数据移动、安全、资源配置和可观测性实施一致的控制。
Scale-In通过将南北向访问演进为覆盖整个AI工厂的统一加速基础设施域来满足这些需求。BlueField-4提供独立于主机的加速与卸载能力,DOCA提供编程和运维基础设施服务的统一模型,Spectrum-X以太网则在Scale-In访问路径(包括外部存储和数据源)上提供高性能以太网连接。三者协同,让运维人员能够对支撑加速计算和数据存储的整体基础架构实施一致的访问控制、数据移动、安全保障、资源调配和可观测性管理。
AI工厂需要互补的存储基础设施来支持持久化数据和推理上下文。Scale-In提供对AI原生存储的高性能访问,包括面向训练、推理和分析的AI工厂存储,以及用于检索和多模态索引的企业AI数据系统。此外,CMX为工厂内共享的KV缓存和可复用推理状态提供pod级存储。BlueField-4在Scale-In中担任基础设施处理器,在CMX中担任数据和存储处理器。Scale-In将AI工厂和企业数据连接到AI计算,而CMX保留并共享上下文以实现更快、更高效的推理。
这五大基础设施支柱共同满足AI工厂的不同需求。只有当数据访问、存储、网络安全和运维能力与GPU、机架和数据中心的扩展同步提升时,扩容才能真正释放价值。
BlueField-4驱动Scale-In基础设施
BlueField-4 在 GPU 服务器、Agentic CPU 系统、AI 工厂存储系统及云服务上全面加速 Scale-In 服务。在 NVIDIA Vera Rubin NVL72 中,NVIDIA ConnectX-9 SuperNIC 通过 Scale-Out 网络承载租户工作负载流量,而 BlueField-4 则运行并加速连接、安全和服务器管理等相关基础设施服务。BlueField-4 为运维人员提供了一个独立于租户主机之外的基础设施处理域,运维人员可在此管理安全策略、服务状态和遥测数据,无需依赖宿主 CPU 或占用其计算资源。NVIDIA BlueField Astra 将可信控制从南北向访问延伸至东西向 Scale-Out 网络。Astra 为服务提供商提供了一个统一、与主机无关的控制点,横跨两个域实现配置、租户隔离和网络策略管理。BlueField-4 负责安装更新策略并监控遥测数据,ConnectX-9 则在数据路径中直接执行这些策略。这一闭环在 Scale-In 和 Scale-Out 之间实现了始终一致的控制,而无需将设备管理放在租户主机上。
BlueField-4 将可编程控制面处理与加速数据面处理相结合。软件负责基础设施决策,而内联引擎在本地执行,无需将工作交还给宿主 CPU。该设计使策略能够跨工厂协调,并以线速在本地强制执行。表 1 总结了主要组件如何支持这一处理模型。
| 组件 | 角色 | 优势 |
|---|---|---|
| 64 核 NVIDIA Grace CPU | 运行策略、配置、遥测及基础设施编排软件 | 算力是前代的 6 倍,支持多项基础设施服务并发运行 |
| 内联加速引擎 | 处理数据包、RDMA、存储协议、加密、防火墙规则及策略执行 | 处理速度高达 800 Gb/s,同时减轻 Grace CPU 和宿主 CPU 的处理负担 |
| LPDDR5X 内存子系统 | 为基础设施软件提供数据和服务状态 | 提供高内存带宽和低功耗运行,且不形成内存瓶颈 |
| PCIe Gen6 主机连接 | 将 BlueField-4 连接至主机服务器 | 在主机与 Scale-In 基础设施处理域之间提供高带宽通道 |
| 800 Gb/s 网络接口 | 将服务器连接至 Scale-In 网络 | 支持高吞吐量访问、安全、数据迁移和存储流量 |
与 BlueField-3 相比,BlueField-4 的内存带宽提升 4 倍、网络带宽提升 2 倍。这些额外容量可支持更多并发服务、更大的策略和遥测数据集,以及更高的流量处理和安全吞吐量。
NVIDIA DOCA 驱动 Scale-In 服务
NVIDIA DOCA 将 BlueField-4 的硬件加速器转化为可编程、可部署的 Scale-In 服务。生产就绪的容器化 DOCA 微服务可直接运行在 BlueField-4 上;DOCA 库和 SDK 则为开发者提供对加速网络、安全、存储和遥测能力的访问,用于构建自定义服务。DOCA Flow 对硬件包处理流水线进行编程,DOCA PCC 支持可编程拥塞行为,DOCA Telemetry 暴露设备和健康状况,DOCA Platform Framework(DPF)负责配置、部署和更新管理。BlueField-4 的多服务架构和原生服务功能链可将每条流量引导至所需的服务序列。这些能力为 Scale-In 提供了统一的软件模型,可在 BlueField-4 系统上运行服务,而无需管理各自独立的服务器管线。
NVIDIA Spectrum-X 以太网连接 Scale-In 网络
NVIDIA Spectrum-X 以太网为 Scale-In 访问路径(包括外部存储)提供了高性能网络架构。BlueField-4 在各节点处理基础设施服务,而 Spectrum-X 以太网则承载 AI factory 与其周边用户、应用、数据源、服务及外部存储之间的流量。Spectrum-X 以太网解决大规模场景下的负载均衡冲突和拥塞问题,提升资源利用率,帮助维持高有效带宽,并隔离并发流量,使访问和存储流获得更一致、可预测的性能。 BlueField-4 DPU、DOCA 微服务和 Spectrum-X 以太网网络与 NVIDIA Vera Rubin 协同设计,确保处理器性能、内存带宽、PCIe 连接、网络带宽、加速能力和软件彼此匹配。它们共同构建了一条 Scale-In 路径,能够处理传输、服务处理和管控任务,而无需消耗分配给 AI 工作负载的资源。Agent AI factory 的关键 Scale-In 用例
Agent AI factory 必须安全地共享加速基础设施、提供企业数据、系统上线,并持续监控性能。以下用例展示了 BlueField-4 加速能力和 DOCA 服务如何解决这些生产需求。
构建隔离的 AI factory 虚拟私有云
AI factory 虚拟私有云(VPC)在共享物理基础设施上实现租户和应用流量的隔离。DOCA 主机网络(HBN)在 BlueField-4 上加速南北向三层路由和多租户隔离。DOCA Flow 配置流量分类与访问控制规则,而 DOCA 加速的 Open vSwitch(OVS-DOCA)则在东西向接口上执行相应策略。BlueField Astra 将同一 VPC 策略扩展到东西向 Scale-Out 接口,使单一策略模型同时管理访问和 Scale-Out 流量。
在 Vera Rubin 中,这套协调模型提供 7.2 Tb/s 的聚合接口带宽,其中南北向 BlueField-4 路径为 800 Gb/s,每个计算托盘有四条 1.6 Tb/s 的东西向路径。这能在访问流量和 Scale-Out 流量上实现一致的策略覆盖,而无需将所有东西向流量都经过 800 Gb/s 接口。运营方集中配置隔离的 AI Factory VPC,而租户继续使用加速网络。这种架构具备云般的弹性、一致的隔离性、更低的宿主机 CPU 开销,以及更高效的共享 AI 基础设施利用率。
在硅片层面实施安全管控
BlueField-4 将策略执行点置于硬件层,独立于宿主机操作系统之外。租户软件无法禁用或绕过这些控制,而被卸载的安全处理既保留了宿主机 CPU 周期,也避免了额外的软件跳转。BlueField-4 以线速加速威胁检测并强制执行网络、文件和对象访问策略:DOCA Argus 提供运行时威胁检测,DOCA Vault 执行文件访问策略,DOCA Flow 执行线速网络策略。BlueField Astra 在各服务器的不同网络上统筹加密、隔离与策略,并在南北向和东西向流量间同步策略、遥测数据、密钥和执行状态——将特权安全控制保留在租户主机之外,为共享 AI 服务提供一致的保护,同时为 AI 工作负载保留宿主机资源。
加速存储访问
Scale-In 将 AI 计算与来自外部存储的训练数据、模型资产、企业知识和应用数据相连。如果存储协议处理、存储虚拟化或数据搬迁跟不上速度,即便 GPU 有闲置算力且 Scale-Up/Scale-Out 网络带宽充足,GPU 也会等待数据。
BlueField-4 在专用基础设施上加速基于 RDMA 和 TCP 的 NVMe-oF、文件及对象存储协议,以及存储虚拟化和数据搬运。Spectrum-X Ethernet 为存储路径提供 AI 优化的以太网架构,其拥塞管理和性能隔离能力可在并发的存储流量之间维持高有效带宽,存储吞吐量比商用现成以太网最高高出 1.45 倍。这降低了宿主机 CPU 开销,有助于持续为 AI 计算供料,并为训练、检索和推理提供更一致的企业数据访问。这条外部数据路径是对 CMX 的补充。
运行 AI 工厂控制面
在运行 AI 工作负载之前,AI 工厂节点必须完成供应、配置、安全加固和连接。BlueField-4 负责节点的接入、网络和存储资源的供应、服务器启动,以及通过网络加载宿主操作系统。由于控制面独立于宿主机运行,它可以在租户软件启动之前就建立策略并完成资源供应。DOCA Platform Framework 是一个 Kubernetes 原生的编排框架,将 BlueField DPU 作为 Kubernetes 节点进行供应、管理和扩展,管理整个AI 工厂中的 DPU 发现、供应、服务部署及更新。这缩短了部署周期,提高了配置一致性,节省了宿主 CPU 资源,使新的 AI 算力能更快上线。
观测与优化 AI 运营
大规模运营AI工厂需要持续监控网络流量、存储访问、服务健康、性能和资源利用率。DOCA Telemetry收集和导出这些信息到网络监控平台,而DOCA库使可观测性提供商能够将相同的基础设施信号集成到自身工具中。通过BlueField-4收集遥测数据,操作者可保持独立于租户主机软件的可见性。当基础设施遥测覆盖GPU和网络利用率时,操作者能识别与访问、流量、存储、策略执行或工作负载部署相关的限制。这种全集群范围的可见性有助于检测异常、定位瓶颈,并在影响AI工作负载之前解决事件。
Scale-In 将扩展的计算能力转化为AI工厂性能
Scale-In将南北向网络演变为一个协调的、加速的基础设施域,用于数据访问、安全和运维。NVIDIA BlueField-4提供网络加速、DOCA程序和运行服务,而Spectrum-X以太网在Scale-In访问和存储路径上提供高有效带宽和性能隔离。两者协同,将扩展的计算能力转化为安全且可运营的AI工厂平台。
后续步骤
- 探索NVIDIA BlueField平台,了解产品架构、规格和资源。
- 了解更多关于NVIDIA Spectrum-X以太网和NVIDIA DOCA软件框架的信息。
- 开始为BlueField编程:下载NVIDIA DOCA,参考DOCA入门指南,并构建DOCA示例。