← 文章 / AI技术
NVIDIA 开发者博客 4小时前 · 2026-09-04 17:49:49 · 4 阅读

NVIDIA PAIR 虚拟推理路由器扩展本地网络可用算力

AI Agent 正通过学习协作完成更多任务。一个主 Agent 可以将复杂任务拆解为更小的子任务,并分配给专门的子 Agent 执行。此外,用户也开始同时运行多个 Agent 会话,多 Agent 协同完成复杂任务的工作流也日益普遍。

这种广度优先的方法可以提升任务完成速度和响应质量,但当大量请求同时发往 GPU 时,也可能成为系统瓶颈。

NVIDIA Personal AI Router (PAIR) 利用本地硬件来缓解多 Agent 及子 Agent 的资源瓶颈。PAIR 将每个独立的推理请求路由到家庭网络中可用的计算设备上。它与 Ollama 和 LM Studio 等熟悉的本地推理服务兼容,使用户无需重新设计 Agent 本身即可扩展可用的算力,也无需对 Agent 框架进行任何改动。

NVIDIA PAIR 现已面向受支持的 Windows、macOS 和 Linux 系统提供测试版,支持图形界面和终端两种交互方式。它兼容搭载 NVIDIA GeForce RTX 20 系列 GPU 及更新显卡、NVIDIA RTX PRO 工作站 GPU(Turing 架构及更新)、NVIDIA DGX Spark 以及 Apple M4+ 芯片的系统。

Flow chart GIF showing how NVIDIA PAIR is distributing Ollama inference among a local network running Ollama and LM Studio, a desktop, and NVIDIA DGX Spark.
图 1. NVIDIA PAIR 分配 Ollama 推理负载

什么是 NVIDIA PAIR?

NVIDIA PAIR 是一款虚拟推理路由器,旨在最大化你家庭网络中的 AI 算力。它并非新的推理引擎;Ollama 或 LM Studio 仍会在选定的机器上运行模型。PAIR 负责发现参与节点,追踪各节点是否就绪,调度独立任务,并将每个响应返回给发起请求的应用程序。

AI 代理只需通过熟悉的本地接口发送请求即可。PAIR 通过代理接收请求,识别其所需的引擎和模型,然后选择一个符合条件的节点。该节点从头到尾执行请求,并通过 PAIR 将响应返回。代理全程仅维持单一连接,而 PAIR 在背后处理调度工作。主要特性包括:

  • 无需新 API: PAIR 代理兼容 Ollama 和 LM Studio 的接口,而非要求每个代理框架集成新的集群 API。
  • 弹性客户端: 兼容系统可在空闲时贡献算力,并在需要时(如关机或休眠)退出集群。
  • 本地控制: PAIR 设计为将提示词、数据和推理流量保留在用户现有的本地网络内。
图表展示了 NVIDIA PAIR 如何将推理请求无缝分发到本地网络的计算资源上。
图 2. NVIDIA PAIR 将推理请求无缝分发到本地网络的计算资源上

PAIR 如何解决多代理本地推理问题?

以一位使用主 NVIDIA RTX AI PC 运行本地代理的 AI 高级用户为例。该代理接收研究、编码或个人整理类任务,并将其拆分为多个子任务分配给若干子代理。每个工作代理负责探索问题的一个有界部分,而其他工作代理则验证证据或组装最终结果。

从用户视角来看,这只是一项任务。但在推理层,它可能展开为数十个独立的模型调用。如果所有调用都涌向同一个本地引擎,它们就会争抢有限的执行槽位,导致队列堆积,主 PC 即便空闲也忙于应对,而网络中其他位置的 RTX PRO 工作站、笔记本或 DGX Spark 却可能有闲置的兼容算力。

PAIR 让推理层能随智能体弹性扩展:部分子智能体请求在主 PC 上运行,其余则分发到已配对的节点。当工作量具备足够的独立性时,利用更多就绪系统可以缩短排队时间,提升端到端的完成速度。

这样,主 PC 可以专心应对图形-intensive 的游戏、内容创作或其他交互式任务,而将推理负载分发到其他节点。

这是工作负载级别的并发。PAIR 并不会让单次推理请求跨多个 GPU 运行;每个请求都被分配给一个符合资格的节点,并在其整个生命周期内驻留在该节点上。

利用家庭 AI 集群的弹性

家庭 AI 集群并非微型数据中心。专业集群通常由持续通电、配置稳定、随时在线的系统构建。而家用硬件则处于动态变化之中:游戏 PC 可能正在运行游戏,笔记本可能进入睡眠、合盖或断开网络,一台工作站可能有请求的模型,而另一台没有;推理引擎也可能被关闭,或者用户会将 GPU 回收给前台应用。

PAIR 正是针对这些动态条件而设计的。它可以通过 mDNS 发现本地系统,在私有网络上配对支持的设备,并实时维护哪些节点可以接收新任务的视图。客户端节点可以在就绪时加入可用资源池,在需要时退出,无需将整个家庭环境改造成 Dedicated 的常驻推理设施。

对于每个新请求,PAIR 会综合考虑多种因素:

  • 配对节点是否在线且就绪
  • 是否启用了支持的推理引擎
  • 请求的模型是否确切存在
  • 当前节点和引擎的工作负载,包括进行中的作业
  • 现有 GPU 利用率(是否有图形-intensive 的应用或工具在运行)

PAIR 并不要求所有系统完全相同或永久在线。它根据日常使用方式调度推理请求并管理集群。

演示:Hermes 五子智能体场景

本次演示展示了 PAIR 与 Hermes Desktop(用于生成子智能体负载)及 Ollama(用于在各节点上执行模型)的协同工作。任务要求 Hermes 分析一个合成的家庭收件箱,并生成一份可信的「周日重置」计划——明确哪些事项今晚、本周、稍后或根本不需要处理,且每项结论都需提供依据。

在五次子智能体运行的场景中,Hermes 创建了五个专家分别审阅独立的证据片段,协调冲突并返回一份综合计划。Hermes 负责任务分解、委派和综合;PAIR 负责推理路由;Ollama 则在 PAIR 选定的节点上执行每个请求。

视频 1. 观看 NVIDIA PAIR 如何将推理分发到由 Hermes 编排的五个子智能体上

在一台 NVIDIA RTX Spark 笔记本上使用 Qwen 3.6 35B A3B 模型运行相同的五子智能体任务,平均耗时 18 分钟。相比之下,由 RTX Spark 笔记本、DGX Spark 和 RTX 5090 组成的三设备 PAIR 集群平均仅耗时 8 分 48 秒。需要注意的是,这是针对特定配置的演示,并非通用基准测试,也不承诺线性扩展能力。

Bar chart showing Hermes subagents performance in a distributed PAIR cluster.
图 3. Hermes 子智能体在分布式 PAIR 集群中表现更佳

此为非官方、特定配置演示。结果取决于工作负载并行度、模型、引擎设置、硬件、网络及节点可用性。这并非普适性基准测试。

PAIR 中的“任务”视图是推理实际运行位置的事实依据。Hermes 代理计数与 PAIR 任务计数之所以不同,是因为一个代理可以生成多个模型请求。只有当 PAIR 遥测数据表明任务在多个符合要求的节点上运行时,才算作多节点执行。

NVIDIA PAIR 如何工作?

本节逐步详细说明 NVIDIA PAIR 的工作原理。

利用局域网发现寻找附近的系统

在每台兼容的 Windows、macOS 或 Linux 系统上安装 PAIR 后,它会通过局域网发现(mDNS)自动寻找附近的系统。需要时也可以直接通过 IP 地址添加节点。用户批准安全配对请求后,PAIR 即可将已信任的本地节点集纳入考虑范围。

在建立安全连接并完成配对之前,所有节点间通信均被阻断。连接建立后,通信将通过 MTLS 和生成的证书进行加密,确保节点间的通信在网络上保持私密。

准备推理引擎和模型

每个参与节点都运行受支持的本地推理引擎:Ollama 或 LM Studio。PAIR 可以帮助安装引擎并启动配对系统上的模型下载,从而减少为多台机器做准备工作所需的人力。只有当所需引擎已启用且目标模型在该节点上可用时,该节点才具备处理请求的资格。

不过,集群中各节点的模型不必完全相同。不同系统可以托管不同的模型,PAIR 可以根据模型位置进行路由。在更多节点上加载相同的模型标签,只是为调度器提供了更大的 eligible 节点池供该请求使用。

代理兼容的本地接口

兼容的应用程序会通过 PAIR 代理的本地端点发送 Ollama 兼容或 LM Studio 兼容的请求。Agent 工具包可以继续使用该接口,而无需独立发现和集成每台机器。能够配置 base URL 的应用程序也可以继续指向其各自的 Ollama 或 LM Studio 端点。

PAIR 通过接管 Ollama 和 LM Studio 用于其服务的默认端口来代理请求。如果 agent 工具包使用的是其他端口,则可以在 PAIR 引擎设置中配置代理端口。

PAIR 会检查请求的引擎与模型需求,然后将这些需求传递给路由器。这种分离是该设计的核心:代理负责决定请求哪些工作,而 PAIR 负责决定符合条件的工作应在何处运行。
Architecture diagram titled ‘Agent harnesses—no configuration changes required.’ The flowchart shows an agent connection starting from a harness (left) through a PAIR proxy and PAIR router setup into an inference engine server and then distributing to multiple nodes (Node 1, Node 2, and Node 3).
图 4. NVIDIA PAIR 代理现有的推理框架(如 Ollama 和 LM Studio),因此代理无需更改即可使用 PAIR

调度单个符合条件的节点

调度器会根据节点的可用性、支持的引擎状态、请求模型是否已就绪以及当前负载来过滤配对系统。它选择一个符合条件的节点,该节点上的 PAIR 路由器会将请求传递给本地推理引擎。来自其他子代理的独立调用可以同时分配给其他可用节点。

返回响应并实现路由可观测

被选中的引擎执行请求,PAIR 再通过相同的本地接口将响应流式传回原始应用。Jobs 和指标视图会显示每个路由请求由哪个节点处理,从而使调度位置可见。

哪些负载最能从 PAIR 中受益?

PAIR 对能同时暴露多个独立请求的负载最有用,包括多代理应用和并发的本地 AI 工具。

对于这些负载,PAIR 可以:

  • 将独立任务路由到本地网络上可用的多个系统
  • 减少排队延迟——否则多个请求会在单个本地引擎前依次等待
  • 提升适合并行负载在兼容配置下的完成速度
  • 释放主 PC 用于游戏、创作或其他交互式任务
  • 保持熟悉且以本地优先的应用工作流
  • PAIR 不支持:

    • 合并多张 GPU 或将 VRAM 池化整合为单个更大的加速器
    • 对单个模型进行分片,或将一次推理请求拆分到多台机器上

    对于高度串行化的任务、由单次长模型调用主导的负载,或仅有一台节点包含所需模型的场景,收益可能有限。建议使用实际系统中的端到端完成时间、队列延迟、输出质量及实际路由表现来衡量工作负载的效果。

    开始使用 NVIDIA PAIR

    PAIR 让家中已有的动态 NVIDIA 系统具备类似集群的体验,同时保持本地推理工作流熟悉便捷。按以下步骤操作即可上手:

    1. 下载 NVIDIA PAIR 公测版,支持 Windows、macOS 或 Linux 系统。
    2. 将 PAIR 安装到希望加入的 NVIDIA RTX PC、NVIDIA RTX PRO 工作站或 NVIDIA DGX Spark 系统。
    3. 发现并安全配对局域网内的各系统。
    4. 启用 Ollama 或 LM Studio,并在符合条件的节点上下载或放置所需的模型。
    5. 在一台已安装 PAIR 且通过 Ollama 或 LM Studio 调用模型的兼容代理程序上运行任务。

    NVIDIA PAIR 项目是开源的。开发者可以查看代码、报告问题,并为设备发现、配对、路由、引擎集成、模型、端点以及用户体验等方面的改进做出贡献。

    原始来源: NVIDIA 开发者博客

    评论 (0)