← 文章 / AI技术
微软研究院 5小时前 · 2026-09-24 01:12:17 · 2 阅读

物理 AI 机器人的推理卸载:突破本地计算瓶颈与续航限制

两张图片展示机器人执行同一任务:将一卷胶带从一只机械臂递给另一只。视频显示,当推理延迟较低时任务能成功完成,而在推理延迟较高的情况下(如机器人搭载的 GPU),递送任务则会失败。

要点速览

  • 挑战机器人 AI 的一个核心假设:我们的研究表明,完全依赖机载 GPU 运行物理 AI 推理会限制机器人性能、电池续航和可扩展性,而将推理卸载到边缘或云端 GPU 则能带来显著优势。
  • 展示推理卸载的可量化收益:在多个典型的移动操作工作负载上,推理卸载提高了任务成功率,支持运行更大的 AI 模型,并帮助机器人在动态多变的真实环境中做出更有效的响应。
  • 延长机器人工作时间:用轻量级机载硬件加远程推理替代高功耗的机载 AI 算力,可以大幅改善电池续航,让机器人在两次充电之间运行更久。
  • 在 Physical AI Toolchain 中推出新能力:开发者现在可以借助基于 Kubernetes 的分布式推理工具,对机器人 AI 工作负载进行容器化,并在机器人、边缘基础设施和云端之间进行部署与编排。

随时可用的物理 AI——让机器人在制造、家庭和仓储场景中辅助用户——在提升安全性、生产力和任务辅助方面潜力巨大。从许多方面来看,面向物理世界的 AI 都代表着 AI 的重要前沿。物理 AI 必须在开放、不可预测的环境中运行,与其他机器人和人类交互,并适应各种不同的机器人形态。要实现这一愿景,需要在三个方向上取得进展:机器人硬件、具身 AI 模型,以及用于训练和推理的系统基础设施。近年来机器人大硬件和 AI 模型进展迅速,而我们关注的是一个相对被忽视的方面:物理 AI 的推理基础设施。要让机器人有效、安全地在物理世界中运行,就需要完善的系统来处理大规模分布式推理算力。

目前,物理 AI 领域的主流做法是在机器人本机部署 GPU,例如直接将 GPU 硬件接入机器人。在这种架构下,机器人的推理计算被限制在本机 GPU 上,为其提供执行任务所需的数据片段和动作序列。尽管更高阶的规划任务可能借助云端完成,但具体的任务执行通常仍受限于机器人本身。我们挑战了这一假设。随着物理 AI 模型在规模和复杂度上的持续增长,本机计算能力的局限性日益凸显。GPU 功耗巨大,会缩短电池续航,推高成本并增加机身重量,往往还限制了运行最新一代 AI 模型的能力。

为了深入理解物理 AI 的系统性影响,我们开展了首次针对机器人工作负载的系统化研究。研究聚焦于“移动机器人操作”,例如“检查厨房垃圾并将其放入垃圾桶”这类典型任务。此类任务涉及规划前往厨房的路径、感知环境以识别垃圾、导航至垃圾位置、拾取垃圾,再导航回垃圾桶处进行清理。我们对三项核心能力——语义映射与规划、导航、以及操作——的代表性模型进行了评估,具体结果见图 2。

移动机器人操作涉及语义映射与规划、操作以及安全导航等组件。上方表格列出了我们在测量研究中用于这些组件的最先进模型。
图 2:移动操作中不同组件所使用的模型详情。

将物理 AI 的推理任务从机器人本体卸载(Offloading)至外部,显著提升了响应速度和准确率,同时改善了电池续航并降低了成本。我们评估了推理模型在本地、边缘及云端等多种计算配置下的表现。具体测试硬件详情可参见我们的技术报告

Diagram showing that offloading Physical AI inference from robots improves performance, battery efficiency, and cost.

任务性能优势:评估结果显示,将推理任务卸载出去可显著提升机器人在建图、规划、导航和操纵等负载下的性能。部分小显存 GPU 根本无法承载移动操作堆栈。即便在显存充足的 GPU 上,其建图和规划速度相比 A100 也要慢 383%,从而限制了机器人在动态环境中的能力。使用较低端 GPU 时,导航模块的障碍物及时检出率下降了 30%。虽然 VLA 模型在较小 GPU 上速度没有大幅下降,但这一延迟仍足以使准确率降低 50%。简而言之,机载 GPU 限制了机器人性能,而将推理卸载到本地或云端 GPU 能提升其运行效果,如下方视频和图表所示。随着物理 AI 模型在规模和复杂度上持续增长,卸载带来的收益可能会更加明显。

Figure 3a: The video shows the handover task with onboard GPUs.
Figure 3b: The video shows the handover task when the inference is offloaded.
Robots can support GPUs such as Jetson Nano and Orin AGX onboard. The graphs above show that the success rate of object handover and navigation are low with onboard GPUs, but increase substantially with beefier GPUs when offloaded such as Jetson Thor and A100.
Figure 4: Success rates of robot arms handing over objects to each other when inference is performed with different GPUs (some onboard, and some offloaded). Offloading improves success rates.

电池续航优势:除了性能之外,机载 GPU 还显著消耗了机器人的电池寿命。我们对比了用树莓派 5 板替代机载 GPU、并将所有数据发送至卸载 GPU 后的电池续航提升情况。即使对于体型较大的机器人,诸如 Jetson Thor 等大型机载 GPU 也会使电池续航缩短高达 160%(即数小时)。

当 GPU 推理被卸载到机器人之外后,Stretch-3 机器人的电池续航可提升超过 100%。
图 5:卸载 GPU 推理对机器人电池续航的影响;以上数据来自 Stretch-3 机器人。

上述结果表明,把 GPU 推理卸载到机器人之外,是在开放世界中运行大模型并保持长续航的关键。不过,推理卸载需要在性能、网络延迟与带宽、可用 GPU 资源之间做复杂的权衡。我们相信,我们的测量研究将为物理 AI 推理系统的设计提供参考。

自动卸载工具集

我们构建了一套工具集,可以轻松地将推理卸载到机器人之外,并在边缘 GPU 和云之间分配推理任务。Kubernetes 是提供统一抽象层的天然平台,可以把机器人 AI 分布在机器人自身算力、边缘 GPU 上,并在超出容量时溢出到云端。该工具集支持通过声明式配置自动完成机器人工作负载的容器化和卸载,使用 Kubernetes 按智能策略分发物理 AI 容器,并集成了机器人模拟器、LeRobot 和 ROS2,方便开发。下面的步骤演示了如何告诉工具集要卸载什么,以及它如何为 GPU 推理创建独立容器并完成卸载。

通过自动生成为 GPU 推理创建容器,并借助 Kubernetes 将其部署到带有 GPU 的机器上,使物理 AI 推理卸载过程变得轻而易举的工具集。
图 6:包含容器化与部署步骤的卸载工具集。

微软近期发布了 物理 AI 工具链(Physical AI Toolchain),以推动物理智能的大规模落地应用。该工具链是一个开源、可直接用于生产环境的框架,它整合了Microsoft Azure 云服务与 NVIDIA 的物理 AI 技术栈,旨在加速机器人与物理 AI 开发者在感知、移动、模仿学习和强化学习等流水线中自动扩展数据筛选、增强与评估流程。我们宣布,在物理 AI 工具链中新增了行业首个机器人物理 AI 推理卸载功能。本次发布包含了针对 SO-101 和 UR10e 机器人进行推理卸载的示例项目。下方的视频展示了如何将其推理卸载至 Jetson Thor GPU,并控制 Mobile Aloha 机器人 执行动作,演示了针对双臂机器人的 微软 Rho 模型 的推理卸载过程。

图 7a:通过卸载 Microsoft Rho 模型 的 GPU 推理,控制 Mobile Aloha 机器人与 BusyBox 互动,按下蓝色按钮。
图 7b:通过卸载 Microsoft Rho 模型 的 GPU 推理,控制 Mobile Aloha 机器人与 BusyBox 互动,将旋钮旋转至 4 号位置。

欢迎查看推理卸载功能、浏览源代码,并告诉我们您的反馈。我们已在多个实际场景中完成测试,期待听取您的部署体验。

原始来源: 微软研究院

评论 (0)