← 文章 / AI技术
NVIDIA 开发者博客 5小时前 · 2026-10-08 02:41:20 · 9 阅读

制造机器的机器:NVIDIA 机器人组装 GB300 托盘的探索与挑战

我们如何教会机器人组装 GB300 测试托盘,以及这一过程揭示的关于机器人学习、机械智能和传统工程学的启示

NVIDIA Grace Blackwell GB300 Superchip 是现代基础模型进行 AI 训练和推理的核心引擎。然而,组装 GB300 托盘 的工艺在全球各地的工厂中仍高度依赖熟练的人工操作。 NVIDIA 西雅图机器人实验室(SRL) 与 NVIDIA Isaac 工程团队就此提出了一个核心问题:我们能否建造出能够组装如此复杂系统的智能机器人?

答案是肯定的,但探索之路充满挑战。让机器人自主组装 GB300 托盘是 SRL 作为一所高产的研究机构 九年来解决过最棘手的问题之一。该问题也迫使我们重新审视端到端学习在何种场景下最具优势,以及何时采用模块化架构更为有效。

当前面临的问题:莫拉维克悖论重现

我们聚焦于组装 GB300 测试托盘,它在发货和部署前用于验证 GB300 计算模块的功能与性能。根据 NVIDIA 运营团队及 GB300 合约制造商富士康的建议,我们将重点锁定在两个关键任务上:(1) 汇流排装配和 (2) 多连接器插入。

在汇流排装配 中,需要抓取一根长而沉重的汇流排(即用于传输大电流的金属条),将其运送至托盘,插入并在 16 个位置拧紧螺丝。此外,还需插入并移除夹具和卡扣。在多连接器插入 中,需将托盘上的两个大型和两个小型线缆电气连接器抬起,并插入间隙极小的插槽中。

下方的图示展示了现实世界的实验设置。

带标签的照片,展示了一个机器人工作站,包括一台 UR10e 螺丝刀机器人和两台 Rizon 4s 抓取机械臂,它们围绕着一个 GB300 测试托盘。标注指明了相机、目标连接器、汇流排和夹具的位置。
图 1. 真实实验装置的前视图。机器人系统由两台 Flexiv Rizon 4S 机械臂和一台带有 OnRobot 螺丝刀的 UR10e 机械臂组成
GB300 测试托盘的俯视图,周围分布着一台 UR10e 螺丝刀机器人和两台 Rizon 4s 机械臂。标签标明了相机、线缆、连接器、汇流排和夹具。
图 2. 真实实验装置的俯视图

熟练的工厂工人执行这两项任务时既可靠又流畅,且无需消耗大量脑力。然而,正如莫拉维克悖论所示,这类任务所需的灵巧性往往极难实现自动化。

视频 1. 富士康工厂中熟练工人进行汇流排装配的场景
视频 2. 工人进行多连接器插入操作的场景

首要的关键挑战在于不确定性。部件的几何形状、外观和动态特性并非完全已知,且初始部件姿态可能存在较大差异。此外,电气连接器连接着沿全长变形的线缆,不仅存在显著的制造差异,还会因塑性变形和疲劳而发生机械特性变化。

在许多制造场景中,不确定性是通过固定自动化来消除的——环境被严格控制:夹具和转接器把零件约束到亚毫米级精度,机器人只需像重复运动的机器一样运作。而在 GB300 测试托盘组装中,由于设计迭代快、产量低,固定自动化行不通,只能依靠柔性自动化。机器人必须天生具备适应性和抗不确定性的能力。鉴于 AI 基础设施需求不断增长,这一范式已成为 NVIDIA 的战略重点。

第二个关键挑战是性能。在机器人研究中,50%-60% 的成功率往往就够用了,80%-90% 就可以把任务称为已解决;而节拍时间、运动平滑度和轻柔抓取通常只是次要指标。此外,研究中的统计严谨性常常不足——每个任务往往只跑 10 到 20 次试验,而要得到合理的置信区间,评估次数要多得多。

我们的性能标准是与 NVIDIA 运营团队和富士康直接协作制定的,确保已解决真正意味着解决。截至本文发布时,我们正在快速逼近这些指标。

视频 3:人工演示我们机器人方案应完成的汇流条组装和多连接器插接。这些步骤与富士康工人的操作(见视频 1 和 2)略有不同——机器人方案不需要大型防护支架,拧螺丝也可以在一个阶段内完成

技术策略:在对的时间用对的工具

机器人学研究非常看重技术新颖性。这种传统有利于发明创造,却让人缺乏动力去优化那些可能达到更高性能的基线方法。结果就是,读完一篇论文,你往往还是不明白:为什么之前的方法行不通。

在 GB300 测试托盘的装配环节,我们的策略是“选对工具,用对时机”。针对每个子问题,我们首先考虑并通常实现经典基线方案。当这些方案力有不逮时,我们转而探索模仿学习、基于模拟的强化学习(RL)及其 Sim-to-Real 迁移、真实世界 RL,以及视觉-语言-动作(VLA)模型。这种递进过程帮助我们识别了每种方法的优劣,也为引入创新和增加复杂度提供了合理依据。

下文将详细探讨汇流条装配与多连接器插入;我们希望这些任务能作为案例,为其他研发和工程团队解决各自现实世界的操作问题提供参考。

装配汇流条:重温经典

汇流条装配包含以下步骤:

  1. 抓取并插入限位夹具(即辅助装配的特定夹具)至托盘
  2. 抓取已连接夹钳的汇流条并将其插入托盘
  3. 驱动 16 颗螺丝,将汇流条固定于托盘
  4. 释放并移除连接在汇流条上的夹钳
  5. 移除限位夹具
汇流条装配的五格序列图。每格以红色高亮显示关键部件:步骤 1,插入限位夹具;步骤 2,抓取并定位带夹钳的汇流条;步骤 3,驱动螺丝固定汇流条;步骤 4,移除夹钳;步骤 5,移除限位夹具。
图 3. 汇流条装配的五个子步骤。每步骤的关键部件用红色框标出

初始条件符合制造场景设定。限位夹具和连接了夹钳的汇流条最初放置在机器人旁边的平面上,位置不受约束;螺丝则最初位于汇流条内部。

厂商要求我们的成功率达到 99.5%,且完成任务的时间不能超过熟练工人的两倍(即不超过 124 秒)。系统不允许与托盘发生任何非预期的碰撞,因为即使微小的损伤也可能导致整个系统被判定为废品。

我们最初的工作基于经典流水线架构(即"传统旧式工程",详见 相关研究),该架构包含独立的感知、规划与控制模块,我们原本计划在后续转向端到端学习。事实证明,经典流水线非常高效,无需转向新架构。模块化设计还使得系统更容易调试和调优,并便于在多个机械臂之间分配任务。

在感知环节,我们最初采用了 NVIDIA 的 FoundationPose,这是一个通用模型,能够根据物体网格、RGB 图像和深度图像估计物体的 6D 位姿。然而,当物体可见度不足时,位姿估计的偏差可能高达 90 或 180 度。因此,我们扩展了流水线,使其能够输入多个视角,为每个视角生成一个估计值,并选取置信度分数更高的那个作为最终结果,从而有效缓解了误差。(注:后来我们转向了更专业的 DOPER 模型,其细节将在后文介绍。)

在规划环节,我们使用快速路径点在自由空间中移动,以缩短循环时间;同时采用基于 操作原语、利萨如曲线 及其他简单路径的对齐方法,以纠正部件初始的对位偏差。

在控制环节,我们实现了高性能阻抗控制器,确保在插入过程中接触轻柔稳定,同时施加足够的力。与现代学习流水线往往采用尽可能简单的控制器不同,我们的方案利用了自动阻尼设计和惯性补偿。我们认为,高性能控制是机器人学习中一个强大但尚未被充分利用的工具。

为缩短循环时间,我们把工作分配给三台机械臂:一台 Flexiv Rizon 4S 负责移动相机做位姿估计;另一台 Flexiv Rizon 4S 负责插入限位工装和 busbar,之后取下 busbar 卡扣和工装;还有一台 Universal Robots UR10e 使用 OnRobot 螺丝刀完成 16 次拧螺丝操作。经厂商同意,我们对 busbar 卡扣做了轻微修改,让单臂就能将其解锁。

视频 4:我们的 busbar 组装方案。一台 Flexiv 机械臂移动相机做位姿估计,另一台插入限位工装和 busbar(带卡扣),UR 机械臂用 OnRobot 螺丝刀把 busbar 拧入托盘,随后第二台 Flexiv 机械臂取下 busbar 卡扣和限位工装

我们的 busbar 组装 方案成功率已超过 95%,目前仍在继续提升。剩余失败主要来自抓取误差和插入过程中的手内滑移。限位工装和 busbar 子任务达到了循环时间要求,但拧螺丝没有达标,导致整个循环耗时 160 秒,超出 124 秒的目标。按顺序执行、针对特定设备的螺丝刀操作是主要瓶颈,也留下了明确的优化空间。

插曲一:基础设施的惊人威力

在 busbar 组装 这类高难度问题上,设计良好的真实机器人基础设施让我们得以快速开发、部署和检查系统。

第一块关键基础设施是 机器人服务。做机器人的人都清楚,同时使用多个库往往会陷入 依赖地狱。我们把库封装成可独立部署的 web 服务,运行在边缘设备、本地机房或云端。这些服务以 Docker 容器打包,提供 FastAPI/HTTP 接口;研究人员用轻量级 Python 客户端就能把不同语言和框架的服务组合起来。我们用 cuRobo 服务做运动规划,用 FoundationPose 服务做位姿估计,用 FoundationStereo 服务做深度估计,等等。

视频 5. 我们的机器人服务功能示例

第二项关键基础设施是任务与智能体生命周期编排系统(TALOS)。TALOS 以 ros2_control 为底座,提供运动规划器、操作原语以及高性能控制器(阻抗、导纳和力控)。该库可以无缝地串联这些组件与学习策略,并运行频率高于 500 Hz 的实时控制循环。TALOS 支持 Franka FR3、Flexiv Rizon 4S、Universal Robots UR10e 和 SO-101。我们在所有实体机器人应用中均使用此库,包括运动引导、遥操作、双手协调和运动规划。

视频 6. TALOS 的应用案例

TALOS 还通过标准 Web 接口对外暴露。编码智能体因此可以调用机器人服务和实体机器人,在开发阶段和部署阶段动态组合感知、规划与控制功能。这一理念与 Anthropic 的模型硬件标准(MHS)保持一致,MHS 是一项模型无关的规范,旨在让 AI 智能体能够发现并安全操作物理设备;我们开源的DROID+ 项目即为这一思路的实践范例。

依托机器人基础设施以及我们在母线组装方面取得的进展,我们开启了第二项关键任务:多连接器插接。

多连接器插接:“苦涩教训的逆命题”

多连接器插接可以分解为以下步骤。对于每个电连接器(2 大 2 小):

  • 抓起所连接的线缆,将电连接器从电路板上方提起
  • 握住线缆末端的连接器
  • 将连接器插入电路板上的对应插座
(左)多连接器插入的初始状态。GB300 托盘顶部已连接四根线缆,带线缆的连接器被任意放置在电路板下半区域。机器人必须选取这些连接器,调整方向,并将其插入对应的插孔中(红框所示)。(中)这些连接器包括两个小型 MCIO 连接器(绿色)和两个大型 DC-SCI 连接器(红色)。(右)最终状态,四个连接器已全部插入插孔。
图 4:多连接器插入的初始状态、连接器类型及最终状态。左图中目标插孔用红圈标出;MCIO 连接器高亮显示为绿色,DC-SCI 连接器为红色

初始条件同样符合制造场景的要求。四根线缆的一端已连接至 GB300 板,线缆未严重缠绕,且带线缆的连接器可任意放置在板上。

制造商再次要求成功率达到 99.5% 以上,且完成多连接器插入任务的时间不得超过熟练工人耗时(即四根线缆均在 72 秒内完成)的两倍。与之前一样,禁止与托盘发生任何非预期的碰撞。

虽然描述该任务很简单,但执行多连接器插入极具挑战性,原因有三:(1)线缆不规则、可塑性变形且易磨损;(2)连接器体积小且纹理较少;(3)连接器与插孔之间的间隙极小,几乎不容许任何误差。

我们首先再次实现了一套经典的 pipeline。为了抓取线缆,我们使用 Segment Anything Model(SAM3)在俯拍 RGB 图像的预定区域内对线缆做分割,然后为每个 mask 拟合出中心线,指挥机器人在指定高度抓取线缆中点,再向上提起以露出连接器。

Side-by-side views from a wrist-mounted camera: a robotic gripper above cables in a GB300 tray on the left, and the same view with four color-coded cable segmentations, centerlines, and grasp markers on the right.
图 5. [左] 腕部 RealSense D405 相机采集的示例图像。[右] SAM3 分割结果及提取的线缆中心线

这套简单的方法在实际运行中几乎没有出现失败。

视频 7. 线缆抓取方法的反复部署

抓取露出的连接器则难得多。用通用模型做姿态估计效果很差——连接器体积小、表面无纹理,且与线缆的连接区域变化多样,导致误差很大,运动和抓取规划因此不可靠。于是我们转向端到端地学习感知、运动和抓取。

这条路同样走不通。基于 action-chunking transformer(ACT)或 diffusion policy 的行为克隆成功率都很低,这类方法依赖大规模高质量数据,而我们很难获取。不同样本的线缆在形状和刚度上差异很大,而这种专用线缆的数量又非常有限,每根线缆在永久变形前只能被抓取和操作有限次数,超过后就不符合实际部署条件了。

我们将此情况视为“逆向苦涩教训”:在某些真实场景中,物理、财务及物流因素可能使规模扩展变得难以处理。那些利用领域知识且对交互数据要求较低的经典方法,再次成为值得探索的方向。

我们重新聚焦于位姿估计,但设定了不同的要求:针对目标部件进行专门化,避免依赖精确或有辨识度的视觉纹理,并能通过真实世界数据快速迭代。在与 NVIDIA Research 的同事合作下,我们开发了一种名为“深度物体位姿估计重访”(DOPER)的感知框架。DOPER 的灵感来源于《NVIDIA 深度物体位姿估计》(DOPE),这是最早探索利用大规模合成数据以实现真实世界感知的论文之一。NVIDIA 深度物体位姿估计 (DOPE)是首批研究使用大规模合成数据来增强真实世界感知能力的论文之一。

两个机械夹爪位于服务器托盘中的电缆连接器上方。插图通过黄色框突出显示了一个连接器,并标有青色追踪点和彩色三维坐标轴。
图 6. 电缆被抓取并抬起后的裸露连接器。[插图] 来自腕部 RealSense D405 摄像头的视角。标注了由 DOPER 生成的连接器边界框、关键点和 6D 位姿

在模拟环境中,DOPER 模型首先通过摄入特定部件的 CAD 模型进行训练,从不同视角渲染 RGB 图像,并通过在部件凸包上使用最远点采样(farthest-point sampling)来自动生成关键点标签,同时根据点的可见性和显著性进行过滤。随后,训练一个快速且轻量的卷积网络,用于从 RGB 图像中预测边界框、分割掩码和关键点标签。

在真实世界中,首先捕获该部件的 3D 神经重建。预训练的 DOPER 模型在不同视角的神经重建上运行,背景随机化,从而生成伪标签;对于低置信度的预测,通过将高置信度的预测投影到目标视角来进行修正。

随后,使用这些标签对 DOPER 模型进行微调。最后在推理阶段,在目标场景中运行 DOPER 模型,并从预测的关键点中提取姿态估计。该过程可执行于 30 Hz 或更高的相机帧率。

服务器托盘并排视频对比:左侧为线缆和铜制部件,右侧为位于黄色轮廓连接器上方的机器人夹爪。
服务器托盘并排视频对比:左侧为线缆和铜制部件,右侧为位于黄色轮廓连接器上方的机器人夹爪。

图 7。[左] 由 DC-SCI 连接器的神经重建渲染的动画,用于微调 DOPER 模型。[右] 推理阶段的 DOPER 模型

DOPER 重新激发了我们对姿态估计潜力的信心。该框架让我们能够训练专门针对特定连接器的高精度姿态估计器,并实时部署这些模型。利用所得的估计结果,一个机械臂可以将每个连接器平移和旋转至特定姿态,使第二个机械臂能够可靠地抓取它。

视频 8. 我们连接器抓取方法的重复部署

插曲 2:机械设计作为不确定性削减手段

如前所述,由于设计周期快且产量低,GB300 测试托盘的装配需要灵活的自动化,要求机器人在面对部件和姿态的不确定性时具备适应性和鲁棒性。同时,灵活系统也能从固定自动化领域的创新中受益,例如通过机械设计来降低不确定性。

遗憾的是,专注于固定自动化的机电一体化研究者和专注于柔性自动化的计算机科学家长期各自为战。我们主张采用全栈式的方法,从整体上统筹硬件、软件和 AI 研究。

在抓取连接器的过程中,夹爪闭合时的接触可能会把连接器碰歪或碰得不稳。虽然触觉感知、重新抓取、手内操作等都是可行的解决方案,但对我们来说,最简单且周期时间最优的方案其实是改进机械设计。

我们设计了两套多用途夹爪手指,让机器人能够抓取汇流排、限位工装、线缆以及大小连接器。

左侧为两组循环演示:多用途夹爪手指抓取小型 MCIO 和大型 DC-SCI 连接器;右侧为同一连接器的 CAD 透视图和剖视图。
图 8。[左] 第一组多用途夹爪手指的演示视频。这些手指设计用于接受抓取前姿态偏差,并将零件引导至可重复的抓取后姿态。第一段视频展示夹爪手指抓取小型 MCIO 连接器;第二段视频展示同一组夹爪手指抓取大型 DC-SCI 连接器。[右] 多用途夹爪手指配合 DC-SCI 和 MCIO 连接器的 3D CAD 渲染图,显示透视图和剖视图。手指几何结构在接触过程中限制连接器运动,以实现可重复的抓取后姿态。
在 GB300 装配装置上,多用途夹爪手指抓取不同零件的四张照片,从左到右依次为:限位夹具、母排手柄、母排夹释放机构以及电缆。
图 9。第二组多用途夹爪手指。这些手指设计用于抓取(从左到右):限位夹具、母排手柄、母排夹释放机构以及电缆。

手指的几何结构在接触时限制了零件运动,使抓取姿态具有极高的可重复性。这些手指几乎可以在任何业余级 3D 打印机上复现。

最后阶段:一项接触性“运动”

握住每个连接器后,多连接器插接的最后一步是将连接器插入 GB300 主板对应的插座。与插接汇流排相比,插接连接器的难度更大,因为导电引脚纤细、间隙紧凑,且接触时的导向面极少。

在这种条件下,传统方法往往力不从心。插座几何形状的变异、机器人控制的累积误差,或不恰当的插接力曲线,都可能导致连接器卡在插座内、未对准插座,甚至与周围组件发生碰撞。顺应性控制器虽有帮助,但对较大的空间误差缺乏鲁棒性,且每项任务都需要精心调参。

因此,我们转向基于学习的解决方案。依托我们在 Sim-to-Real 领域的系列研究(1,2,3,4,5),我们利用无模型 RL 在 NVIDIA Isaac Lab 中训练策略,使其能从广泛的初始位姿插入电气连接器,并将这些策略部署到真实世界中。

视频 9-12。在 Isaac Lab 中并行化 RL 训练连接器插接策略。(左)DC-SCI 和 MCIO 连接器的部分训练策略。(右)完全训练后的策略

Sim-to-Real 迁移在真实世界中对大型连接器实现了高成功率,但对小型连接器的效果较差。策略消耗位姿估计值,即便微小的估计误差也可能导致连接器在插座边缘打滑。即使是大型连接器,其可靠性仍未达到工业标准。因此,我们得出最终的技术结论:真实世界数据无可替代。

更准确地说,大多数真实部署旨在实现最优性能,如最大可靠性、最高速度或最低干预率。由于仿真与现实之间必然存在不匹配,在仿真中训练的策略往往并非最优。因此,真实部署若能直接从真实数据中学习,理想情况下尽可能通过在线交互进行,将获益匪浅。

在插接环节,我们在之前的工作 SPARR 的基础上改进了插入策略。SPARR 的做法是:先在仿真中通过 RL 训练一个基于状态的 base 策略,再在真实环境中通过 RL 训练一个基于图像的 residual 策略。base 策略的执行结果可以引导真实环境中的学习,让训练更高效、探索更安全。由于插接过程中连接器被视觉遮挡,我们改用力/力矩输入而非图像来训练 residual 策略。

视频 13. 连接器插接方案的反复部署。仿真训练的 base 策略与真实环境训练的 residual 策略的动作叠加组合

最终的 multi-connector insertion 方案把线缆抓取、连接器抓取和连接器插接三条技术路线整合在一起,实现了四根连接器从头到尾的完整装配。系统成功率达到 90-95%,剩余失败主要源于抓取连接器时的多臂协调问题。平均每个线缆周期耗时 40 秒,主要瓶颈在于抓取前对裸露连接器位姿的缓慢、离散调整。虽然性能距离部署要求还有差距,但我们正在持续改进以缩小这一差距。

视频 14. multi-connector insertion 方案。第一台 Flexiv 机械臂提起目标线缆,露出其连接器并调整到第二台 Flexiv 机械臂可达的位姿;第二台机械臂抓住连接器,运行学习到的策略将其插入插座。剩余每根线缆都重复这一流程

为什么这件事重要:走向良性循环

自动化 GB300 系统及其后继产品的生产与测试,对 NVIDIA 及整个 AI 生态系统至关重要,因为这些系统是基础模型的计算引擎。放眼长远,以智能自动化弥补熟练劳动力的不足,对本国制造业至关重要:预计到 2033 年,将有 190 万个制造业岗位无法填补。从长期来看,通过机器人组装 AI 硬件可以实现更为宏大的愿景:在未来,在人类的监督下,由 AI 驱动的机器人组装 AI 硬件,随后这些硬件再用于训练下一代 AI 驱动的机器人,从而形成一个安全且良性循环的闭环。

Blackwell 的寓言:故事中的寓意

攻克 GB300 测试托盘的组装难题,是我们经历过的最具启发性的研究实践之一,它有力地印证了任务驱动研究的价值。

在研究工作中,在抽象层面上发明技术方法是一种常见且有益的做法,因为当应用场景逐渐清晰后,这些方法往往能带来长期的回报。我们在 GB300 组装方面的经验则倡导了一种互补的方法:识别一个近乎不可能且具有重大现实价值的问题,揭示现有方法的能力与局限,并在没有明确路径的地方进行创新。

我们的工作还让我们总结了七条关键的技术经验:

  1. 姿态估计(Pose estimation)可以非常有效。在项目初期,我们既不相信这一结论,甚至不愿它是真的。然而,我们的 DOPER 框架为工业零部件生成了快速且准确的姿态估计模型。关键在于重新审视姿态估计的修改后需求:训练专用模型,避免依赖精确或独特的视觉纹理,并支持在真实世界数据上进行快速微调。
  2. 机械设计能够高效地降低不确定性。这一点在自动化领域已是不证自明,但在机器人学习方向可能不太显著。我们 3D 打印的夹爪手指设计,让我们无需引入触觉传感器、重抓取机构或手内操作等复杂度,就能可靠地抓取夹具、线缆和固定装置。机器人学是一个全栈问题,人工智慧与机械智慧的结合能带来最佳效果。
  3. 不应忽视高性能控制。研究人员数十年来致力于开发高性能机器人控制器,但大多数机器人学习论文只实现了最简单的控制律。具备自动阻尼设计和惯性补偿的高性能控制器能确保平稳的自由空间运动,促进轻柔且稳定的接触交互,并提升基于 RL 学习到的行为之成功率与循环时间。
  4. 规模瓶颈区域值得进一步审视。「苦涩的教训」(Bitter Lesson)有令人瞩目的实证支持;但正如我们所说的「逆向苦涩教训」,当交互数据稀缺、部件难以仿真、替换成本高昂或反复使用导致物体劣化时,扩大规模可能变得棘手。经典方法依然强大,而基于学习的研究或可受益于对结构与样本效率的进一步强调。
  5. 循环时间应与成功率同等重要。典型的机器人学习系统可能结合 1 kHz 本体感知、100 Hz 策略、30 Hz 相机流和 5 Hz 夹爪控制,且实时保证各不相同。某些子任务可能难以甚至无法并行化。提高速度必须保持控制精度、确保人和机器人的安全,并避免部件损坏。研究者应同等重视循环时间和成功率。
  6. 研究基础设施加速开发与部署。在我们工作中,机器人服务和 TALOS 对于避免依赖冲突、让不同规划器和控制器可互换、以及跨机器人迁移代码至关重要。创业公司和大型企业的可能会深度投入基础设施,而研究实验室通常不会;社区若能开发定制的研究基础设施,或将加速该领域的进步。
  7. 合成数据与真实数据都不可或缺。DOPER 利用大规模、针对特定零部件的合成数据启动训练,我们的连接器插拔方案则借助基于仿真的 RL 进行预训练。但事实证明,真实数据依然必不可少。工业机器人的严格要求容不得性能打折,必须将合成数据与真实数据结合起来,才能真正创造现实价值。

弥合实验室与工厂之间的差距

在机器人领域,衡量研究成功的真正标准是能否落地到真实世界。我们的下一个目标,是把技术部署到 NVIDIA 合同代工厂生产 AI 硬件的产线上;我们的目标是达到甚至超越其性能要求,从而加速全球最先进算力硬件的生产。

不过,真实部署面临不少挑战。首当其冲的是:即使机器人方案在实验室测试中表现出色,部署前又该如何保证其性能?工厂的环境和工位条件各不相同,而应对域偏移(domain mismatch)几乎是基于学习的机器人的通病。真实产线还会遇到产品设计的变更,这是实验室里无法观察到的另一重变量。

此外,即使系统足够鲁棒或具备足够的自适应能力,其性能也必须经过验证。要在单侧 95% 置信区间下支撑至少 99.5% 的成功率,需要经过 至少 598 次测试且零失败。就我们的场景而言,由于零部件存在磨损,这类评估可能需要数百个相同的 GB300 组件。虽然 物理仿真和交互式世界模型近来进展不小,但如何精确模拟几何和力学上不规则的零部件,仍是一个未解的难题。

我们建议借鉴自动驾驶(AV)行业的经验。在自动驾驶领域,离线训练与在线部署的界限是模糊的:起初,人类会对车辆行为进行密切监督和纠正,但随着时间推移,车辆的自主性越来越高。同理,机器人学习系统也不应追求完美,而应在具备较强能力的同时接受不完美的状态进行部署。人类或受人类监督的智能体应无缝记录干预操作,系统则需利用这些数据实现持续改进。随着时间推移,在真实部署环境中积累足够的数据,将能为性能提供强有力的统计学保证。

现实世界部署的第二个关键挑战是:在将机器人方案部署以解决特定任务后,如何解决下一个任务时投入更少的精力?这一目标可概括为两个词:泛化性和适应性。

强大的泛化性意味着机器人在一组任务上训练后,能够出色地解决新任务。如果机器人知道如何将插销插入孔中、组装齿轮组并拧紧螺丝,它就应具备高层次的常识和低层次的灵巧性,从而能顺利插入 USB-C 线缆。强大的适应性则意味着机器人虽然不知道如何解决新任务,但能高效地学习它。例如,一个能以 0.5 mm 间隙组装齿轮的机器人,应能迅速学会组装间隙为 0.1 mm 的齿轮。

与研究界的共识一致,我们认为通往泛化性和适应性的长期路径,在于那些能从互联网规模数据中学习模型,包括视觉-语言-动作模型(VLAs)、世界-动作模型(WAMs)以及机器人原生基础模型。这些模型已展现出显著的物理常识、快速适应能力和上下文学习能力。

机器人领域存在一个公开的秘密:我们距离掌握并高效学习物理世界近乎无限的多样性,仍有很长的路要走。做个思想实验,一家自动驾驶公司每天可能采集 100 TB 到 1 PB 的有效数据,但自动驾驶只是通用机器人应当掌握的一项任务。此外,在约束相对合理的环境中,模块化系统通常比端到端模型具有更好的泛化能力和更快的速度(例如 1,2)。

我们认为,机器人基础模型实现泛化和适应性有三条互补的路径。第一条是数据飞轮:在部署环境中构建持续改进的机器人系统,在部署过程中采集数据,并利用这些数据对基础模型进行中间训练或后训练。其关键限制在于覆盖率:每次部署都代表一个狭窄的交互分布,基础模型可能难以进行插值。

第二条路径是世界模型。将其定义为“动作条件的多模态预测模型”,这类模型几乎可以基于任何物理数据源进行训练。研究人员最终可能会将它们用作所有物理交互的模拟器,从而实现机器人基础模型的多样化后训练。然而,未来的世界模型必须随时间演化;如前所述,物体动力学可能具有高度的非平稳性。

第三条路径是由 Agent 驱动的机器人技术。正如近期突破所暗示的(例如 1,2,3),Agent 不仅展现出越来越多的人类常识,包括空间推理,还能在模拟器、世界模型以及现实世界中提出有效的动作。Agent 引导的动作可以生成后训练数据,而 Agent 引导的干预最终可能取代人类在新型任务上的修正。

视频 15:在习得的世界模型中对 GPT-6 Astra 的近期实验。Astra 展现出出色的空间理解能力,能够在世界模型中控制机器人,帮助机器人学家收集大量宝贵数据

最后,我们发出行动号召:欢迎加入我们的旅程。AI 硬件的机器人装配不仅是当今时代最具影响力的问题之一,更是基础与应用机器人研究的绝佳北极星。我们期待看到社区在这一方向上取得快速进展。

深入了解

我们正在准备一份白皮书,详细介绍我们的方法和最新实验结果。同时我们也在推进 DOPER 和 TALOS 的社区发布,并附带与 NVIDIA Isaac 工程团队协作构建的连接器插装参考工作流。

每项成果发布后,我们都会在本篇文章中更新相关链接。

欢迎查看我们的 NVIDIA Robotics Research and Development Digest (R2D2),快速了解 NVIDIA Research 在物理 AI 与机器人应用领域的最新突破。

订阅 newsletter,并在 YouTube、Discord 和 developer forums 上关注 NVIDIA Robotics,即可随时获取最新动态。想开启你的机器人之旅,可以报名免费的 NVIDIA Robotics Fundamentals courses。

原始来源: NVIDIA 开发者博客

评论 (0)