← 文章 / AI技术
DeepMind 博客 2026/8/11 · 2026-08-11 09:21:53 · 40 阅读

Gemini Robotics ER 2:视频理解、任务编排与多机器人协作赋能机器人

要让机器人在日常环境中协助人类,仅具备精准的空间推理能力还不够。机器人还必须快速思考,让决策和推理跟上物理世界的实时节奏。

因此,我们今天推出了 Gemini Robotics ER 2——目前能力最强的机器人“具身推理”模型。你可以把 Gemini Robotics ER 2 理解为机器人的高级大脑:它能与人类对话、理解物理世界,并规划多步骤任务;随后,再将运动执行交给任意底层视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还支持原生调用 Google Search 等工具,也可以调用用户自定义的函数。它的设计允许机器人在执行动作的同时,思考下一步该做什么。

相比 Gemini Robotics ER 1.6,Gemini Robotics ER 2 实现了大幅升级。通过持续观看视频流,机器人现在可以跟踪任务进度,在出现问题时及时调整,并准确判断何时进入下一步。我们还引入了多机器人协作能力,让多个机器人能够在共享空间中协同工作,完成单个机器人无法独立完成的复杂流程。

开发者现在可以通过 Gemini API 和 Google AI Studio 公开使用 Gemini Robotics ER 2,也可以在 Gemini Enterprise Agent Platform 中申请私有预览。为帮助大家快速上手,我们还提供了相关示例,介绍如何配置模型,并通过提示词让它支持更实用的实体 AI 任务。

推进实体智能体能力

现实世界中的大多数任务都很复杂,往往需要多个步骤才能完成。Gemini Robotics ER 2 是一种物理智能体,能够为机器人编排任务步骤,并支持机器人自主纠错、适应更多新颖场景。要搭建智能体系统,开发者可以将底层控制接口(例如 Vision-Language-Action(VLA)模型或导航 API)声明为工具,并将多模态视频、音频或文本直接输入模型。

Gemini Robotics ER 2 改进了这一工具编排流程。我们可以通过仿真环境中的机器人、真实世界的机器人控制,甚至由人类远程操控机器人等方式,评估它的表现。

在三种控制模式——真实 VLA、仿真 VLA 和人工远程操控——下,Gemini Robotics ER 2 在工具编排方面始终优于 ER 1.6。

Chart comparing physical agent performance of Gemini Robotics ER 1.6 and Gemini Robotics ER 2

在机器人领域,高层推理能力取决于执行速度。Gemini Robotics ER 2 集成了 Gemini Live API,通过针对低延迟任务优化的双向流式端点,实现流畅的任务编排:它可以调用动作模型和机器人 API 完成多步骤任务,避免令人不适的“停下来思考”式卡顿。

为了展示这一能力,我们与合作伙伴 Boston Dynamics 携手,使用其 Spot 机器人制作了一个演示。Gemini Robotics ER 2 能够编排 Spot API,调用导航、机械臂移动等功能,打造出一台可以根据你的需求取回物品的交互式机器人。

在自然语言指令下,由 Gemini Robotics ER 2 驱动的 Boston Dynamics Spot 取回了一份爆米花零食。

代码及其他示例已发布在 Github。

解锁时间智能,可靠完成任务

机器人领域最难解决的问题之一,是准确判断任务何时完成。Gemini Robotics ER 2 大幅提升了视频理解和进度跟踪能力,能够确认复杂任务——例如拧紧灯泡或扎好垃圾袋——是否已按要求完成,然后再切换到下一项任务。

在此次更新中,我们重点增强了任务进度理解的两项基础能力:进度分类和关键时刻定位。

连续进度分类

进度分类是指机器人跟踪任务完成进度的能力。在评测中,我们将视频流的每一帧划分到五个进度区间之一:0–20%、20–40%、40–60%、60–80% 和 80–100%。通过量化任务进度,Gemini Robotics ER 2 能为机器人提供实时态势感知,让其动态调整操作,或在某一步失败后重试,而无需从头开始整个工作流程。

在进度分类任务中,Gemini Robotics ER 2 的准确率达到 57.4%,超过上一代模型和其他前沿模型。

Chart comparing progress classification of different robots

精准定位关键时刻

关键时刻定位用于衡量模型能否找出关键事件发生的准确视频帧,例如判断何时停止向杯中倒咖啡。Gemini Robotics ER 2 在关键时刻定位方面实现了显著提升,使机器人能够精准切换任务、确认任务是否成功,并提出纠正措施。

在关键时刻定位任务中,Gemini Robotics ER 2 的准确率达到 91.3%,平均绝对偏差仅为 0.96 秒。它的表现接近参数规模大得多的模型,同时计算成本仅为后者的一小部分,执行速度却达到 4 倍——亚秒级延迟正是机器人在现实世界中安全运行所需要的。

Graph of Moment finding: Accuracy vs distance

多机器人协作

没有一种机器人能够胜任所有任务:轮式机器人适合室内环境,人形机器人则可能更擅长应对崎岖地形。Gemini Robotics 2 支持多机器人协作,让不同类型的机器人基于共享的语义理解进行通信,协同交接并完成复杂任务。点击这里,了解 Gemini Robotics ER 2 如何让 Apptronik 的 Apollo 2 与 Franka F3 Duo 协作。

提升通用空间智能

Gemini Robotics ER 2 进一步增强了核心空间推理能力,具体表现在以下三项基准测试中:

  • 成功/失败检测:现在可直接处理原始视频流,而不再局限于静态图像,因此能够识别执行过程中的洒漏、滑落、错位等失败情况。
  • 通用仪器读数:支持读取的不再只是圆形表盘和视镜,还包括数字显示屏、线性刻度、尺子和液体温度计。我们在 10 种不同类型的仪器上进行了测试。
  • 增强空间 VQA:借助 Gemini 在多模态理解方面的进展,进一步提升视觉问答能力。

在所有核心能力上,Gemini Robotics ER 2 都持续取得最高准确率,尤其在成功检测(图像/视频)、问答(ERQA)和通用仪器读数方面表现突出。

Comparison fo ER metrics of different robots

推动具身智能安全性发展

Gemini Robotics ER 2 是我们迄今最安全的模型。在 Safety Instruction Following 和 Human Proximity 基准测试中,它的表现均有显著提升:前者评估模型在推理任务中遵守物理约束的能力,后者则考察模型识别人员并保持空间安全距离的能力。我们发现,当有人靠近时,Gemini Robotics ER 2 能够成功让人形机器人停止工作,并在确认周围环境安全后自主恢复任务。为进一步提升物理智能体的安全性,我们推出了一项新的基准测试,用于评估基础模型充当安全 VLA 编排器的能力,包括执行安全约束、监控环境、判断物理可行性,以及在需要时向人类寻求澄清。详情请参阅我们的安全技术报告。

在 Safety Instruction Following 和 Human Proximity 基准测试中,Gemini Robotics ER 2 的表现优于 ER 1.6 及其他前沿模型。

Comparison of safety performance of different robots

展望未来,我们计划推动这些模型处理更加复杂的任务,加速实用型机器人的发展,并为整个机器人领域提供支持。

原始来源: DeepMind 博客

评论 (0)