Gemini Robotics ER 2:视频理解、任务编排与多机器人协作赋能机器人
Gemini Robotics ER 2 正式发布
2026 年 7 月 30 日
Gemini Robotics ER 2 在为机器人赋能方面实现了跨越式突破,借助视频理解、任务编排与多机器人协同,让机器人能够在真实世界中提供更有价值的帮助。
Steven Hansen
高级资深软件工程师
Peng Xu
资深软件工程师
分享
阅读 AI 生成的摘要
我们正式发布 Gemini Robotics ER 2,这是一款专为机器人打造的"高层大脑"模型。它支持实时空间推理、多步骤任务规划,以及不同机器人之间的协同作业。现在你可以通过 Gemini API、Google AI Studio 或 Gemini Enterprise Agent Platform 调用该模型,开始构建你自己的物理 AI 智能体。
摘要由 Google AI 生成。生成式 AI 仍处于实验阶段。Google 刚刚发布了 Gemini Robotics ER 2,它就像是机器人的"智慧中枢",能让机器人快速思考、规划多步任务,甚至与其他机器人协同配合。该模型让机器人能够通过分析视频流来追踪自身进度,并实时纠错。它的目标是让机器人在真实世界中更安全、更实用。
摘要由 Google AI 生成。生成式 AI 仍处于实验阶段。探索其他风格:
- 通用摘要
- 通俗讲解
要让机器人真正在日常环境中协助人类,光靠精确的空间推理还不够。机器人还必须快速思考,让决策和推理跟上物理世界的实时节奏。
因此,我们今天正式发布 Gemini Robotics ER 2,这是我们迄今为止最强大的机器人"具身推理"模型。可以把 Gemini Robotics ER 2 看作机器人的"高层大脑":它能让机器人与人对话、理解物理世界,并规划多步任务,随后将动作执行交给任意底层的视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还能原生调用 Google Search 等工具来获取信息,或调用任何用户自定义的函数。它的设计让机器人在执行动作的同时,能够"思考"下一步该做什么。
相比 Gemini Robotics ER 1.6,Gemini Robotics ER 2 是一次重大升级。通过持续观察视频流,机器人现在可以跟踪自身进度、在出现意外时灵活调整,并准确判断何时进入下一步。此外,我们还引入了多机器人协作功能,让机器人能够在共享空间中协同工作,完成单个机器人无法胜任的复杂任务流。
Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 向开发者开放,并在 Gemini Enterprise Agent Platform 上提供私有预览。为了帮助你快速上手,我们还分享了 示例,展示如何配置模型并通过提示词驱动更多实用的物理 AI 任务。
提升物理智能体的自主能力
现实世界中的大多数任务都很复杂,往往需要多步操作才能完成。Gemini Robotics ER 2 是一款物理智能体,能够为机器人编排执行步骤,使其具备自我纠错能力,并泛化到更多未知场景。在搭建智能体系统时,开发者可以将底层控制接口(例如视觉-语言-动作(VLA)模型或导航 API)声明为工具,直接向模型流式传输多模态的视频、音频或文本数据。
Gemini Robotics ER 2 改进了这套工具编排工作流程。我们可以通过多种方式来评估其性能:使用真实机器人控制、在仿真环境中测试机器人,甚至与远程操控机器人的人类操作员协同配合。
在真实 VLA、仿真 VLA 和人工遥操三种控制模式下,Gemini Robotics ER 2 在工具编排方面都稳定优于 ER 1.6。
在机器人领域,高层推理离不开快速执行。Gemini Robotics ER 2 已集成到 Gemini Live API 中,通过针对低延迟任务优化的双向流式端点运行。由此带来的是流畅的编排体验:Gemini Robotics ER 2 指挥动作模型和机器人 API 一步步完成任务,全程没有那种卡顿的"停顿思考"。
为展示这一能力,我们与合作伙伴 Boston Dynamics 一起,基于其 Spot 搭建了一个演示:利用 Gemini Robotics ER 2 来编排 Spot API(包括导航和机械臂运动),打造出一台能听懂自然语言指令、为你取物的交互式机器人。
Gemini Robotics ER 2 驱动的 Boston Dynamics Spot 机器人根据一句自然语言指令取来一包爆米花。
代码及更多示例已发布在 GitHub 上。
释放时序智能,实现稳健的任务执行
机器人领域最棘手的难题之一,就是判断一个任务何时才算完成。Gemini Robotics ER 2 在视频理解和进度追踪方面带来了质的飞跃,能在切换到下一个任务之前,验证拧紧灯泡、系紧垃圾袋等复杂任务是否已按规范完成。
在本次更新中,我们在任务进度理解的两项基础能力上取得了进展:进度分类与关键帧定位。
连续进度分类
进度分类指的是机器人追踪任务完成进度的能力。在评测中,我们将视频流中的每一帧归入五个进度等级(0-20%、20-40%、40-60%、60-80%、80-100%)。通过对任务进度进行量化,Gemini Robotics ER 2 为机器人提供了实时态势感知,使其能够即时调整动作,或在某个步骤失败后重试,而无需重启整个工作流程。
Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的准确率,超越了上一代模型以及同类的前沿模型。
精准关键帧定位
关键帧定位衡量的是模型识别关键事件发生所在视频帧的能力(例如咖啡倒到何时该停)。Gemini Robotics ER 2 在关键帧定位性能上取得了显著提升,使机器人能够精确地在不同任务间切换、验证执行成功与否,并给出修正建议。
在关键帧定位任务上,Gemini Robotics ER 2 达到了 91.3% 的准确率,平均绝对偏差仅为 0.96 秒。它与体量大得多的同类模型表现相当,却只需极低的算力成本,并以 4 倍的执行速度完成这些任务——这种亚秒级延迟正是物理机器人在真实世界中安全运行所必需的。
多机器人协作
没有任何一种机器人能胜任所有任务——轮式机器人在室内表现出色,而人形机器人则更适合复杂地形。Gemini Robotics 2 支持多机器人协作,让形态各异的机器通过共享的语义理解进行通信,从而交接任务并协同完成复杂工作。点击此处查看 Gemini Robotics ER 2 如何让 Apptronik 的 Apollo 2 与 Franka F3 Duo 实现协作。
提升通用空间智能
Gemini Robotics ER 2 在核心空间推理能力上取得了进步,通过以下三项基准测试来衡量:
- 成功/失败检测:现在可直接处理原始视频流而非静态图像,从而捕捉到执行过程中的失败情况,例如洒漏、打滑或位置偏移。
- 通用仪表读数:适用范围从原有的圆形表盘和视镜扩展到数字显示屏、线性刻度、尺子以及液体温度计。我们在 10 种不同类型的仪表上进行了测试。
- 增强的空间视觉问答:借助 Gemini 在多模态理解方面的改进,提升了视觉问答能力。
Gemini Robotics ER 2 在所有核心能力上均稳定达到最高准确度,亮点包括成功检测(图像/视频)、问答(ERQA)以及通用仪表读数。
推进具身智能的安全发展
Gemini Robotics ER 2 是我们目前最安全的模型,在"安全指令遵循"和"人体接近度"基准测试上取得了显著提升——这两个基准分别衡量模型在推理任务中对物理约束的遵守程度,以及检测人体时的空间感知能力。我们发现,Gemini Robotics ER 2 能够在有人靠近时及时停止人形机器人的动作,并在确认周围安全后自主恢复作业。为了推动物理智能体的安全发展,我们推出了一项新的基准测试,用于评估基础模型作为安全 VLA 编排器的能力,包括执行安全约束、监控环境、评估物理可行性以及主动寻求人工确认等方面。详情请参阅我们的安全技术报告。
在"安全指令遵循"和"人体接近度"基准测试上,Gemini Robotics ER 2 的表现优于 ER 1.6 及其他前沿模型。
展望未来,我们计划让这些模型胜任更复杂的任务,以加速实用型机器人的开发,并为整个机器人社区提供支持。