← 文章 / AI技术
Google Research 博客 1小时前 · 2026-09-04 08:19:17 · 2 阅读

AgentHands:为XR中空间化agent对话生成交互式手势

随着AI助手从简单的文本界面演进为多模态伴侣,我们正见证辅助方式向更具主动性和情境感知方向的转变。Project Astra和Gemini 3.1 Flash Live等最新创新已能让用户实时讨论所处的物理环境,通常借助视觉边界框覆盖层来识别摄像头画面中的物体。虽然这些覆盖层在2D屏幕上效果显著,但向Android XR等沉浸式平台的过渡则带来了独特挑战:我们如何突破平面UI的局限,创造出真正具身化、具有空间感知能力的对话体验? 为弥合这一差距,我们推出了AgentHands(发表在CHI 2026),这是一个研究原型,将协同手势的力量带入了3D世界。在人类交流中,双手的作用远不止指向——它们能描述形状、模仿动作、强调重点,并与语音高度同步。借助扩展现实(XR)的空间理解能力,AgentHands复刻了这种自然的协同效应。在人类I/O和Sensible Agent等前期研究的基础上,AgentHands进一步赋予AI智能体 expressive、同步的手势能力,将抽象的语言指令转化为直观的物理演示,让关于周围环境的对话更加自然、引人入胜。 播放静音循环视频 暂停静音循环视频 取消静音视频 静音视频 AgentHands演示:赋予AI智能体富有表现力且与语音同步的手势,用于XR中的空间化对话。

XR中具身化手势智能体的分类体系

首先,我们与谷歌的 XR 和人机交互(HCI)专家开展了一项探索性研究,以确定 3D 环境中虚拟手势该如何做到“清晰易懂”。基于这些发现,我们提炼出一套多维分类体系,规范智能体如何利用手势将对话锚定在用户的真实物理空间中。

  • 左右手与手势:根据情境选择单手或双手,并从预设手势库中选取形态,如警示用的“掌心”或模仿握工具的“圆柱握持”。
  • 空间定位:利用 XR 深度感知确定手势落脚点。日常对话悬浮于空中,指认部件时锚定在物体上,传递社交信号时则以用户为参照。
  • 时间动态与视觉效果(VFX):XR 手势并非静态姿势,而是包含“倒水”“描边”等动画过程。我们还叠加 XR 特有的视觉图层添加特效,例如用红光表示高温警告。
虚拟手势分类体系:左右手、手势、空间定位、时间动态、交互性与视觉效果。

AgentHands 分类体系图示展示了六个维度:左右手、手势、空间定位、时间动态、交互性与视觉效果。

AgentHands 工作流程

AgentHands 的核心创新在于,能够将大语言模型的高级推理映射为精确的实时物理动作,使其既符合智能体的“表达风格”,又契合用户的 XR 环境。以下为其工作流程的关键步骤。

环境感知

系统首先通过轻量级的物体注册模块启动。借助视线与场景重建,用户可以快速对物品——如兰花或笔记本电脑——进行“打标”,生成带有 3D 包围盒的空间注册表,供智能体后续调用。

工作流程示意图,展示视线、场景网格和第一人称视角如何被处理,以在兰花周围生成 3D 包围盒。

AgentHands 通过视线与场景理解,将物理物体注册到 3D 注册表中。

手势事件库

我们构建了一个涵盖三种语义类别的手势行为库:a) 指示性手势(用于指代),b) 图标性手势(用于描绘动作或形态),以及 c) 表达性手势(用于传递社交线索与情感)。

将手势行为划分为三类:指示性(指向)、图标性(表示形状/大小)和表达性(情感)。

一组按语义目的分组代表行为,便于 LLM 选择。

嵌入手势的推理

当用户提问时,后端 LLM 会生成包含内联 GestureEvents 的响应。每个事件都与特定触发词关联,并按照分类维度编码手势行为的基元要素。

XR 同步执行

X 头显上的本地解析器负责协调 文字转语音(TTS)播放与动画引擎。通过利用词级时间戳,代理的双手能够与语音完美同步地做出伴随手势,提供清晰且富有表现力的空间参照。

通过整合这些模块,AgentHands 在语言意图与物理动作之间搭建了无缝桥梁。系统将标准 LLM 输出转化为丰富的多模态演绎,使代理的生成响应通过语音和空间上精准的动作共同呈现,从而能够在用户环境中指令发生的精确位置演示复杂操作。

AgentHands 系统工作流示意图,展示从用户语音和第一人称视角(FPV)到 LLM 生成的 GestureEvents 及 XR 同步渲染的流程。

完整的 AgentHands 系统工作流,阐明从用户语音和第一人称视角(FPV)到 LLM 生成的 GestureEvents 及 XR 同步渲染的流程。

应用场景

我们展示了这些具身手势如何结合 XR 的空间感知能力,增强我们对物理环境的理解。

交互式辅导:在兰花养护场景中,代理不仅说“检查一下根部”,还会将手移到植物基部,同时讲解气根功能并勾勒出气根的轮廓。

播放静音循环视频 暂停静音循环视频 解除视频静音 静音视频

AgentHands 在兰花护理任务中利用空间手势指出气根位置。

技术操作演示:针对3D打印机操作,代理可以演示精确的"旋转并点击"序列来操作控制旋钮和选择文件,使复杂的物理界面步骤变得直观。

播放静音循环视频 暂停静音循环视频 解除视频静音 静音视频

AgentHands 演示了3D打印机菜单导航中精确的旋钮交互操作。

生活陪伴:代理可以担任健康教练,与你的实际行动进行互动。例如,代理可以通过握住用户的手并配合视觉效果,做出交互式"警示"手势,提醒用户避免不健康的行为。

播放静音循环视频 暂停静音循环视频 解除视频静音 静音视频

AgentHands 通过微妙的交互式手势来支持健康的日常习惯。

用户研究

为评估这些手势的影响,我们开展了一项受试者内实验(N = 12),将 AgentHands 与仅语音基线进行对比。两组条件使用相同的预设语音内容,确保唯一差异在于是否存在具身双手及其同步手势。参与者完成了两项操作流程,分别涵盖日常护理和技术操作。

  • 兰花护理任务:用户学习识别植物部位(气根、茎干),并完成包括定点浇水和正确施肥在内的多步骤护理操作。
  • 3D打印机操作任务:用户依次学习识别喷嘴、打印平台等硬件部件,然后完成开机、插入SD卡以及操作控制面板的流程。
并列照片展示了用户研究场景,左侧为兰花旁的蓝色浮动手形化身(a),右侧为3D打印机旁的蓝色浮动手形化身(b)。

用户研究场景展示了两个任务环境:(a)兰花护理站和(b)3D打印机操作站。

结果

结果证实,XR 与伴随言语的手势相结合,对于空间化交互非常有效。我们分析了多项沟通效果关键指标的数据。

  • 空间锚定效果显著提升:参与者认为定位特定物体和识别代理所指方向明显更容易(p < 0.05)。指向手势与代理说"这个"精准同步,消除了纯语言指令中常见的猜测成本。
  • 复杂动作理解更直观:所需操作被评价为更容易跟随(p < 0.05)。一位参与者提到,"只有当代理做出抬举手势时,我才意识到要抬起兰花让水排掉"。
  • 安全提示更加醒目:警告信息与手势和视觉效果结合时效果显著增强。3D打印任务中使用的"灼热"特效被评价为"非常印象深刻",确保用户一定会注意到高温喷嘴的风险。
  • 认知负担降低:参与者反映指令更易理解和记忆。定性反馈表明,虚拟双手给人的感觉像是"一位引导我的伙伴",将体验从基于工具的搜索转变为一种融合式的具身对话。
柱状图展示了AgentHands与基线在7分量表上十个对话指标的可用性评分对比。

系统功能体验问卷的统计结果显示,AgentHands在位置定位、动作理解和警告感知三个维度上显著优于基线。

结论与未来方向

AgentHands代表了一个重要进展,指向这样一个未来:AI系统不再只是分析我们的世界,而是在其中动态地运作。通过结合伴随言语的手势和XR的空间能力,将对话锚定于物理动作之中,我们能够降低复杂任务的认知负担,让空间计算更加易用、更加以人为本。

随着我们持续为Android XR生态系统进行开发,我们正在探索让手势更加个性化的方法——适配用户的惯用手,或学习其特定的空间习惯——以实现更无缝的人机协作。

致谢

本研究主要由 Ziyi Liu 在 Google 担任 Student Researcher 期间完成,是多个团队联合协作的成果。我们衷心感谢 David Li、Zhongyi Zhou 和 David Kim 等关键贡献者的支持,同时也感谢 Adarsh Kowdle、Guru Somadder 和 Shahram Izadi 的战略指导与精心审阅。
原始来源: Google Research 博客

评论 (0)