AgentHands:为XR中空间化agent对话生成交互式手势
XR中具身化手势智能体的分类体系
首先,我们与谷歌的 XR 和人机交互(HCI)专家开展了一项探索性研究,以确定 3D 环境中虚拟手势该如何做到“清晰易懂”。基于这些发现,我们提炼出一套多维分类体系,规范智能体如何利用手势将对话锚定在用户的真实物理空间中。
- 左右手与手势:根据情境选择单手或双手,并从预设手势库中选取形态,如警示用的“掌心”或模仿握工具的“圆柱握持”。
- 空间定位:利用 XR 深度感知确定手势落脚点。日常对话悬浮于空中,指认部件时锚定在物体上,传递社交信号时则以用户为参照。
- 时间动态与视觉效果(VFX):XR 手势并非静态姿势,而是包含“倒水”“描边”等动画过程。我们还叠加 XR 特有的视觉图层添加特效,例如用红光表示高温警告。
AgentHands 分类体系图示展示了六个维度:左右手、手势、空间定位、时间动态、交互性与视觉效果。
AgentHands 工作流程
AgentHands 的核心创新在于,能够将大语言模型的高级推理映射为精确的实时物理动作,使其既符合智能体的“表达风格”,又契合用户的 XR 环境。以下为其工作流程的关键步骤。
环境感知
系统首先通过轻量级的物体注册模块启动。借助视线与场景重建,用户可以快速对物品——如兰花或笔记本电脑——进行“打标”,生成带有 3D 包围盒的空间注册表,供智能体后续调用。
AgentHands 通过视线与场景理解,将物理物体注册到 3D 注册表中。
手势事件库
我们构建了一个涵盖三种语义类别的手势行为库:a) 指示性手势(用于指代),b) 图标性手势(用于描绘动作或形态),以及 c) 表达性手势(用于传递社交线索与情感)。
一组按语义目的分组代表行为,便于 LLM 选择。
嵌入手势的推理
当用户提问时,后端 LLM 会生成包含内联 GestureEvents 的响应。每个事件都与特定触发词关联,并按照分类维度编码手势行为的基元要素。
XR 同步执行
X 头显上的本地解析器负责协调 文字转语音(TTS)播放与动画引擎。通过利用词级时间戳,代理的双手能够与语音完美同步地做出伴随手势,提供清晰且富有表现力的空间参照。
通过整合这些模块,AgentHands 在语言意图与物理动作之间搭建了无缝桥梁。系统将标准 LLM 输出转化为丰富的多模态演绎,使代理的生成响应通过语音和空间上精准的动作共同呈现,从而能够在用户环境中指令发生的精确位置演示复杂操作。
完整的 AgentHands 系统工作流,阐明从用户语音和第一人称视角(FPV)到 LLM 生成的 GestureEvents 及 XR 同步渲染的流程。
应用场景
我们展示了这些具身手势如何结合 XR 的空间感知能力,增强我们对物理环境的理解。
交互式辅导:在兰花养护场景中,代理不仅说“检查一下根部”,还会将手移到植物基部,同时讲解气根功能并勾勒出气根的轮廓。
播放静音循环视频 暂停静音循环视频 解除视频静音 静音视频AgentHands 在兰花护理任务中利用空间手势指出气根位置。
技术操作演示:针对3D打印机操作,代理可以演示精确的"旋转并点击"序列来操作控制旋钮和选择文件,使复杂的物理界面步骤变得直观。
播放静音循环视频 暂停静音循环视频 解除视频静音 静音视频AgentHands 演示了3D打印机菜单导航中精确的旋钮交互操作。
生活陪伴:代理可以担任健康教练,与你的实际行动进行互动。例如,代理可以通过握住用户的手并配合视觉效果,做出交互式"警示"手势,提醒用户避免不健康的行为。
播放静音循环视频 暂停静音循环视频 解除视频静音 静音视频AgentHands 通过微妙的交互式手势来支持健康的日常习惯。
用户研究
为评估这些手势的影响,我们开展了一项受试者内实验(N = 12),将 AgentHands 与仅语音基线进行对比。两组条件使用相同的预设语音内容,确保唯一差异在于是否存在具身双手及其同步手势。参与者完成了两项操作流程,分别涵盖日常护理和技术操作。
- 兰花护理任务:用户学习识别植物部位(气根、茎干),并完成包括定点浇水和正确施肥在内的多步骤护理操作。
- 3D打印机操作任务:用户依次学习识别喷嘴、打印平台等硬件部件,然后完成开机、插入SD卡以及操作控制面板的流程。
用户研究场景展示了两个任务环境:(a)兰花护理站和(b)3D打印机操作站。
结果
结果证实,XR 与伴随言语的手势相结合,对于空间化交互非常有效。我们分析了多项沟通效果关键指标的数据。
- 空间锚定效果显著提升:参与者认为定位特定物体和识别代理所指方向明显更容易(p < 0.05)。指向手势与代理说"这个"精准同步,消除了纯语言指令中常见的猜测成本。
- 复杂动作理解更直观:所需操作被评价为更容易跟随(p < 0.05)。一位参与者提到,"只有当代理做出抬举手势时,我才意识到要抬起兰花让水排掉"。
- 安全提示更加醒目:警告信息与手势和视觉效果结合时效果显著增强。3D打印任务中使用的"灼热"特效被评价为"非常印象深刻",确保用户一定会注意到高温喷嘴的风险。
- 认知负担降低:参与者反映指令更易理解和记忆。定性反馈表明,虚拟双手给人的感觉像是"一位引导我的伙伴",将体验从基于工具的搜索转变为一种融合式的具身对话。
系统功能体验问卷的统计结果显示,AgentHands在位置定位、动作理解和警告感知三个维度上显著优于基线。
结论与未来方向
AgentHands代表了一个重要进展,指向这样一个未来:AI系统不再只是分析我们的世界,而是在其中动态地运作。通过结合伴随言语的手势和XR的空间能力,将对话锚定于物理动作之中,我们能够降低复杂任务的认知负担,让空间计算更加易用、更加以人为本。
随着我们持续为Android XR生态系统进行开发,我们正在探索让手势更加个性化的方法——适配用户的惯用手,或学习其特定的空间习惯——以实现更无缝的人机协作。