← 文章 / AI技术
DeepMind 博客 9小时前 · 2026-08-13 16:02:41 · 2 阅读

把手语 AI 交到用户手中

2026 年 8 月 12 日 Models

把手语 AI 交到用户手中

Google DeepMind 手语团队

分享一位用户单手打着手语,另一只手握着智能手机,演示 Gboard 的手语转文字听写功能。

推出手语转文字(SL2T)模型,这一突破性成果为听障用户带来了全新的手语功能。

近几十年来,AI 处理口语的能力飞速提升,自动翻译、听写和对话接口让健听用户几乎感受不到任何障碍。然而,这场技术革命却并未惠及全球 200 多种手语,以及使用这些手语的约 7000 万名听障人士。

今天,我们正式发布一个大规模多语言的手语转文字(SL2T)翻译模型,在质量和通用性上都取得了突破。借助它,我们首次把手语 AI 从实验室带到了消费产品中:SL2T 为 Pixel 11 上的 Gboard 和实时转写功能提供手语转文字听写支持,首批支持美式手语(ASL)转英语。更多设备即将上线,更多语言也将陆续推出。

就像健听用户可以用听写代替键盘输入一样,这项功能让听障用户在任何需要打字的场景下,都可以直接对着手机打手语。你可以一边比划一边搜索网页、撰写消息或文档,还能让 Gemini 帮你解答问题或完成任务。在实时转写中,你可以用手语回应对方,不必再反复打字交流。测试用户反馈说,用 ASL 打手语比用英语打字更快、更自然,体验也更愉悦。

您的浏览器不支持视频标签。您的浏览器不支持视频标签。

由 SL2T 驱动的「手语转文字」功能,让用户在任意需要打字的场景下都可以直接对手机打手语。

为什么手语至关重要

手语是全球聋人社群的主要语言,也是聋人文化身份的基石。聋人在手语、口语、阅读和写作方面的熟练程度存在很大差异,因此,为各种交流方式提供支持至关重要。聋人可以从手语处理技术中受益,就像健听人可以从口语处理技术中受益一样。此外,这项技术还为弥合聋人与健听人社群之间的沟通鸿沟开辟了新可能。尽管它有望带来积极的社会影响,但手语 AI 的发展一直较为缓慢——一方面,为手语构建 AI 系统面临诸多复杂挑战,另一方面,人们对手语本身如何运作也存在广泛误解。

与口语转写相比,手语翻译面临两项核心挑战。首先,语音转写是将同一种语言中的声音按顺序映射为文本,而手语则是独立的自然语言,拥有自身独特的语法和词汇体系。因此,手语需要真正的机器翻译,而不是逐个将手势转换为词语的顺序处理过程。其次,模型必须学会“观察”并理解身体动作。手语通过手、手臂、躯干、头部和面部的同步动作传递含义。要在高帧率下准确追踪这些动作,是一项困难且计算量庞大的计算机视觉任务。

基于以上背景,就不难理解为什么早期的一些手语技术尝试(例如手语手套)会受到根本性限制:手语并不只是“用手表达英语”。它需要对细腻的全身动作进行复杂的视觉感知,并完成完整的语言翻译。SL2T 正是为同时实现这两点而设计的。

Your browser does not support the video tag. Your browser does not support the video tag.

SL2T 将手语输入视为手语者身体上的关键点,并将其翻译为流式文本输出。示例来自 FLEURS-ASL 基准。

SL2T 的工作原理

我们采用以用户为中心、尊重文化差异的方法,再叠加海量数据,构建出了 SL2T。该模型基于超过 10 万小时的数据训练而成,覆盖 50 余种手语语言,其中约四分之一为美式手语(ASL)。将不同语言、方言和熟练程度的数据联合训练,能让模型学习到共有的底层结构,实验表明其效果优于单一语言模型。

为保护用户隐私,SL2T 将手语视为一系列姿态关键点坐标,而非原始摄像头画面。设备端模型(MediaPipe Holistic)负责追踪这些关键点的坐标,仅将几何坐标发送到服务器进行翻译,原始视频则可立即丢弃。

SL2T 直接将坐标序列翻译成文本,跳过了先前手语翻译工作中广泛使用的"注释中间表示(gloss)"。注释无法捕捉到手语中丰富的非线性特征,比如非手控标记和空间构词。直接从关键点翻译既摆脱了人为设定的词汇限制,也让翻译质量能够随数据量同步提升。

在 FLEURS-ASL(sd-test)等关键基准测试中,SL2T 是目前能力最强的手语翻译模型,该测试评估 ASL 到英语的翻译质量。SL2T 取得了 70 BLEURT 的零样本分数,远超此前报告的任何成绩。但只追求学术基准的分数并不能保证实际场景下的体验,所以我们也在实际问题上下了很大功夫,比如降低流式传输延迟、避免对非手语输入产生幻觉、确保对占 10% 的左手手语使用者的公平性,以及提升单手打手语(另一只手握着手机时使用)的翻译效果。

英文原文SL2T 的 ASL → 英文输出
The Cook Islands do not have any cities but are composed of 15 different islands. The main ones are Rarotonga and Aitutaki.The Cook Islands have no cities and consist of 15 islands. The two main islands are Rarotonga and Aitutaki.
比赛于上午 10:00 在晴好的天气中开赛,除了上午中段一阵很快放晴的小雨之外,堪称七人制橄榄球的绝佳一天。比赛在上午 10 点开始,天气晴好。早上有一阵小雨,很快就停了,是打七人制橄榄球的完美日子。
在一些联邦制国家,例如美国和加拿大,所得税既在联邦层面征收,也在地方层面征收,因此税率和税级会因地区而异。在一些联邦制国家,比如美国和加拿大,所得税在联邦和地方两级都要征收。这意味着税率和税级因地区而异。
这种全身覆羽的温血猛禽被认为像伶盗龙一样用两腿直立行走,并长有爪子。这种生物是温血动物,食腐(译注:原意为"吃灰色",疑似"食腐"之误译),全身覆羽。据信它像伶盗龙一样用两条腿行走。
也许有一天,你的曾孙辈将站在某个外星世界之巅,回望他们古老的祖先?也许有一天,你的曾孙辈将站在外星世界之上,回望他们的祖先。

FLEURS-ASL 基准测试示例。SL2T 能将复杂的 ASL 准确地翻译成流畅的英语。在罕见手语、快速手指拼写(如 "prey" 误译为 "grey")、被动结构、分类语描绘(遗漏 "claws")以及缺少上下文时的时态判断(如 "kicked off" 译为 "start")方面仍偶有错误。

与社区共同构建

我们坚信要与聋人群体共同构建,而非仅仅为他们构建。聋人群体的视角塑造了项目的每个环节——从聋人 Google 员工 Sam Sepah 发起的概念构思,到与聋人合作伙伴进行的数据收集、在聋人用户研究中开展的评价,以及由聋人专家对技术影响进行的评估。

为了指导这项技术在现实中的负责任部署,我们成立了 AI 手语咨询委员会(AISLAC),汇集了众多全球聋人组织和领域专家。通过这种参与式治理模式,受我们技术影响最深的社群能够直接参与决定我们的研发优先级。我们与委员会联合撰写了一份关于在 Gboard 和 Live Transcribe 中发布 SL2T 1.0 的联合影响报告,透明地说明了该技术的能力和当前局限——我们计划在今后所有重要手语版本发布时都延续这种协作方式。

展望未来

SL2T 建立在学术界和业界数十年基础研究之上,但把美式手语输入带到用户手机上只是一个开始。Google 的使命是整合全球信息,使人人皆可访问并从中受益。要实现真正的普惠无障碍,就要让手语与口语、书面语完全对等。我们的团队正在着手将该技术拓展到更多手语、手语生成以及前沿 AI 能力。我们期待以负责任的方式分享进展,让手语在数字世界中的使用变得如同日常。

你可以率先在 Pixel 11 上通过 Gboard 和 Live Transcribe 体验 SL2T,更多机型即将支持——全部免费提供。

致谢

本项目由 Google DeepMind 和 Android 团队合作完成。开发 SL2T 模型的核心团队成员包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。

负责将该模型集成到 Gboard 和 Live Transcribe 的 Android 团队成员包括:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。

我们感谢 Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus 和 Biao Zhang 提供的额外支持。

同时衷心感谢参与我们模型早期测试的所有人员。

原始来源: DeepMind 博客

评论 (0)