把手语 AI 交到用户手中
把手语 AI 交到用户手中
Google DeepMind 手语团队
分享推出手语转文字(SL2T)模型,这一突破性成果为听障用户带来了全新的手语功能。
近几十年来,AI 处理口语的能力飞速提升,自动翻译、听写和对话接口让健听用户几乎感受不到任何障碍。然而,这场技术革命却并未惠及全球 200 多种手语,以及使用这些手语的约 7000 万名听障人士。
今天,我们正式发布一个大规模多语言的手语转文字(SL2T)翻译模型,在质量和通用性上都取得了突破。借助它,我们首次把手语 AI 从实验室带到了消费产品中:SL2T 为 Pixel 11 上的 Gboard 和实时转写功能提供手语转文字听写支持,首批支持美式手语(ASL)转英语。更多设备即将上线,更多语言也将陆续推出。
就像健听用户可以用听写代替键盘输入一样,这项功能让听障用户在任何需要打字的场景下,都可以直接对着手机打手语。你可以一边比划一边搜索网页、撰写消息或文档,还能让 Gemini 帮你解答问题或完成任务。在实时转写中,你可以用手语回应对方,不必再反复打字交流。测试用户反馈说,用 ASL 打手语比用英语打字更快、更自然,体验也更愉悦。

您的浏览器不支持视频标签。您的浏览器不支持视频标签。由 SL2T 驱动的「手语转文字」功能,让用户在任意需要打字的场景下都可以直接对手机打手语。
为什么手语至关重要
手语是全球聋人社群的主要语言,也是聋人文化身份的基石。聋人在手语、口语、阅读和写作方面的熟练程度存在很大差异,因此,为各种交流方式提供支持至关重要。聋人可以从手语处理技术中受益,就像健听人可以从口语处理技术中受益一样。此外,这项技术还为弥合聋人与健听人社群之间的沟通鸿沟开辟了新可能。尽管它有望带来积极的社会影响,但手语 AI 的发展一直较为缓慢——一方面,为手语构建 AI 系统面临诸多复杂挑战,另一方面,人们对手语本身如何运作也存在广泛误解。
与口语转写相比,手语翻译面临两项核心挑战。首先,语音转写是将同一种语言中的声音按顺序映射为文本,而手语则是独立的自然语言,拥有自身独特的语法和词汇体系。因此,手语需要真正的机器翻译,而不是逐个将手势转换为词语的顺序处理过程。其次,模型必须学会“观察”并理解身体动作。手语通过手、手臂、躯干、头部和面部的同步动作传递含义。要在高帧率下准确追踪这些动作,是一项困难且计算量庞大的计算机视觉任务。
基于以上背景,就不难理解为什么早期的一些手语技术尝试(例如手语手套)会受到根本性限制:手语并不只是“用手表达英语”。它需要对细腻的全身动作进行复杂的视觉感知,并完成完整的语言翻译。SL2T 正是为同时实现这两点而设计的。

Your browser does not support the video tag. Your browser does not support the video tag.SL2T 将手语输入视为手语者身体上的关键点,并将其翻译为流式文本输出。示例来自 FLEURS-ASL 基准。
SL2T 的工作原理
我们采用以用户为中心、尊重文化差异的方法,再叠加海量数据,构建出了 SL2T。该模型基于超过 10 万小时的数据训练而成,覆盖 50 余种手语语言,其中约四分之一为美式手语(ASL)。将不同语言、方言和熟练程度的数据联合训练,能让模型学习到共有的底层结构,实验表明其效果优于单一语言模型。
为保护用户隐私,SL2T 将手语视为一系列姿态关键点坐标,而非原始摄像头画面。设备端模型(MediaPipe Holistic)负责追踪这些关键点的坐标,仅将几何坐标发送到服务器进行翻译,原始视频则可立即丢弃。
SL2T 直接将坐标序列翻译成文本,跳过了先前手语翻译工作中广泛使用的"注释中间表示(gloss)"。注释无法捕捉到手语中丰富的非线性特征,比如非手控标记和空间构词。直接从关键点翻译既摆脱了人为设定的词汇限制,也让翻译质量能够随数据量同步提升。
在 FLEURS-ASL(sd-test)等关键基准测试中,SL2T 是目前能力最强的手语翻译模型,该测试评估 ASL 到英语的翻译质量。SL2T 取得了 70 BLEURT 的零样本分数,远超此前报告的任何成绩。但只追求学术基准的分数并不能保证实际场景下的体验,所以我们也在实际问题上下了很大功夫,比如降低流式传输延迟、避免对非手语输入产生幻觉、确保对占 10% 的左手手语使用者的公平性,以及提升单手打手语(另一只手握着手机时使用)的翻译效果。
| 英文原文 | SL2T 的 ASL → 英文输出 |
|---|---|
| The Cook Islands do not have any cities but are composed of 15 different islands. The main ones are Rarotonga and Aitutaki. | The Cook Islands have no cities and consist of 15 islands. The two main islands are Rarotonga and Aitutaki. |
| 比赛于上午 10:00 在晴好的天气中开赛,除了上午中段一阵很快放晴的小雨之外,堪称七人制橄榄球的绝佳一天。 | 比赛在上午 10 点开始,天气晴好。早上有一阵小雨,很快就停了,是打七人制橄榄球的完美日子。 |
|---|---|
| 在一些联邦制国家,例如美国和加拿大,所得税既在联邦层面征收,也在地方层面征收,因此税率和税级会因地区而异。 | 在一些联邦制国家,比如美国和加拿大,所得税在联邦和地方两级都要征收。这意味着税率和税级因地区而异。 |
| 这种全身覆羽的温血猛禽被认为像伶盗龙一样用两腿直立行走,并长有爪子。 | 这种生物是温血动物,食腐(译注:原意为"吃灰色",疑似"食腐"之误译),全身覆羽。据信它像伶盗龙一样用两条腿行走。 |
| 也许有一天,你的曾孙辈将站在某个外星世界之巅,回望他们古老的祖先? | 也许有一天,你的曾孙辈将站在外星世界之上,回望他们的祖先。 |
FLEURS-ASL 基准测试示例。SL2T 能将复杂的 ASL 准确地翻译成流畅的英语。在罕见手语、快速手指拼写(如 "prey" 误译为 "grey")、被动结构、分类语描绘(遗漏 "claws")以及缺少上下文时的时态判断(如 "kicked off" 译为 "start")方面仍偶有错误。
与社区共同构建
我们坚信要与聋人群体共同构建,而非仅仅为他们构建。聋人群体的视角塑造了项目的每个环节——从聋人 Google 员工 Sam Sepah 发起的概念构思,到与聋人合作伙伴进行的数据收集、在聋人用户研究中开展的评价,以及由聋人专家对技术影响进行的评估。
为了指导这项技术在现实中的负责任部署,我们成立了 AI 手语咨询委员会(AISLAC),汇集了众多全球聋人组织和领域专家。通过这种参与式治理模式,受我们技术影响最深的社群能够直接参与决定我们的研发优先级。我们与委员会联合撰写了一份关于在 Gboard 和 Live Transcribe 中发布 SL2T 1.0 的联合影响报告,透明地说明了该技术的能力和当前局限——我们计划在今后所有重要手语版本发布时都延续这种协作方式。
展望未来
SL2T 建立在学术界和业界数十年基础研究之上,但把美式手语输入带到用户手机上只是一个开始。Google 的使命是整合全球信息,使人人皆可访问并从中受益。要实现真正的普惠无障碍,就要让手语与口语、书面语完全对等。我们的团队正在着手将该技术拓展到更多手语、手语生成以及前沿 AI 能力。我们期待以负责任的方式分享进展,让手语在数字世界中的使用变得如同日常。
你可以率先在 Pixel 11 上通过 Gboard 和 Live Transcribe 体验 SL2T,更多机型即将支持——全部免费提供。
致谢
本项目由 Google DeepMind 和 Android 团队合作完成。开发 SL2T 模型的核心团队成员包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。
负责将该模型集成到 Gboard 和 Live Transcribe 的 Android 团队成员包括:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。
我们感谢 Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus 和 Biao Zhang 提供的额外支持。
同时衷心感谢参与我们模型早期测试的所有人员。