返回 文章 apply CMS 文章

Google DeepMind 推出 SL2T:将手语 AI 带入 Pixel 11 的 Gboard 和 Live Transcribe

Google DeepMind 的 SL2T 模型让失聪用户能在 Pixel 11 上用手语直接输入文本,标志着多语言手语 AI 的突破性进展。

手语AISL2TGoogle DeepMind可访问性
成长分 / 100 78 综合收获、行动、留存与影响

Google DeepMind 推出 SL2T:将手语 AI 带入 Pixel 11 的 Gboard 和 Live Transcribe
为什么值得读了解手语 AI 面临的核心技术挑战及 SL2T 如何通过姿态关键点和直接翻译解决这些问题。

认识 Google 与聋人社区共同建设的参与式治理模式,以及 AI 手语咨询委员会的作用。

关键洞察
  1. SL2T 在超过 50 种手语的 100,000 多小时数据上训练,其中约四分之一为 ASL,联合训练提升了模型性能。
  2. 模型将手语视为姿态关键点序列而非原始视频,保护隐私的同时实现直接文本翻译,绕过中间注释。
  3. SL2T 在 FLEURS-ASL 基准上取得 70 BLEURT 零样本分数,显著优于此前报告的任何分数。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10799

将手语 AI 交到用户手中

隆重推出手语转文本(SL2T),这是我们突破性的模型,为失聪和听障用户提供全新的手语功能。

近几十年来,AI 处理口语的能力飞速发展,实现了自动翻译、听写和对话界面,让健听用户感到轻松自如。然而,这场技术革命尚未触及全球 200 多种手语——以及估计 7000 万使用这些手语的失聪和听障人士。

今天,我们推出一款大规模多语言手语转文本(SL2T)翻译模型,在质量和通用性上标志着一次突破。借助它,我们首次将手语 AI 从实验室带入消费产品:SL2T 为 Pixel 11 上 Gboard 和 Live Transcribe 的手语转文本听写提供支持,首先支持美国手语(ASL)转英语。更多设备即将推出,更多语言也将陆续支持。

与健听用户可以使用听写来说话而非打字类似,这项功能让失聪用户可以在通常需要打字的任何地方,用手语对着手机表达。你可以用手语搜索网页、起草消息或文档,并让 Gemini 解答查询或执行任务。在 Live Transcribe 中,你可以在对话中用手语回应,而不必来回打字。据我们的测试者反馈,用美国手语比用英语打字更快、更自然、也更令人愉悦。

由 SL2T 驱动的手语转文本,让用户可以在通常需要打字的任何地方,用手语对着手机表达。

手语为何重要

手语是世界各地失聪社群的主要语言,也是失聪文化认同的基石。失聪人士在手语、口语、阅读和写作的熟练程度上差异很大,因此支持所有模态的访问非常重要。失聪人士可以从手语处理中受益,就像健听人士从口语处理中受益一样,此外这项技术还为弥合失聪社群与健听社群之间的沟通鸿沟开辟了新的可能性。尽管有这种产生积极社会影响的机会,手语 AI 的进展却一直缓慢——既因为为手语构建 AI 面临复杂挑战,也因为对手语本身如何运作存在广泛的误解。

与口语转录相比,手语翻译面临两个核心挑战。首先,转录语音是在同一语言内进行从声音到文本的顺序映射,而手语是独立的自然语言,拥有自己独特的语法和词汇。因此,它们需要真正的机器翻译,而不是手语到词语的顺序转换过程。其次,模型必须学会“看见”并理解身体动作。手语通过手、手臂、躯干、头部和面部的同步动作来传达意义。以高帧率准确追踪这些动作是一项困难且计算需求很高的计算机视觉任务。

鉴于这样的背景,就不难理解为什么一些早期的手语技术尝试,比如手语手套,存在根本性的局限:手语并不只是“手上的英语”。它们需要对精细的全身动作进行复杂的视觉感知,以及完整的语言翻译。SL2T 旨在同时实现这两点。

SL2T 将手语输入视为打手语者身体上的点,并将其翻译为流式文本输出。示例来自 FLEURS-ASL 基准测试。

SL2T 的工作原理

我们构建 SL2T 时,将用户中心、文化知情的方法与大规模数据扩展相结合。该模型在超过 50 种手语的 100,000 多小时数据上进行训练——其中大约四分之一的数据是 ASL。在多种语言、方言和熟练程度上进行联合训练,使模型学习到共享的底层结构,在我们的实验中表现优于单语言模型。

为了保护用户隐私,SL2T 将手语视为一系列姿态关键点位置,而不是原始摄像头画面。一个设备端模型(MediaPipe Holistic)跟踪打手语者身上点的位置,只有这些几何坐标会被发送到服务器进行翻译,从而可以立即丢弃原始视频。

SL2T 将这些坐标序列直接翻译为文本,绕过了此前手语翻译工作中广泛使用的被称为“注释”的中间标注。注释无法捕捉手语中丰富的非线性方面,例如非手动标记和空间构式。直接从关键点翻译消除了人为的词汇限制,并使翻译质量能够随数据直接扩展。

根据 FLEURS-ASL(sd-test)等关键基准测试,SL2T 是迄今为止能力最强的手语翻译模型,该基准评估 ASL 到英语的翻译质量。SL2T 取得了令人瞩目的 70 BLEURT 零样本分数,显著高于此前报告的任何分数。但仅优化学术基准并不能保证在实际应用中的可用性,因此我们在实际问题上下足了功夫,例如最小化流式延迟、防止在非手语输入上产生幻觉、确保对 10% 左利手打手语者的公平性,以及改善单手打手语(另一只手拿着智能手机时使用)的性能。

原文英文 SL2T 的美式手语 → 英文输出
库克群岛没有任何城市,而是由 15 个不同的岛屿组成。主要岛屿是拉罗汤加岛和艾图塔基岛。 库克群岛没有城市,由 15 个岛屿组成。两个主要岛屿是拉罗汤加岛和艾图塔基岛。
比赛于上午 10:00 开始,天气极佳,除了上午中段的一场小雨很快放晴外,这是一个非常适合七人制橄榄球的日子。 比赛于上午 10 点开始,天气极佳。早晨有小雨,随后放晴。这是一个非常适合七对七橄榄球的日子。
在一些联邦制国家,如美国和加拿大,所得税在联邦和地方两级征收,因此税率和税级可能因地区而异。 在一些联邦制国家,如美国和加拿大,所得税在联邦和地方两级征收。这意味着税率和税级因地区而异。
这种全身覆盖羽毛、温血的猛禽被认为用双足直立行走,爪子类似伶盗龙。 这种生物是温血的,吃灰色,全身覆盖羽毛。据信它像伶盗龙一样用双足行走。
也许有一天,你的曾孙会站在一个外星世界上,好奇他们的远古祖先? 也许有一天,你的曾孙会站在一个外星世界上,反思他们的祖先。

来自 FLEURS-ASL 基准的示例。SL2T 准确地将复杂的美式手语翻译成流利的英语。在罕见手语、快速手指拼写(“prey” → “grey”)、被动结构、分类词描述(遗漏“claws”)以及无上下文的时态(“kicked off” → “start”)中仍偶尔出现错误。

与社区共建

我们相信要与聋人社区共同建设,而不仅仅是为他们建设。聋人的视角塑造了这个项目的每一个阶段——从聋人谷歌员工 Sam Sepah 的概念化,到与聋人合作伙伴的数据收集,聋人用户研究中的评估,以及与聋人专家对技术的影响评估。

为了指导负责任的现实世界部署,我们成立了 AI 手语咨询委员会(AISLAC),汇集了许多全球聋人组织和主题专家。通过这种参与式治理模式,受我们技术影响最大的社区直接影响了我们的开发优先级。我们共同撰写了一份联合影响报告,用于在 Gboard 和 Live Transcribe 中发布 SL2T 1.0,透明地详细说明了技术的能力和当前局限性——我们计划在所有主要手语发布中继续这种协作方式。

展望未来

SL2T 建立在学术界和工业界数十年的基础研究之上,但将美式手语输入带到用户手机上只是开始。谷歌的使命是组织世界的信息,使其普遍可访问和有用。实现普遍可访问性意味着与口语和书面语言完全平等。我们的团队正在努力将这项技术扩展到更多手语、手语生成和前沿 AI 能力。我们期待负责任地分享我们的进展,以使通过手语的访问在数字领域成为标准。

你可以率先在 Pixel 11 上的 Gboard 和 Live Transcribe 中体验 SL2T,更多设备即将支持——全部无需额外费用。

致谢

这项工作由 Google DeepMind 和 Android 的团队共同完成。开发 SL2T 模型的核心团队是:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。

将该模型集成到 Gboard 和 Live Transcribe 的 Android 团队是:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。

我们感谢 Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Phoebe Kirk、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus 和 Biao Zhang 提供的额外支持。

我们还要感谢 MediaPipe Holistic(Google AI Edge)团队:Ivan Grishchenko、Artsiom Ablavatski、Valentin Bazarevsky、Esha Uboweja、George Sung、Jonathan Baccash、Gregory Karpiak、Sebastian Schmidt、Suril Shah、Raman Sarokin 和 Juhyun Lee。

也非常感谢那些参与我们模型早期测试的人员。