Google DeepMind 于 2026 年 8 月 12 日发布了可将手语直接翻译成文字的 AI 模型「SL2T」。此前一直停留在实验室阶段的手语 AI,首次以面向普通用户的功能形式进入产品,搭载于 Pixel 11 的 Gboard 与 Live Transcribe。首批支持美国手语(ASL)到英语的转换,不额外收费。
语音输入的手语版终于成形
用语音输入文字在智能手机上早已是标配功能。相比之下,把手语直接转成文字的能力长期未能进入实用阶段。全球有 200 多种手语,使用这些手语的听障人士估计超过 7,000 万,但自动翻译和语音输入在口语领域带来的进展,并没有同样惠及手语。
SL2T 正是针对这一空白。在 Pixel 11 上,Gboard 支持手语输入,过去需要打字的场景现在可以改为对着摄像头打手语,涵盖网页搜索、撰写消息和文档,以及向 Gemini 下达指令。在转写应用 Live Transcribe 中,用户可以一边用文字跟上对方的发言,一边用手语作出回应。Google 表示,测试者反馈用 ASL 打手语比用英语打字更快、更自然。
手语并不是「用手表达的英语」
语音识别与手语翻译的难点性质不同。语音转写是在同一种语言内把声音按顺序映射为文字,而手语是拥有独立语法和词汇的自然语言,因此需要的是真正意义上的机器翻译,而不是逐词替换。
模型还必须「看懂」动作。手语通过手、手臂、上身、头部和面部的同时运动来传递含义,要在高帧率下准确追踪这些信息,是计算量很大的计算机视觉难题。Google DeepMind 指出,早期的手语手套之类的尝试之所以未能实用,正是因为误以为手语只是用手表达的英语。
只把骨骼坐标发送到服务器
SL2T 并不直接处理摄像头画面。运行在设备端的 MediaPipe Holistic 会追踪打手语者身上各个关键点的位置,只有这串几何坐标会被发送到服务器,原始视频随即被丢弃,这一设计是出于隐私保护的考虑。
翻译环节同样体现了设计取舍。以往的手语翻译研究普遍会经过一种称为 gloss 的中间标注,但 gloss 会丢失非手部标记、空间构式等手语特有的信息。SL2T 从坐标序列直接生成文字,去掉了人为的词汇上限,使翻译质量能够随数据量增长而提升。
训练数据覆盖 50 多种手语、总时长超过 10 万小时,其中约四分之一为 ASL。把多种语言、方言和熟练度混合在一起联合训练后,模型表现优于单语言版本。在衡量 ASL 到英语翻译质量的基准 FLEURS-ASL 的 sd-test 上,SL2T 以零样本方式取得 70 BLEURT,大幅超过此前报告的成绩。
为了真正可用而做的琐碎打磨
基准分数高和用户真的用得上是两回事。Google DeepMind 表示,团队在压缩流式输出延迟、避免在画面中没有手语时凭空生成文字、以及保证约占 10% 的左利手打手语者精度不下降等方面做了大量调整。用户一手拿着手机、只用另一只手打手语的场景,也在优化范围之内。
与听障群体共同打造
这一项目始于 Google 的听障员工 Sam Sepah 的构想。数据采集与听障伙伴共同推进,评估通过面向听障用户的研究完成,技术影响评估也有听障领域专家参与。
Google DeepMind 还设立了汇集全球听障组织与专家的 AI Sign Language Advisory Committee(AISLAC),并在 SL2T 1.0 发布的同时公开了联合影响报告。报告明确写出了技术能做什么以及当前的局限,公司表示今后的重要手语相关发布都会沿用这一做法。
目前支持的只有 ASL 与英语这一组合,但 Google DeepMind 表示正在扩展支持的语言和设备,同时也在推进从文字生成手语的方向。
总结
Google DeepMind 发布的 SL2T 不经过 gloss,直接把手语翻译成文字,并已免费集成到 Pixel 11 的 Gboard 与 Live Transcribe 中。该模型基于 50 多种手语、超过 10 万小时的数据训练,在 FLEURS-ASL 的 sd-test 上零样本取得 70 BLEURT。只发送设备端提取的骨骼坐标,以及对左利手和单手打手语的照顾,都体现出这是一款为实际使用而打磨的模型。目前覆盖范围仅限 ASL 到英语,设备也仅限 Pixel 11,但这是手语 AI 首次作为产品面向用户。