Google DeepMind 於 2026 年 8 月 12 日發表可將手語直接翻譯成文字的 AI 模型「SL2T」。過去僅停留在實驗室階段的手語 AI,首次以一般使用者也能用到的功能形式進入產品,搭載於 Pixel 11 的 Gboard 與 Live Transcribe。初期支援美國手語(ASL)翻譯成英文,且不另外收費。
語音輸入的手語版終於成形
用語音輸入文字,在智慧型手機上早已是理所當然的功能。相對地,把手語直接轉成文字的能力長年未能進入實用階段。全球有 200 種以上的手語,使用這些手語的聽障者估計超過 7,000 萬人,但自動翻譯與語音輸入在口語上帶來的進展,並未同樣延伸到手語。
SL2T 正是為了填補這塊空白。在 Pixel 11 上,Gboard 支援手語輸入,過去需要打字的場合,現在可以改成對著鏡頭比手語,包括網頁搜尋、撰寫訊息與文件,以及向 Gemini 下指令。在轉寫應用程式 Live Transcribe 中,使用者可以一邊以文字掌握對方的發言,一邊用手語回應。Google 表示,測試者的回饋是用 ASL 比手語比用英文打字更快、也更自然。
手語並不是「用手表達的英文」
語音辨識與手語翻譯的困難之處性質不同。語音轉寫是在同一種語言內把聲音依序對應成文字,而手語是擁有獨立文法與詞彙的自然語言,因此需要的是真正意義上的機器翻譯,而不是逐字替換。
模型還必須「看懂」動作。手語是透過手、手臂、上半身、頭部與表情的同時動作來傳達意義,要在高影格率下準確追蹤這些資訊,是運算負荷相當大的電腦視覺課題。Google DeepMind 指出,早期的手語手套之類的嘗試之所以未能實用,正是因為誤以為手語只是用手表達的英文。
只把骨架座標送到伺服器
SL2T 並不直接處理攝影機的影像。在裝置端執行的 MediaPipe Holistic 會追蹤比手語者身上各個關鍵點的位置,只有這串幾何座標會送到伺服器,原始影片隨即被捨棄,這個設計是出於保護隱私的考量。
翻譯環節同樣有設計上的取捨。以往的手語翻譯研究普遍會先經過稱為 gloss 的中介標記,但 gloss 會遺漏非手部標記、空間構式等手語特有的資訊。SL2T 直接從座標序列生成文字,去掉了人為的詞彙上限,使翻譯品質能隨資料量成長而提升。
訓練資料涵蓋 50 種以上的手語、總時數超過 10 萬小時,其中約四分之一為 ASL。將多種語言、方言與熟練度混合在一起共同訓練後,模型表現優於單一語言的版本。在衡量 ASL 翻譯成英文品質的基準 FLEURS-ASL 的 sd-test 上,SL2T 以零樣本方式取得 70 BLEURT,大幅超越先前回報的成績。
為了真正能用而做的細部打磨
基準分數高,跟使用者實際用得上,是兩回事。Google DeepMind 表示,團隊在壓縮串流輸出延遲、避免畫面中沒有手語時憑空生成文字,以及確保約占 10% 的左撇子比手語者精度不下滑等方面,做了大量調整。使用者一手拿著手機、只用另一隻手比手語的情境,也在最佳化的範圍內。
與聽障社群一起打造
這個專案始於 Google 的聽障員工 Sam Sepah 的構想。資料蒐集與聽障夥伴共同進行,評估透過以聽障者為對象的使用者研究完成,技術的影響評估也有聽障領域的專家參與。
Google DeepMind 另外成立了匯集全球聽障組織與專家的 AI Sign Language Advisory Committee(AISLAC),並在 SL2T 1.0 發表的同時公開了共同影響報告。報告明確寫出技術做得到什麼、目前的限制又在哪裡,公司也表示今後重要的手語相關發表都會沿用同樣做法。
目前支援的只有 ASL 與英文這一組,但 Google DeepMind 表示正在擴充支援的語言與裝置,同時也在推進從文字生成手語的方向。
總結
Google DeepMind 發表的 SL2T 不經過 gloss,直接把手語翻譯成文字,並已免費整合到 Pixel 11 的 Gboard 與 Live Transcribe。這個模型以 50 種以上手語、超過 10 萬小時的資料訓練,在 FLEURS-ASL 的 sd-test 上以零樣本取得 70 BLEURT。只傳送裝置端擷取的骨架座標,以及對左撇子與單手比手語的照顧,都顯示這是為了實際使用而打磨的模型。目前涵蓋範圍僅限 ASL 翻譯成英文,裝置也僅限 Pixel 11,但這是手語 AI 首次以產品形式來到使用者手上。