Google DeepMindが2026年8月12日、手話を直接テキストへ翻訳するAIモデル「SL2T」を公開しました。研究室にとどまっていた手話AIが、Pixel 11のGboardとLive Transcribeという一般向け機能として初めて実装されます。当初はアメリカ手話から英語への変換に対応し、追加料金はかかりません。
音声入力の手話版がようやく形になった
声で文字を入力する仕組みは、スマートフォンではとうに当たり前の機能になりました。一方、手話をそのまま文字に起こす機能は長らく実用の域に届いていません。世界には200を超える手話言語があり、それを使うろう者・難聴者は7,000万人以上と見積もられていますが、音声言語で起きた自動翻訳や音声入力の進歩が、そのまま手話に及んできたとは言い難い状況でした。
SL2Tはこの空白を埋める位置づけです。Pixel 11ではGboardが手話入力に対応し、これまでキーボードを打っていた場面をカメラに向かって手話で置き換えられます。ウェブ検索、メッセージや文書の作成、Geminiへの指示までが対象です。文字起こしアプリのLive Transcribeでは、相手の発話を文字で追いながら、返答を手話で返すという使い方ができます。Googleは、テスターから英語を打ち込むよりASLで手話するほうが速くて自然だという反応が返ってきたと説明しています。
手話は「手で表す英語」ではない
音声認識と手話翻訳では、そもそも難しさの質が違います。音声の文字起こしは、同じ言語の中で音を文字へ順番に置き換える作業です。これに対して手話は独自の文法と語彙を持つ自然言語なので、単語を1つずつ置き換えるのではなく、本来の意味での機械翻訳が必要になります。
さらに、モデルは動きを「見る」必要があります。手話は手や腕だけでなく、上体や頭、表情を同時に動かして意味を伝えます。これを高いフレームレートで正確に追いかけるのは、計算量の面でも負荷の大きい画像認識の課題です。かつて話題になった手話グローブのような装置が実用に届かなかったのは、手話が手で表す英語ではないという前提を取り違えていたためだと、Google DeepMindは整理しています。
映像ではなく骨格の座標だけをサーバーへ送る
SL2Tはカメラの映像そのものを扱いません。端末側で動くMediaPipe Holisticが手話をする人の体の各点、いわゆるポーズランドマークの位置を追跡し、その幾何座標の並びだけをサーバーへ送ります。元の映像は即座に破棄される設計で、プライバシー保護を意図した構成です。
翻訳の中身にも設計上の判断があります。従来の手話翻訳研究では、グロスと呼ばれる中間表記をいったん挟む方式が広く使われてきました。しかしグロスは、非手指標識や空間を使った構文といった手話特有の情報を落としてしまいます。SL2Tは座標列から直接テキストを生成することで、語彙の人為的な上限を取り払い、データ量に応じて翻訳品質が伸びる形にしています。
学習データは50を超える手話言語にわたる10万時間以上で、およそ4分の1がASLです。複数の言語や方言、習熟度を混ぜて同時に学習させたところ、単一言語のモデルを上回ったといいます。ASLから英語への翻訳品質を測るベンチマークFLEURS-ASLのsd-testでは、ゼロショットで70 BLEURTを記録し、これまで報告された数値を大きく上回りました。
実際に使わせるための地味な作り込み
ベンチマークの点数が高いことと、手元で使えることは別の話です。Google DeepMindは実運用に向けて、逐次表示の遅延を詰める、手話をしていない映像に対して勝手な文章を生成しないようにする、手話をする人のおよそ10パーセントを占める左利きでも精度が落ちないようにする、といった調整を重ねたとしています。スマートフォンをもう一方の手で持ったまま片手で手話をする場面への対応も、その1つです。
ろう者コミュニティと一緒に作るという姿勢
このプロジェクトは、ろう者のGoogle社員であるSam Sepah氏の発案から始まりました。データ収集はろう者のパートナーと進め、評価もろう者を対象としたユーザースタディで実施し、技術の影響評価にはろう者の専門家が加わっています。
さらに、世界のろう者団体や専門家が参加するAI Sign Language Advisory Committee(AISLAC)を設置し、SL2T 1.0のリリースに合わせて共同のインパクトレポートを公開しました。できることと現時点での限界を明示する内容で、今後の主要な手話関連リリースでも同じやり方を続けるとしています。
対応はASLと英語の組み合わせから始まりますが、Google DeepMindは対応言語と対応端末を広げるほか、テキストから手話を生成する方向にも取り組むとしています。
まとめ
Google DeepMindが公開したSL2Tは、手話をグロスを介さず直接テキストへ翻訳するモデルで、Pixel 11のGboardとLive Transcribeに追加費用なしで組み込まれました。50以上の手話言語にわたる10万時間超のデータで学習し、FLEURS-ASLのsd-testでゼロショット70 BLEURTを記録しています。端末側で抽出した骨格座標だけを送る構成や、左利き・片手手話への配慮など、実際に使わせるための作り込みが目立つ内容です。対応はASLから英語への1組だけで、対応端末もPixel 11に限られますが、手話AIが製品として世に出た最初の例になります。