Googleは、話した言葉をほぼリアルタイムで別の言語の音声に変換する新しい音声翻訳モデル「Gemini 3.5 Live Translate」の提供を始めたと発表しました[1]。70を超える言語を自動で判別し、話し手の抑揚や話す速さ、声の高さを保ったまま自然な翻訳音声を生成するのが特徴です[1]。Google翻訳アプリやGoogle Meet、開発者向けAPIを通じて、同日から順次使えるようになります[1]。
「話しながら訳す」連続翻訳の仕組み
Gemini 3.5 Live Translateは、音声を音声のまま翻訳する(speech-to-speech)最新の音声モデルです[1]。Googleによると、入力された音声から70以上の言語を自動で検出し、なめらかで自然な翻訳音声を作り出します[1]。
従来の多くの仕組みは、話し手が話し終えるのを待ってから訳す「ターン制」でした[1]。これに対して3.5 Live Translateは音声を途切れず連続して生成し続けます[1]。文脈を待って翻訳の質を高めることと、すぐに訳して話し手に追従することのバランスを取りながら処理するため、不自然な間が空かず、セッションの間ずっと話し手から数秒遅れる程度に収まるとしています[1]。
Googleは、翻訳が同社の機械学習の初期からの取り組みであり、現在では各製品を通じて毎月10億人規模のユーザーに向けて1兆語を超える翻訳を提供していると説明しています[1]。
開発者・企業・一般への段階的な提供
Gemini 3.5 Live Translateは、Googleの各製品を通じて同日から順次展開されます[1]。提供形態は利用者の種別ごとに分かれています[1]。
開発者向けには、Gemini Live APIとGoogle AI Studioを通じてパブリックプレビューとして公開されます[1]。企業向けには今月から、Google Meet上でプライベートプレビューが始まります[1]。そして一般のユーザーは、Android版とiOS版のGoogle翻訳アプリから利用できます[1]。
ノイズに強く、多言語入力にも対応
開発者にとっての強みは、ストリーミングされる音声をそのまま処理できる点だとされています[1]。設定を手動で切り替えなくても複数言語の入力を扱えるうえ、雑音への耐性があるため、騒がしく予測しづらい環境でも動作するといいます[1]。Googleは、多言語の通話や会議、授業、放送といった場面での同時通訳に活用できると説明しています[1]。
Gemini Live APIを使うことで、Agora、Fishjam、LiveKit、Pipecat、Vision Agentsといった開発者向けプラットフォームが、音声翻訳アプリの構築と公開を容易にします[1]。これらの連携がリアルタイムのメディア配信基盤という複雑な部分を引き受けるため、開発者は利用体験の作り込みに集中できるとしています[1]。
実証も始まっています。配車サービスのGrabは、乗車の合流時にドライバーと利用者がほぼリアルタイムで多言語のやり取りができるよう、このモデルを試験的に使っているとのことです[1]。Grabの利用者は同サービスを通じて月間1,000万件を超える音声通話を行っているといいます[1]。このほかCJ ENMやLiveKitなども、翻訳の品質や精度、遅延の小ささを評価する声を寄せていると紹介されています[1]。
Google MeetとGoogle翻訳アプリでの体験
Google Meetの音声翻訳も、近くこの3.5 Live Translateを使うようになります[1]。対応言語はこれまでの5言語から70言語以上へと広がり、1回の会議で2,000を超える言語の組み合わせに対応します[1]。従来は英語との間の翻訳に限られていましたが、その制限が取り払われる形です[1]。音声翻訳にすぐアクセスできるよう、画面の表示も更新されます[1]。この更新は今月から一部の法人向けGoogle Workspace利用者にプライベートプレビューとして提供され、より広い展開は年内に予定されています[1]。
Google翻訳アプリでは、AndroidとiOSの両方で世界的に展開されます[1]。Live translate機能を使う際は、手持ちのイヤホンをつなぐだけで、話し手の口調を反映した翻訳を70言語以上で体験できるとしています[1]。
Androidでは、新たに「リスニングモード(listening mode)」の提供も始まります[1]。これは、翻訳音声をスマートフォンの受話口から直接聞ける機能です[1]。通常の通話と同じように端末を耳に当てると、訳された音声がそのまま流れてくる仕組みで、イヤホンが手元になく、周囲に聞かれずに素早く翻訳を確認したい場面で役立つとしています[1]。
生成音声には電子透かし「SynthID」
Gemini 3.5 Live Translateが生成する音声には、すべて電子透かしの「SynthID」が付与されます[1]。これは音声の出力に直接織り込まれる、人には知覚できない透かしです[1]。AIが生成した内容を検出できるようにしておくことで、誤情報の拡散を防ぐ狙いがあるとGoogleは説明しています[1]。安全性や責任ある提供に関する考え方については、同社がモデルカードで示しています[1]。
まとめ
Gemini 3.5 Live Translateは、話し手の声の調子を保ったまま70言語以上を連続して訳す、Googleの新しい音声翻訳モデルです。開発者向けのAPI、Google Meet、Google翻訳アプリという複数の入り口から段階的に提供され、会議や通話、旅行先での会話など、言語の壁が課題となる場面での実用が見込まれます。生成音声にはSynthIDの透かしが付き、安全面にも配慮した設計となっています。
出典:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-live-3-5-translate/
