Google が 2026年8月26日(現地時間)、音声認識モデル「Gemini 3.5 Transcribe」を発表しました。単に音声を文字に置き換えるのではなく、言い直しや「あー」「えーっと」といった意味のない間投詞を取り除き、書式まで整えた状態でテキストを返すのが特徴です。開発者向けには2種類のAPIで公開され、Android の Gboard や macOS 版 Gemini アプリなど、一般ユーザーが触れる場所にもすでに入り込んでいます。
「聞き取る」だけでなく「整える」方向へ
従来の音声認識は、背景ノイズ、業界固有の専門用語、そして話し言葉特有の乱れに弱いという弱点を抱えてきました。Gemini 3.5 Transcribe はそこを正面から狙ったモデルで、生の音声から直接、整形済みのテキストを生成します。
わかりやすいのは自己修正への対応です。「火曜に会いましょう、いや水曜で」と言い直した場合、そのまま両方を書き起こすのではなく、話者の意図をくんだ形に落とし込みます。フィラー(つなぎ言葉)の削除や自動整形も同様で、書き起こし後に人が手直しする工程を減らす設計といえます。
もう1つ、独自の語彙をあらかじめ登録しておけば、社内用語や特殊なつづりにも追随します。郵便番号や注文番号のような英数字混じりの文字列を、雑音の多い環境でも正確に拾えると説明されています。
用途で分かれる2つのAPI
提供形態は開発ワークフローに合わせて2系統に分かれています。
リアルタイム系は Live API で、モデル名は gemini-3.5-transcribe-live です。1秒未満のレイテンシで双方向のストリーミングを継続でき、音声エージェントやライブ字幕のような対話型の用途を想定しています。
録音済み音声を扱うのが Interactions API で、こちらは gemini-3.5-transcribe を使います。会議の録音やコールログを話者ごとに切り分け、単語単位のタイムスタンプ付きで書き起こします。話者識別は3人までが正式対応で、4人以上は実験的な扱いです。対応言語は自動判別込みで85以上あり、地域なまりや方言も想定に入っています。
さらに、macOS 版 Gemini アプリでは関数呼び出し(Function Calling)が利用でき、画像生成やファイル分析といった重い処理を裏側の別モデルへ委譲できます。音声入力が「文字を打つ手段」から「操作の入口」へ寄っていく流れが見て取れます。
精度と速度は Chirp 3 から一段上へ
数字の面では、Artificial Analysis の計測で平均単語誤り率(WER)がストリーミング時4.0パーセント、非ストリーミング時2.6パーセントとされています。多言語ベンチマークの FLEURS では、主要な言語・ロケールを対象にストリーミング時5.50パーセント、非ストリーミング時5.04パーセントという値でした。
先代にあたる文字起こしモデル Chirp 3 との比較では、最終的な書き起こしが確定するまでの時間が70パーセント短縮されたと説明されています。精度の改善幅だけでなく、この待ち時間の短さがリアルタイム用途では効いてきそうです。
なお WER は数値が低いほど優秀という指標で、測定条件や音源によって振れ幅が出ます。公表値はあくまで特定の測定環境での結果として受け止めておくのが妥当でしょう。
すでに触れる場所と、これから広がる場所
一般ユーザー向けには、Android の Gboard に搭載された新機能 Rambler が入口になります。話した内容を整形済みのテキストに変換し、音声で編集や誤字修正、文体変更まで指示できます。提供は一部の国と言語からです。
macOS 版 Gemini アプリでは英語で利用でき、画面の内容と組み合わせた音声コマンドが使えます。ローカルファイルの要約やアプリをまたいだテキストの再利用、カーソル位置での画像生成といった操作を、声だけで完結させる構想です。Chrome への搭載も近日中とされており、Web上の任意の入力欄で音声入力できるようになります。
開発者と企業向けはいずれもパブリックプレビュー段階です。開発者は Google AI Studio 経由の Gemini API と Google Antigravity から、企業は Gemini Enterprise Agent Platform から試せます。Gemini Enterprise for Customer Experience への提供も予定されています。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents といった開発基盤側も Live API 経由での対応を進めており、リアルタイム配信の作り込みを各社に任せられる環境が整いつつあります。
まとめ
Gemini 3.5 Transcribe は、認識精度の数字だけでなく、フィラー除去や自動整形といった「後工程の削減」に踏み込んだ音声認識モデルです。非ストリーミングでWER2.6パーセント、85言語以上への対応、Chirp 3 比で70パーセント短縮された確定までの時間と、実用面の材料はひととおり揃っています。Gboard や macOS 版 Gemini アプリで先に体験できるので、まずは自分の話し方でどこまで整うのかを試してみるのが手っ取り早そうです。
