Googleは、macOS向けGeminiアプリに音声で操作する新しい機能を追加しました[1]。Fnキーを長押しすると、デスクトップのどのウィンドウにいても、そのまま話しかけられます。既定では話した内容を整えて文字に起こす音声入力として動き、設定を切り替えると画面に映っているものを読み取って要約や書き換え、画像の生成まで引き受けます。まずは英語から、世界中の利用者へ順次配信されています。
アプリを切り替えずに話しかける
これまでAIアシスタントに何かを頼むには、作業中の画面からいったん離れて、チャットのウィンドウへ移動する必要がありました。今回の更新は、その移動そのものをなくす方向に振られています。GoogleはmacOS版のGeminiアプリを、作業の流れを止めないために作ったと説明しており、今回の音声機能もその延長線上にあります[1]。
起動の合図はFnキーの長押しです。macOSのどこにいても押した瞬間に受け付ける仕組みで、画面の下部には波形を表示する小さな横長のパネルが現れます。「Ask Gemini」の入力欄の末尾に追加された画面共有ボタンからも呼び出せます[2]。
「えーと」を落として整えてくれる音声入力
既定で有効になるのは、賢い音声入力の方です。話した言葉をそのまま書き起こすのではなく、「えーと」や「あの」といった言い淀みを自動で取り除き、途中で言い直した部分も後から言った内容を拾ってくれます。整えられた文章は、その時点のカーソル位置へそのまま挿入されます[1]。
この挙動は、Googleがスマートフォン向けに用意しているGboardのRamblerに近いものです[2]。口述筆記というより、頭の中で固まりきっていない話を投げると読める文章になって返ってくる、という使い方に向いています。
画面を読み取らせる推論は任意で有効化
もう1段階上の使い方を望む場合は、設定からGeminiの推論を有効にします。こちらは既定では無効で、利用者が自分で切り替える形になっています[1]。有効にすると、Geminiが画面上の文脈を理解したうえで、いくつもの手順を含む作業を代行できるようになります。
Googleが挙げているのは3つの用途です。1つ目は情報の抽出と要約で、デスクトップ上のファイルや画像、書類を選択したうえで、必要な形を口頭で伝えます。公式の例では「これらの獣医の書類を読んで、犬の病歴をペットホテル宛のメールにまとめて」という指示が示されています。2つ目は文章の作成と書き換えで、画面上のどこにあるテキストでも選択して、口頭で言い回しやトーンを変えさせ、仕上がったものを必要な場所へ落とし込めます。3つ目は画像の生成と編集で、手元のイラストを参照させながら「これのダークモード版を作って」といった指示を出せます[1]。
いずれも、選択した対象と口頭の指示を組み合わせる点が共通しています。画面の内容をGeminiに読ませることが前提になるため、既定で無効という設計は妥当なところでしょう。
配信状況と必要なバージョン
この音声機能は、macOS版Geminiアプリのすべての利用者に向けて、英語で世界的に配信が進んでいます。対応言語は今後追加される予定です[1]。利用するにはアプリをバージョン1.88へ更新しておく必要があります[2]。アプリ自体はGoogleの配布ページから入手できます[1]。
なお、この機能は2026年5月のGoogle I/O 2026で先行して披露されていたもので、今回が正式な配信開始にあたります[2]。macOSにはOS標準の音声入力が以前からありますが、言い淀みの除去や画面の文脈を踏まえた指示までは踏み込んでいません。その差をアプリ側で埋めにきた格好です。
まとめ
macOS版のGeminiアプリに、Fnキーの長押しで呼び出せる音声機能が追加されました。既定では言い淀みを取り除いて整えた文章をカーソル位置へ挿入する音声入力として働き、設定で推論を有効にすると、画面上のファイルやテキスト、画像を対象にした要約・書き換え・画像編集まで口頭で指示できます。配信は英語圏から世界的に進行中で、バージョン1.88以降が必要です。
出典[1]:https://blog.google/innovation-and-ai/products/gemini-app/speak-naturally-gemini-app-mac-os/
出典[2]:https://9to5google.com/2026/07/29/gemini-mac-voice-control/
