Google 為 macOS 版 Gemini 應用程式加入了全新的語音功能[1]。長按 Fn 鍵,就能在正在使用的任何視窗裡直接開口說話。預設情況下它以智慧語音輸入的形式運作,把口語整理成通順的文字後放進游標位置;若在設定中再打開一個開關,Gemini 還能讀取畫面上的內容,完成摘要、改寫甚至產生圖片。目前已開始以英文向全球推送。
不必再切換到聊天視窗
過去要請 AI 助理幫忙,通常得先離開手邊的工作,切換到另一個聊天視窗。這次的更新正是針對這段繞路而來。Google 表示,macOS 版 Gemini 應用程式的設計初衷就是不打斷使用者的工作節奏,這次的語音功能延續了同樣的思路[1]。
啟動方式是長按 Fn 鍵,在 macOS 的任何位置都能生效,畫面下方會浮現一個帶有波形的小型膠囊狀面板。另外,Ask Gemini 輸入框末端新增的畫面分享按鈕同樣可以叫出這項功能[2]。
會自動濾掉贅詞的語音輸入
預設啟用的是智慧語音輸入。它不會逐字照搬,而是自動濾掉「嗯」「啊」這類贅詞,並辨識說到一半改口的部分,保留真正想表達的內容。整理好的文字會直接插入目前的游標位置[1]。
這樣的表現與 Google 在手機端提供的 Gboard Rambler 相當接近[2]。比起嚴謹的口述記錄,它更適合思緒尚未成形時先說出來,再拿回一段可讀的文字。
畫面推理需要自行開啟
想使用更進一步的能力,就得在設定中啟用 Gemini 推理。這個選項預設為關閉,必須由使用者自行打開[1]。啟用之後,Gemini 可以理解畫面上的脈絡,代為完成包含多個步驟的工作。
Google 舉出 3 種用途。第一是擷取與摘要資訊,選取桌面上的檔案、圖片或文件後,用口頭說明需要什麼樣的成果。官方範例是「讀一下這些獸醫檔案,把我家狗的病史整理成寄給寵物旅館的郵件」。第二是撰寫與改寫文字,選取畫面上任何位置的文字,用語音改變用詞或語氣,再把成稿放到需要的地方。第三是產生與編輯圖片,可以指著手邊的插圖提出「做一個深色模式版本」這類要求[1]。
3 種用途的共同點,都是把畫面上選取的對象與口頭指令結合起來。由於前提是讓 Gemini 讀取畫面內容,預設關閉的設計算是合理的取捨。
推送範圍與所需版本
這項語音功能正以英文向 macOS 版 Gemini 應用程式的所有使用者全球推送,更多語言也將陸續加入[1]。使用前需要將應用程式更新到 1.88 版[2],應用程式本身可從 Google 的下載頁面取得[1]。
這項功能曾在 2026 年 5 月的 Google I/O 2026 上先行亮相,這次屬於正式推送[2]。macOS 系統內建的語音輸入行之有年,但並不會濾掉贅詞,也無法結合畫面上的脈絡執行指令。Google 這次是在應用程式層面補上了這段落差。
總結
macOS 版 Gemini 應用程式新增了長按 Fn 鍵叫出的語音功能。預設狀態下,它會濾掉贅詞並把整理後的文字插入游標位置;在設定中啟用推理後,還能以畫面上的檔案、文字與圖片為對象,用語音完成摘要、改寫與圖片編輯。目前正以英文在全球推送,需要 1.88 以上的版本。
來源[1]:https://blog.google/innovation-and-ai/products/gemini-app/speak-naturally-gemini-app-mac-os/
來源[2]:https://9to5google.com/2026/07/29/gemini-mac-voice-control/
