谷歌为 macOS 版 Gemini 应用加入了全新的语音功能[1]。长按 Fn 键,就能在正在使用的任意窗口里直接说话。默认情况下它作为智能语音输入工作,把口语整理成通顺的文字后落到光标处;在设置中再打开一个开关,Gemini 还能读取屏幕上的内容,完成总结、改写乃至生成图片。该功能已开始面向全球以英文推送。
不必再切换到聊天窗口
以往向 AI 助手提问,通常要先离开手头的工作,切换到单独的聊天窗口。这次更新正是冲着这段绕路而来。谷歌表示,macOS 版 Gemini 应用的设计初衷就是不打断使用者的工作节奏,这次的语音功能延续了同一思路[1]。
唤起方式是长按 Fn 键,在 macOS 的任何位置都能生效,屏幕底部会浮现一个带波形的小型胶囊状面板。此外,在 Ask Gemini 输入框末尾新增的屏幕共享按钮同样可以调用[2]。
自动去掉"嗯""啊"的语音输入
默认启用的是智能语音输入。它不会逐字照搬,而是自动去掉"嗯""啊"之类的语气词,并识别说到一半改口的部分,保留真正想表达的内容。整理好的文字会直接插入当前光标位置[1]。
这一表现与谷歌在手机端提供的 Gboard Rambler 相当接近[2]。相比严格的口述记录,它更适合思路尚未成形时先说出来,再拿回一段可读的文字。
屏幕推理需要手动开启
若想使用更进一步的能力,需要在设置中启用 Gemini 推理。该选项默认关闭,须由使用者自行打开[1]。开启后,Gemini 可以理解屏幕上的上下文,代为完成包含多个步骤的任务。
谷歌列举了 3 种用途。第一是提取与总结信息,选中桌面上的文件、图片或文档后,用口头方式说明所需的形式。官方给出的例子是"读一下这些兽医资料,把我家狗的病史整理成发给宠物寄养店的邮件"。第二是撰写与改写文本,选中屏幕上任意位置的文字,用语音改变措辞或语气,再把成稿放到需要的地方。第三是生成与编辑图片,可以参照手头的插图提出"做一个深色模式版本"这类要求[1]。
3 种用途的共同点,都是把屏幕上的选中对象与口头指令结合起来。由于前提是让 Gemini 读取屏幕内容,默认关闭的设计是合理的取舍。
推送范围与所需版本
该语音功能正以英文向 macOS 版 Gemini 应用的全部用户全球推送,更多语言将陆续加入[1]。使用前需要把应用更新到 1.88 版[2],应用本身可从谷歌的下载页面获取[1]。
这项功能曾在 2026 年 5 月的 Google I/O 2026 上先行展示,此次属于正式推送[2]。macOS 系统自带语音输入由来已久,但并不会去除语气词,也无法结合屏幕上的上下文执行指令。谷歌这次是在应用层面补上了这段差距。
总结
macOS 版 Gemini 应用新增了长按 Fn 键唤起的语音功能。默认状态下,它会去掉语气词并把整理后的文字插入光标位置;在设置中启用推理后,还能以屏幕上的文件、文字和图片为对象,用语音完成总结、改写和图片编辑。目前正以英文在全球推送,需要 1.88 及以上版本。
来源[1]:https://blog.google/innovation-and-ai/products/gemini-app/speak-naturally-gemini-app-mac-os/
来源[2]:https://9to5google.com/2026/07/29/gemini-mac-voice-control/
