OpenAI 于 7 月 23 日(美国时间)宣布,已更新 ChatGPT 桌面应用,新增可通过说话来操作的「ChatGPT Voice」。用户可以用语音向 AI 智能体下达指令,在电脑上完成各类任务。其底层依托本月推出的新语音模型系列「GPT-Live」,首先在 macOS 版和 Windows 版应用中提供。
能真正「动手干活」的桌面版
此前 ChatGPT 的语音功能以问答对话为主。这次的桌面版则可以用语音下达包含多个步骤的复杂指令,当 ChatGPT 需要确认时,用户也能用语音回应。它从单纯的语音聊天,升级为通过说话推进实际工作的操作方式。
ChatGPT Voice 同时支持面向日常业务的「ChatGPT Work」与编程助手「Codex」。它还能调用「计算机操作(computer use)」技能,自行到网站和应用中查找信息,因此从检索到执行都可以只靠语音完成。在 OpenAI 公开的演示视频中,开发者用一句话下达「新建一个线程、提交一个拉取请求,并找出某个缺陷的根本原因」的指令,ChatGPT 便完成了这一整套操作。
底层是能同时听与说的新模型「GPT-Live」
新功能所用的,是 OpenAI 本月推出的语音模型系列「GPT-Live(ChatGPT-Live)」。传统语音助手通常是「你说完我再答」的轮流方式。GPT-Live 对此做了改进,采用一边听一边说的全双工方式。它能在不打断对方的前提下插入「明白了」之类的附和,同时把耗时较长的复杂推理交给后台模型处理。由此在对话的自然度与处理的复杂度之间取得了平衡。
macOS 上还能参考屏幕内容,面向开发场景
macOS 版新增了名为「Appshots」的屏幕识别功能。在用户授权后,ChatGPT Voice 可以参考当前最前面的窗口及其显示内容(包括替代文本)。由于能结合本地文件和代码结构进行交流,其设想的用法是:开发者一边用语音讨论,一边让智能体并行推进实际处理。这接近于看着屏幕口头商量的体验,让人可以双手离开键盘继续推进工作。
至于 Codex,OpenAI 表示还可以通过 iOS 应用的远程访问,在外出时用语音进行操作。
与手机版的差异,以及竞争对手 Anthropic 的动向
ChatGPT Voice 的手机版虽然在对话流畅度、被打断时的处理自然度上有所提升,但并未设计成能在手机上实际代为操作。这次的桌面版更进一步,迈向「用语音执行任务」,这是二者的重要区别。
在语音代办这一方向上加码的并非只有 OpenAI。Anthropic 也革新了对话助手「Claude」的语音模式,让用户可在 Opus、Sonnet、Haiku 各模型中选择,并能用语音在 Gmail、Google 日历、Slack 等已连接的应用中完成操作。用语音下达指令、推进实际工作的助手,正成为各家清晰的竞争焦点。
总结
OpenAI 在 ChatGPT 桌面应用中新增了语音操作「ChatGPT Voice」,可用语音操控 ChatGPT Work 与 Codex 的智能体。其底层是能同时听与说的新模型「GPT-Live」,在 macOS 上还能参考屏幕内容。能够用语音下达多步骤指令、甚至把开发工作交给它,是它与以往的不同之处。围绕「用语音完成实际任务」的助手之争,连同 Anthropic 的动向,正日趋激烈。
