OpenAIは7月23日(米国時間)、ChatGPTのデスクトップアプリを更新し、音声で操作する「ChatGPT Voice」を追加したと発表しました。声でAIエージェントに指示を出し、パソコン上の作業を進められるのが特徴です。土台となるのは今月公開した新しい音声モデル群「GPT-Live」で、まずはmacOS版とWindows版のアプリから利用できます。
声で「作業」まで任せられるデスクトップ版
これまでのChatGPTの音声機能は、質問に答えてもらう対話が中心でした。今回のデスクトップ版では、声で複数の手順を含む複雑な指示を出し、ChatGPTが確認を求めてきたときには声で答える、という往復ができます。単なる音声チャットから、声で実際の作業を前に進める操作手段へと、役割が一段広がった形です。
ChatGPT Voiceは、業務向けの「ChatGPT Work」と、コーディング支援の「Codex」の両方と連携します。さらに、ウェブサイトやアプリを自分で調べにいく「コンピュータ操作(computer use)」のスキルも呼び出せるため、調べ物から実行までを声だけで任せられます。OpenAIが公開したデモ動画では、開発者が「新しいスレッドを作り、プルリクエストを出し、あるバグの根本原因を突き止めて」と一度に指示すると、ChatGPTがその一連の作業をこなす様子が示されました。
土台は同時に聞いて話す新音声モデル「GPT-Live」
新機能が使うのは、OpenAIが今月公開した音声モデル群「GPT-Live(ChatGPT-Live)」です。従来の音声アシスタントは、利用者が話し終えるのを待ってから応答する交互のやり取りが基本でした。GPT-Liveはこの仕組みを見直し、聞くことと話すことを同時に行う全二重(フルデュプレックス)方式を採ります。相手の話をさえぎらずに「なるほど」といった相づちを挟みつつ、時間のかかる複雑な思考は背後のモデルに任せる設計です。これにより、会話の自然さと処理の重さを両立させています。
macOSでは画面の中身も参照、開発現場を想定
macOS版では、「Appshots」と呼ぶ画面認識の機能が加わりました。利用者が許可すると、ChatGPT Voiceは今開いている最前面のウィンドウや、そこに表示されている内容(代替テキストを含む)を参照できます。手元のファイルやコードの構成を踏まえたやり取りができるため、開発者が声で相談しながら、エージェントに実際の処理を並行して進めさせる、といった使い方が想定されています。画面を見ながら口頭で相談する感覚に近く、キーボードから手を離したまま作業を進められる点が新しいところです。
Codexについては、iOSアプリからのリモートアクセスを通じて、外出先でも音声で操作できるとしています。
スマホ版との違いと、競合Anthropicの動き
ChatGPT Voiceのスマートフォン版は、会話の滑らかさや、話に割り込まれたときの処理の自然さは向上していたものの、スマホ上で実際の操作を代行する作りにはなっていませんでした。今回のデスクトップ版は、そこから一歩進んで、声で作業を実行することに踏み込んだ点が大きな違いです。
音声で作業を任せる方向性を強めているのは、OpenAIだけではありません。Anthropicも対話アシスタント「Claude」の音声モードを刷新し、Opus・Sonnet・Haikuの各モデルを選べるようにしたうえで、GmailやGoogleカレンダー、Slackといった連携アプリ上の作業を声でこなせるようにしています。声で指示して実務を前に進めるアシスタント、という競争軸が各社ではっきりしてきました。
まとめ
OpenAIは、ChatGPTのデスクトップアプリに音声操作「ChatGPT Voice」を追加し、声でChatGPT WorkやCodexのエージェントを動かせるようにしました。土台は同時に聞いて話す新モデル「GPT-Live」で、macOS版では画面の内容も参照できます。声で複数の手順にわたる指示を出し、開発作業まで任せられる点が従来との違いです。音声で実務を進めるアシスタントをめぐる競争は、Anthropicの動きも含めて一段と本格化しています。
