OpenAIは2026年7月8日(米国時間)、音声AIの新世代モデル「GPT-Live」を発表しました[1]。聞くことと話すことを同時にこなす全二重(フルデュプレックス)構造を採用し、相づちや自然な割り込みを含む、人と話しているような会話体験を実現します。同日からChatGPTの音声機能「ChatGPT Voice」の新しい基盤として全世界で順次展開が始まっており、複雑な質問は裏側でGPT-5.5に委ねながら、会話そのものは途切れさせない設計になっています[1]。
「聞きながら話す」全二重アーキテクチャ
これまでの音声AIは、大きく2つの世代に分けられます。初代のChatGPT Voiceは、音声認識・大規模言語モデル・音声合成という3つのモデルを直列につなぐカスケード方式で、応答が遅くぎこちないという課題がありました。続くAdvanced Voice Modeでは1つのモデルで音声を直接処理するようになり、遅延は減ったものの、ユーザーが話し終えるのを待ってから応答するターン制のままでした。無音でターンの終わりを判定するため、考え込んだだけの短い沈黙や周囲の雑音を「話し終わり」と誤解し、不自然なタイミングで割り込んでしまう問題も残っていました[1]。
GPT-Liveはこの制約を全二重構造で解消します。入力の処理と出力の生成を連続的に並行して行うため、話すか、聞き続けるか、黙るか、割り込むか、ツールを呼ぶかといった判断を1秒間に何度も下せます。会話中に「うんうん」といった相づちで聞いていることを示したり、ユーザーが考えをまとめる間は静かに待ったりと、テンポの良いやり取りが可能になりました。時間感覚の把握が向上したことで、ライブ翻訳のような使い方もできるとしています[1]。
深い処理はGPT-5.5へ委任、会話は止めない
もう1つの柱が、会話と「深い作業」の分離です。ウェブ検索や込み入った推論、エージェント的な処理が必要な質問では、GPT-Liveが裏側でGPT-5.5などのフロンティアモデルにタスクを委任し、結果が出るまでの間も会話を続けられます。委任先のモデルは今後の新モデル公開に合わせて順次更新されるため、自然な対話と最新の知能を両立できる構造です[1]。
性能面では、5〜10分の実会話でAdvanced Voice Modeとの比較評価を行い、会話の流れ・ターンテイキング・自然さなどの総合的な好ましさでGPT-Liveが強く支持されたとしています。専門レベルの科学的推論を測るGPQAや、エージェント的なウェブ検索能力を測るBrowseCompでも大幅な性能向上を示しました[1]。
ChatGPT Voiceはこう変わる
ChatGPTでは毎週1億5,000万人以上が音声機能や音声入力を利用しており、今回の刷新はその体験全体に及びます。話の途中での質問や、ゆっくり話してほしいという依頼にも柔軟に応じ、9種類の音声もGPT-Live向けにリマスターされました。応答の考える深さはInstant(即答)・Medium・Highの3段階から選べます[1]。
聞き取りの面では、ユーザーが考え込んでいるときに割り込まず待つようになり、「静かに聞いていて」という指示にも従います。通行音や近くの会話といった背景雑音があっても、ユーザーの声に集中しやすくなりました。さらに、天気・株価・スポーツなどの話題では、会話しながらビジュアルカードで情報を表示できるようになっています[1]。
音声専用の安全対策と提供範囲
リアルタイムに会話が進む音声ならではの安全設計も特徴です。発話中に問題のある出力を検知すると、より安全な応答へ誘導したり、注意喚起や相談窓口の情報を表示したり、リスクの高いケースでは会話を終了したりできます。10代のユーザー向けには年齢に応じた振る舞いをモデル自体に学習させたほか、保護者がペアレンタルコントロールで音声機能の利用可否を選べます。実在する人物の声の模倣を防ぐ仕組みも組み込まれており、用意された音声のみを使用します[1]。
提供は、iOS・Android・ウェブ版ChatGPTで順次進行中です。Go・Plus・Proユーザーには標準モデルとしてGPT-Live-1が、無料ユーザーにはGPT-Live-1 miniが既定で適用されます。API提供も近日中に予定されています。なお、発表時点では音声とビデオ・画面共有の併用には未対応で、一部の言語では訛りや流暢さに課題が残るとしており、従来のStandard・Advanced Voice Modeも引き続き利用できます[1]。
まとめ
GPT-Liveは、ターン制の音声対話から「聞きながら話す」連続的な対話への転換点となる発表です。会話の自然さと、裏側のフロンティアモデルによる知能を分離して両立させた設計は、今後の音声エージェントの標準になりそうです。まずは手元のChatGPTで、相づちを打ちながら話を聞いてくれる新しいVoiceを試してみてはいかがでしょうか。
