OpenAIは2026年9月10日、聞き取りと発話を同時にこなせる音声AIモデル「GPT-Live-1」をAPIで一般提供すると発表しました。音声認識・応答生成・音声合成という3つの工程を1つのモデルに統合し、人間同士の会話に近い間合いや割り込みを扱えるのが特徴です。電話予約やカスタマーサポートなど、実際の音声業務での利用を見据えた設計になっています。

音声認識から応答生成、音声合成までを1つのモデルで完結

これまでの音声AIエージェントの多くは、音声をテキストに変換するモデル、内容を理解して返答を考えるモデル、テキストを音声に戻すモデルを別々に組み合わせて動かしていました。工程ごとにモデルが分かれているため、話者が発言を終えるまで次の処理が始まらず、間延びした反応や不自然な割り込みが起きやすいという課題がありました。

GPT-Live-1は、この3つの工程を単一のモデルに統合したフルデュプレックス方式を採用しています。入力される音声と出力する音声を同時に処理できるため、相手の発話を遮ってでも訂正や相槌を挟むといった、人間の会話に近いやり取りが可能になりました。込み入った質問や複雑な作業が必要な場面では、会話そのものはGPT-Live-1が担いながら、推論部分だけを上位モデルであるGPT-6 Astraなどのバックエンドに委ねる仕組みも用意されています。

応答の速さと自然さが大きく向上

OpenAIが公開した評価結果によると、会話の同時進行性を測る指標において、GPT-Live-1は従来モデル比で30ポイントの改善を示しました。話者交代までの反応時間も、従来モデルの1.41秒から0.798秒までおよそ半分に短縮されています。音声エージェントの実務対応力を測るタスクでは正答率が45.7パーセントから86.2パーセントへ伸びており、実際に導入した企業からも、考え込む間の沈黙による相手からの割り込みがおよそ80パーセント減ったとの報告が上がっています。

電話対応から語学学習まで、幅広い用途を想定

想定される利用シーンは幅広く、飲食店の予約受付やコールセンターでの顧客対応、銀行窓口業務、語学学習の会話練習、医療機関での患者対応などが挙げられています。実際に、住宅・医療分野向けにAIを提供する企業では予約対応の現場に導入され、コード量を大幅に削減しながら電話応対の品質を高められたと報告されています。飲食店向けサービスでは注文や予約の電話対応で自然な会話を実現できたとの声もあり、ソフトウェア開発を支援するAIエージェントとの連携事例も出てきています。

料金はAPI経由の音声インターフェース部分について1分あたり0.05ドル(約7.7円)で、推論を担当するバックエンドモデルの利用料は別途かかります※1ドル154円換算(2026年9月15日時点)。トーンや話す速さはシステムプロンプトから調整でき、長時間の会話でも文脈を保持し続けられる点も業務利用を意識した設計といえます。

声のバリエーションと電話連携にも対応

提供される音声の種類も拡充され、複数のアクセントや話し方の異なるバリエーションから選べるようになりました。電話回線との連携機能も備えており、既存の電話システムに音声エージェントを組み込みたい企業にとって導入のハードルを下げる要素になりそうです。長い沈黙や周囲の環境音を適切に処理し、無駄な相槌を挟まずに会話を継続できる点も、これまでの音声AIとの違いとして挙げられます。

まとめ

GPT-Live-1は、音声認識・推論・音声合成を別々のモデルでつなぐ従来の方式から、1つのモデルで同時に処理するフルデュプレックス方式へと踏み込んだ音声AIです。反応速度と会話の自然さを大きく高めたことで、電話対応や予約受付といった実務での音声AI活用が、これまで以上に現実的な選択肢になりそうです。