OpenAI は 2026 年 5 月 7 日、リアルタイム音声向け API に 3 つの新しいモデルを追加すると発表しました。中核となる「GPT-Realtime-2」は GPT-5 と同等クラスの推論能力を備え、ライブ翻訳に特化した「GPT-Realtime-Translate」と、低遅延ストリーミング書き起こし用の「GPT-Realtime-Whisper」が同時にラインアップに加わります[1][2]。コンテキスト ウィンドウは 32K から 128K トークンに拡大され、対応言語や価格設定も明らかになりました[1][3]。

GPT-Realtime-2、推論レベルを 5 段階で切り替え可能に

GPT-Realtime-2 は、OpenAI が「初めて GPT-5 級の推論を音声モデルに持ち込んだ」と位置付ける新フラッグシップです。会話の流れを止めずに思考を続け、ツールを呼び出しながら応答を生成できる点が従来モデルとの違いとして挙げられています[1]。

主な強化点は次の通りです。まず、応答前に「ちょっと確認しますね」のような短いつなぎ文を返す「プリアンブル (preambles)」が利用可能になりました。複数のツールを同時に呼び出しつつ「カレンダーを見ています」「いま調べています」と進捗を声に出す並列ツール呼び出しと進捗の透明化、エラー時に黙り込まず「うまくいかないようです」と説明する復旧動作の改善も追加されています[1]。

さらにコンテキスト ウィンドウは 32K から 128K トークンに 4 倍化され、長時間のエージェント作業にも対応します[1][3]。推論レベルは minimal / low / medium / high / xhigh の 5 段階で、初期値は low です。簡単な応答は低レイテンシで、複雑な要求は高い推論レベルでより慎重に処理する切り替えが、開発者側で制御できる設計になりました[1]。

ベンチマークでは、推論能力を測る「Big Bench Audio」で前世代の GPT-Realtime-1.5 を 15.2% 上回り、複数ターンの対話インテリジェンスを評価する「Audio MultiChallenge」でも 13.8% 高いスコアを示したと公式に報告されています[1]。

70 言語入力の翻訳と低遅延 Whisper、棲み分けが明確に

GPT-Realtime-Translate は、70 を超える入力言語を 13 の出力言語に変換するライブ翻訳専用モデルです。話者の発話に追従しながら逐次翻訳することを想定しており、カスタマー サポートやクロスボーダー営業、教育、イベント、メディア、クリエイター プラットフォームなどで使われることを公式が想定として挙げています[1]。

インドの音声 AI スタートアップ BolnaAI は、ヒンディー語、タミル語、テルグ語の評価で「他のどのモデルよりも語誤り率 (WER) が 12.5% 低かった」とコメントしており、地域方言や音韻の差を含む実運用評価でも改善が確認できたとしています[1]。動画プラットフォームの Vimeo は、製品紹介動画を再生しながら同時に各国語へ翻訳できるユース ケースを公開しました[1]。

GPT-Realtime-Whisper は、話者の発話と並行して音声をテキストへ変換するストリーミング書き起こしモデルです。会議や授業の字幕、ライブ放送、コール センター記録、医療やリクルート領域での会話メモなど、リアルタイム性が要求されるワークフローへ組み込むことを想定した設計です[1]。

価格は 1 分単位、Zillow は対応難要件で正答率 95% を実現

3 モデルの価格は次の通りです。GPT-Realtime-2 は音声入力 100 万トークンあたり 32 ドル(約 4,992 円)、出力 100 万トークンあたり 64 ドル(約 9,984 円)です。キャッシュ済み入力は 100 万トークンあたり 0.40 ドル(約 62 円)に下げられています[1]。※1 ドル 156 円換算

GPT-Realtime-Translate は 1 分あたり 0.034 ドル(約 5.30 円)、GPT-Realtime-Whisper は 1 分あたり 0.017 ドル(約 2.65 円)で利用できます[1][3]。※1 ドル 156 円換算

実運用での効果について、米不動産プラットフォーム Zillow は、最も難易度の高い対応評価で「コール成功率がプロンプト最適化後に 26 ポイント上昇し、69% から 95% になった」と報告しています。住宅機会均等法 (Fair Housing) のコンプライアンス面でも従来比で頑健になったと、AI 担当 SVP の Josh Weisberg 氏が述べています[1]。

早期利用顧客としては Zillow に加え、Glean、Genspark、Bluejay、Intercom、Priceline、Foundation Health、ドイツテレコム、Vimeo、BolnaAI などが挙げられており、特にドイツテレコムは多言語カスタマー サポートでの活用を進めているとされています[1]。

利用は OpenAI の Realtime API 経由で、Playground での試用と Codex 経由の組み込み手順が公式に案内されています。EU データ レジデンシーや Agents SDK によるカスタム ガードレール追加にも対応しています[1]。

まとめ

OpenAI は GPT-Realtime-2 を中心とする 3 モデルで、音声 AI を「自然に会話できる」段階から「会話しながら推論し行動する」段階へと押し上げようとしています。128K トークンのコンテキストや 5 段階の推論調整、低価格化された翻訳・書き起こしモデルが同時に揃ったことで、対話エージェントだけでなく多言語サポートや業務メモ系プロダクトの設計にも影響が及びそうです。

出典:[1] OpenAI「Advancing voice intelligence with new models in the API」 https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/

出典:[2] OpenAI Developers Blog「Updates for developers building with voice」 https://developers.openai.com/blog/updates-audio-models

出典:[3] StreetInsider「OpenAI launches three new voice models for real-time applications」 https://www.streetinsider.com/Corporate+News/OpenAI+launches+three+new+voice+models+for+real-time+applications/26451629.html

出典:[4] The New Stack「OpenAI brings GPT-5-level reasoning to its speech models」 https://thenewstack.io/openai-gpt-5-level-speech/