OpenAIが、自社初のカスタム推論チップ「Jalapeño」の最初の測定結果を公開しました[1]。公開ベンチマークで既存の商用システムと比べたところ、消費電力あたりの処理量で1.5〜1.9倍、応答が返るまでの時間で1.7〜3.6倍の差が付いたとしています。スループットと低レイテンシーはどちらかを取ればどちらかが落ちる関係になりがちですが、そのトレードオフを1つのアーキテクチャーで抱え込まずに済んだ、というのが同社の主張です。
公開ベンチマークで3種類のモデルを実測
測定に使われたのは、SemiAnalysisが公開している推論ベンチマーク「InferenceX」です。AIへのリクエストを処理する一連の流れ全体を測る仕組みで、OpenAIはここでJalapeñoと市販の主要AIシステムを、高スループット寄りの運用から低レイテンシーの対話型運用まで幅広い動作点で比較しています[1]。
対象になったモデルはGPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1Tの3種類です。いずれも公開されているモデルで、OpenAI社内で作られたものと社外で作られたものが混ざっています。3モデルすべてでJalapeñoは電力あたり性能とレイテンシーの組み合わせが優位に立ち、パレートフロンティア(どちらかを犠牲にしなければ改善できない限界線)上に位置したとされています[1]。
数字で言うと、ピークスループット時の1ワットあたり処理量が1.5〜1.9倍、エンドツーエンドのレイテンシーが1.7〜3.6倍短縮です。対話性の高いワークロードに限れば2.1〜4.1倍の性能差が出たとしています。テストしたなかで最大規模のKimi K2.5 1Tでは、電力あたりのピーク性能が約1.5倍、エンドツーエンドのレイテンシーが約3.4倍短くなりました[1]。
社内でのフロンティアモデルによる検証では差がさらに開いたともあり、ワークロードが大きく重くなるほどこのアーキテクチャーの効きが良くなる、という読み方をしています。ただしこれは公開ベンチマークの外側にある社内測定で、第三者が追試できる形にはなっていません。
定格700ワットに対し、実測は550ワット以下
比較の前提として、OpenAIは「チップ1個あたり」ではなく「消費電力あたり」で並べるべきだという立場を取っています。各アクセラレーターの公称電力値で正規化した数値を出しており、Jalapeño自体は700ワット定格ながら、テストしたワークロードでの持続消費電力は550ワット以下にとどまったとしています[1]。
もっとも、これらはOpenAI自身が実施・公表した測定です。ベンチマーク自体が公開されている点は検証可能性を高めますが、比較対象となった「市販の主要AIシステム」の具体的な製品名は示されていません。数字の受け取り方には、その分の留保が必要です。
チップ・メモリー・ネットワークをまとめて設計する
Jalapeñoの出発点は、「現在と将来の言語モデル、とくに対話型エージェントを動かすことだけを仕事にするなら、どんなハードウェアを作るか」という問いだったと説明されています[1]。
言語モデルの推論は、性質の違う2つの局面を行き来します。プロンプトを読み込むプリフィルは計算量が支配的で、応答をトークン単位で生成するデコードはメモリー帯域に縛られます。加えて、コアやチップの間でデータが動くたびに遅延が生まれ、待っている間は演算器が遊びます。片方の局面だけ得意なシステムは、結局データの移動待ちでその優位を失うことになります。
そこでJalapeñoでは、データ移動と通信の遅延を最小化する方向に振っています。応答生成中に使うKVキャッシュを含むモデルの状態を明示的に配置してローカルに保持し、推論の局面ごとに演算・メモリー・ネットワークの適切な組み合わせを起こす、という考え方です。ネットワークもアーキテクチャーの一部として扱われ、大きなドメインを取ることでワークロード全体を1つの接続システム内に収め、リクエストの最初から最後まで速さと効率を保つ狙いがあります[1]。
設計にも運用にもAIが入り込んでいる
開発期間の短さもこのチップの特徴です。初期設計からテープアウトまで9カ月という工程で、OpenAIのモデルが実装案の探索や設計・測定・検証のループ短縮に使われました。演算回路の最適化にもAIが関わり、予定どおりのスケジュールでより多くの演算性能をチップに収められたとしています[1]。
Jalapeñoは、人間とAIの双方にとって扱いやすいプログラミング対象として設計されたとも書かれています。エンジニアはローカルなテンソル、明示的な通信、予測可能な同期という語彙で処理を記述し、AIはその処理をシステム全体にどう配置しスケジュールするかを最適化する、という分担です。
実例として挙がっているのが、当初の量産計画に含まれていなかったオープンウェイトの3モデルを、CodexとGPT-Astraを使って2カ月で高い性能まで持ち込んだ話です。GPT-OSSの一部のアテンション処理とMixture-of-Experts(複数の専門家モデルを切り替えて使う構成)ブロックでは、AIが生成した実装が人間の熟練エンジニアによる実装より1.5〜1.8倍高速に動いたとしています[1]。この数字はあくまで選定したブロック単体の話で、モデル全体の性能ではありません。
年内に自社インフラへ、NVIDIA製も引き続き使う
Jalapeñoは2026年6月24日に、Broadcomとの共同開発として発表されたチップです。設計から製造のテープアウトまでを9カ月で終えており、ボードやラック、システム面ではCelesticaが加わっています[2]。
配備については、年内にOpenAIの計算基盤へ投入を始める計画です。世代を重ねる前提のロードマップになっており、第2世代は開発が深く進行中、第3世代も形になりつつあるとしています[1]。現時点では量産に向けた品質確認、ソフトウェアの成熟、大規模運用の準備、より多くのモデルでの性能検証が続いている段階です。
自社チップに全面移行するという話ではない点も明記されています。学習と推論の双方でNVIDIAをはじめとするパートナーのアクセラレーターは引き続き広く展開する、というのが同社の説明です[1]。増え続ける需要に対しては、調達できる計算資源をあらゆる方面から積み上げる必要がある、という現実的な事情が背景にあります。
まとめ
OpenAIが自社初の推論チップJalapeñoの初期測定を公開し、公開ベンチマークInferenceX上で電力あたり性能1.5〜1.9倍、エンドツーエンドレイテンシー1.7〜3.6倍短縮という結果を示しました。プリフィルとデコードで性質が変わる言語モデル推論に合わせ、チップからネットワーク、ラック規模のシステムまでを一体で設計した点が効いているという説明です。年内に自社インフラへの配備が始まりますが、数字はOpenAI自身の測定であり、比較対象の詳細は示されていません。第2世代以降の進み方と、第三者による追試の有無が次の見どころになります。
出典[1]: https://openai.com/index/jalapeno-first-results
出典[2]: https://openai.com/index/openai-broadcom-jalapeno-inference-chip/
