OpenAI 公開了自家首款客製推論晶片 Jalapeño 的首批測試結果[1]。在公開基準測試中與既有商用系統相比,這款晶片在單位功耗完成的 AI 工作量上高出 1.5 至 1.9 倍,端到端延遲則縮短 1.7 至 3.6 倍。輸送量與低延遲通常難以兼顧,但 OpenAI 表示,單一架構同時做到了兩者,不必在其中取捨。
以公開基準實測 3 款模型
測試採用的是 SemiAnalysis 公開的推論基準 InferenceX,衡量的是處理一次 AI 請求的完整流程。OpenAI 在從高輸送量服務到高互動、低延遲使用的整個測試運作區間內,將 Jalapeño 與市面上主要的商用 AI 系統進行比較[1]。
受測模型共 3 款:GPT-OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T,皆為公開模型,其中既有 OpenAI 內部開發的成果,也有外部開發的模型。在這 3 款模型上,Jalapeño 在每瓦效能與延遲的組合上都占上風,位於柏拉圖前緣(不犧牲其中一項就無法改善另一項的臨界線)之上[1]。
以數字來看,尖峰輸送量時的每瓦工作量提升 1.5 至 1.9 倍,端到端延遲縮短 1.7 至 3.6 倍。若只看互動性較強的工作負載,效能差距擴大到 2.1 至 4.1 倍。在受測規模最大的 Kimi K2.5 1T 上,每瓦尖峰效能約為 1.5 倍,端到端延遲約縮短 3.4 倍[1]。
OpenAI 另提到,在內部前沿模型上的測試中優勢進一步拉開,意味著工作負載越大、要求越高,這套架構的效益越明顯。不過這部分屬於公開基準之外的內部測量,外界無法複驗。
額定 700 瓦,實測持續功耗在 550 瓦以內
在比較基準上,OpenAI 主張應以單位功耗而非單顆晶片來衡量。公布的數據依各加速器公開的晶片功耗值進行正規化。Jalapeño 本身額定 700 瓦,但在所測工作負載下的持續功耗維持在 550 瓦以下[1]。
不過,這些仍是 OpenAI 自行執行並公布的測量結果。所用基準本身公開,確實提高了可驗證性,但作為比較對象的主要商用 AI 系統究竟是哪些產品並未指名,解讀這些數字時仍需保留這一分寸。
晶片、記憶體與網路一體設計
Jalapeño 的起點是一個提問:如果一款硬體的主要工作就是運行當前與未來的語言模型,尤其是互動式代理,那麼它該被設計成什麼樣子[1]。
語言模型推論會在性質不同的兩個階段之間往返。處理提示詞的預填充階段以運算量為主,逐個 token 產生回應的解碼階段則更受記憶體頻寬限制。此外,資料每次在核心與晶片之間移動都會產生延遲,等待期間運算單元處於閒置狀態。只擅長其中一個階段的系統,最後會在等待資料時失去優勢。
因此 Jalapeño 的設計方向是把資料移動與通訊延遲壓到最低。包含產生回應時使用的 KV 快取在內,模型狀態可被明確配置並保留在本地,系統再依推論的各個階段調動運算、記憶體與網路的適當組合。網路同樣被視為架構的一部分,較大的網域可讓整個工作負載留在同一個連線系統內,使一次完整請求從頭到尾維持速度與效率[1]。
設計與程式撰寫都有 AI 介入
開發期程之短也是這款晶片的特色。從初期設計到流片僅耗時 9 個月,期間 OpenAI 的模型被用於探索實作方案,並縮短設計、測量與驗證的循環。AI 也參與了晶片算術電路的最佳化,讓團隊得以在原定進度內把更多運算效能塞進晶片[1]。
文中也提到,Jalapeño 被設計成對人與 AI 都清晰、可預測的程式撰寫對象。工程師以本地張量、明確通訊與可預測的同步來描述工作,AI 則負責最佳化這些工作在系統中如何對應、配置、排程與協調。
實例之一是:原本不在量產計畫內的 3 款開放權重模型,團隊借助 Codex 與 GPT-Astra 在 2 個月內把效能推到相當高的水準。在選定的 GPT-OSS 注意力處理與混合專家(依需求切換多個專門子模型的架構)區塊上,AI 產生的實作比資深工程師撰寫的實作快 1.5 至 1.8 倍[1]。這個數字僅針對選定區塊,並非整個模型的效能。
年內導入自家基礎設施,NVIDIA 晶片仍會持續使用
Jalapeño 是 2026 年 6 月 24 日與 Broadcom 共同開發並發表的晶片。從設計到製造流片耗時 9 個月,主機板、機櫃與系統層面則由 Celestica 參與[2]。
部署方面,計畫在年內開始投入 OpenAI 自家的運算基礎設施。路線圖以多世代演進為前提,第 2 代研發已深入推進,第 3 代也逐漸成形[1]。目前仍在進行量產品質確認、軟體成熟化、大規模運轉準備,以及在更多模型上的效能驗證。
這並不代表全面轉向自研晶片。OpenAI 明確表示,訓練與推論兩方面都會持續廣泛部署 NVIDIA 等夥伴的加速器[1]。面對不斷成長的需求,必須從所有可取得的來源累積運算資源,這是現實面的考量。
總結
OpenAI 公開了自家首款推論晶片 Jalapeño 的初期實測,在公開基準 InferenceX 上呈現每瓦效能提升 1.5 至 1.9 倍、端到端延遲縮短 1.7 至 3.6 倍的結果。其說法是,針對預填充與解碼性質各異的語言模型推論,將晶片、網路乃至機櫃規模的系統一體設計,正是效益的來源。年內即將開始部署到自家基礎設施,但數字出自 OpenAI 自身測量,且未公布比較對象的細節。第 2 代之後的推進節奏,以及是否有第三方複驗,會是接下來的觀察重點。
來源[1]:https://openai.com/index/jalapeno-first-results
來源[2]:https://openai.com/index/openai-broadcom-jalapeno-inference-chip/
