8 月 13 日,OpenAI 搶先公開了新的服務層級 Ultrafast,讓自家最強的模型 GPT-5.6 Sol 以最高 14 倍於標準處理的速度執行[1]。該層級首先在 OpenAI API 上提供,推論由 Cerebras 的晶片負責。輸出速度最高可達每秒 750 個詞元,而模型的智慧水準與標準層級完全相同[1][2]。
速度與智慧的取捨不再成立
過去若要取得即時回應,通常只能改用較小或較專用的模型[1]。前沿模型夠聰明,但使用者必須等待,這樣的認知已經相當根深蒂固。
Ultrafast 指向另一個方向。OpenAI 將它定位為提升單位時間內完成的有效工作量[1]。當速度不再以犧牲智慧為代價,AI 就能進入業務中對時間最敏感的環節,一些原本無法成立的工作也隨之成為可能[1]。
Cerebras 方面同樣強調這一點。該公司執行長暨共同創辦人 Andrew Feldman 表示,執行於 Ultrafast 上的 GPT-5.6 Sol 證明速度與智慧不再互斥[2]。OpenAI 負責 Compute Strategy 與 GPT-Infra 的副總裁 Sachin Katti 也說明,公司正在探索當客戶能以顯著更低的延遲取得最強模型的智慧時,究竟會帶來什麼新的可能性[2]。
支撐每秒 750 詞元的晶圓級引擎
速度的來源是 Cerebras 的 Wafer-Scale Engine 架構[2]。整片晶圓當作單一晶片使用,晶片上整合 44 GB SRAM,讓模型權重在推論過程中始終留在晶片內部[2]。
以 GPU 為基礎的推論必須在晶片內記憶體與晶片外儲存之間反覆搬運權重,這個記憶體頻寬瓶頸限制了前沿模型的推論速度[2]。把權重留在晶片內就解除了這項限制。最終結果是在維持 GPT-5.6 Sol 完整智慧的前提下,輸出速度提升到每秒 750 個詞元[1][2]。
Cerebras 也提出了比較數據。以 Artificial Analysis 公布的 Anthropic 模型輸出速度為基準,Ultrafast 比 Fast 模式下的 Claude Opus 4.8 快 5 倍,比 Claude Fable 5 快 11 倍[2]。
基準測試中,3 天的運算量壓縮成 11 小時
針對真實工作設計的基準測試,把這個差距化成了具體數字。
在涵蓋研究所程度化學、經濟學與文學的 2,500 題測驗 Humanity's Last Exam 中,GPT-5.6 Sol Ultrafast 以 11 小時多一點的時間完成全部題目[2]。同一批題目下,Claude Fable 5 需要超過 3 天的連續運算,等於 Ultrafast 以接近 7 倍的速度達到相當的正確率[2]。
在彙集法律文件起草、財務模型建置、工程報告撰寫等高經濟價值知識工作的 GDP-Val 上,Ultrafast 在不犧牲品質的前提下達成端到端 5.6 倍的加速[2]。其重點並非基準分數本身,而是達成同樣成果所需的時間。
鎖定那些等不起的工作
OpenAI 列出了幾個 Ultrafast 可望發揮作用的具體情境[1]。
在故障應變與可靠性方面,當關鍵系統當機時,模型會比對應用程式記錄檔、近期程式碼變更與工程師回報,在故障仍在持續期間找出可能原因,並協助準備修復方案[1]。在金融研究與資安領域,它能在行情仍在變動時分析市場訊號、評估交易並找出可疑活動[1]。
在客戶支援與語音應對上,目標是即使答案需要跨越多個步驟或系統,也能不中斷對話、當場解決複雜問題[1]。在電子商務情境中,它會在顧客還在猶豫時回答商品問題、查詢庫存、調整推薦並解決結帳卡關,趕在猶豫變成棄單之前處理完畢[1]。
在即時研究與實驗方面,過去需要跑一整晚的處理可以變成互動式的工作階段[1]。團隊測試想法、檢視結果、調整方向、再跑一次實驗,整段流程不會被打斷[1]。
OpenAI 內部已用於故障處理與研究調查
在 OpenAI 內部,一組開發者持續測試執行於 Ultrafast 的 GPT-5.6 Sol,藉此了解哪些工作流程能從可即時回應的前沿智慧中受益[1]。
故障應變就是其中一例。警報觸發時,系統與證據都仍在變化。團隊用它讀取記錄檔、分析追蹤資料、整理溝通內容、列出下一步該確認的檢查項目,並協助準備或驗證修復方案,全程維持 Sol 的智慧水準且耗時大幅縮短[1]。從觀察到訊號、驗證假設到決定下一步行動之間的延遲被壓縮,而判斷與部署的責任仍由工程師承擔[1]。
在研究調查方面,團隊用它檢索知識來源、查詢資料,並跨已連接的工具收集、整理與摘要資訊[1]。過去晚上批次啟動實驗、隔天早上檢視結果的常見做法,正逐漸收斂成工作日內可以反覆迭代的循環[1]。
目前為限量預覽,價格與正式開放時間未公布
GPT-5.6 Sol Ultrafast 目前僅以限量預覽形式開放給部分客戶[1][2]。OpenAI 正與程式開發、電子商務、金融研究、客戶支援等領域的企業合作,在真實的正式環境中研究這些條件,再決定如何擴大部署[1]。
隨著運算容量成長,開放範圍會逐步擴大,但這次的公告並未提及價格體系與正式開放時間[1]。由於這是新增的速度層級,與標準層級之間的價差如何訂定,將直接影響企業能否真正把它導入業務流程。
總結
OpenAI 公開了 Ultrafast 限量預覽,可讓 GPT-5.6 Sol 以最高 14 倍於標準處理的速度執行。推論由 Cerebras 的 Wafer-Scale Engine 負責,透過把模型權重保存在 44 GB 的晶片內 SRAM 中解除記憶體頻寬瓶頸,實現每秒 750 個詞元的輸出。在 Humanity's Last Exam 中,原本需要 3 天以上的處理被壓縮到 11 小時多一點,GDP-Val 也在不犧牲品質的情況下確認了 5.6 倍的加速。目前僅向部分客戶提供限量預覽,價格與正式開放時間尚未公布。
