OpenAI於7月9日開始正式提供新的大型語言模型系列「GPT-5.6」。此系列由三款模型組成:旗艦級的「Sol」、面向日常工作的「Terra」,以及低價又高速的「Luna」,並將陸續涵蓋ChatGPT、面向企業的ChatGPT Work、程式設計助手「Codex」以及面向開發者的API。這次正式提供是在上月底以來的限定預覽之後進行,於通過美國政府部門的審查後,更大範圍的使用才得以開放。以下整理三款模型的差異,以及官方公布的效能與價格重點。
依用途選擇的三款模型
GPT-5.6採用效能與價格各異的三級結構。最高階的「Sol」是旗艦模型,力求在程式設計、查找資料、文件製作、資安乃至科學領域等廣泛任務中取得最高水準的成果。中階的「Terra」定位為均衡地處理日常業務,最入門的「Luna」則適合追求回應速度快、成本低的情境。
根據OpenAI表示,Sol能以比以往前沿模型更少的token(處理文字的最小單位)取得同等或更佳的成果,進而提高每一美元支出所帶來的效能。與其把一款聰明的巨型模型當作萬用工具,不如依工作的輕重分別選用模型——這正是這次的設計思路。
基準測試展現的效能
作為效能佐證,OpenAI公布了數項指標。在衡量長時間專業工作完成能力的「Agents' Last Exam」中,Sol取得53.6%,比Anthropic的「Claude Fable 5」高出13.1個百分點。中階的Terra也以大幅更低的成本超越Fable 5,而入門的Luna在程式設計任務上超越Claude Opus 4.8,成本卻僅約為其四分之一。
不過,這些數值皆由OpenAI自行公布。實際使用體驗會隨任務與條件而變化,因此結合第三方驗證來看待較為妥當。
面向開發者新增的機制
面向開發者,新增了能更快完成複雜工作的功能。重頭戲是名為「ultra」的設定,它讓四個代理(agent)並行運作,分工合作因應課題。
另一項是可在API上使用的「Programmatic Tool Calling」。它不再逐次把外部工具呼叫回傳給開發者,而是讓模型當場撰寫並執行輕量程式,用以協調多個工具、篩選中間結果。由於減少了往返互動,多步驟的自動化更易於建構。同時也提供了處理多個代理的新測試版功能,開發者可自行組建相當於ultra的協同。
資安能力的強化及隨之而來的限制
GPT-5.6被稱為迄今資安能力最強的版本,在衡量可被攻擊程度的指標「ExploitBench2」中取得73.5%。
強大也是一把雙面刃。OpenAI計劃透過名為「Trusted Access for Cyber」的框架,收緊對資安能力最強模型的存取權限。相關使用者須在9月1日前啟用採用硬體金鑰的「Advanced Account Security」,否則將無法繼續使用這些模型。這是為了保護能力強大的模型免於遭到濫用或帳號被盜,而要求使用方也具備一定的安全設定。
延伸至文件製作的適用範圍
在程式設計之外,官方強調文件製作的品質有所提升。GPT-5.6能從作為範本的一組投影片中讀取版面、字體、間距、配色、投影片母片規則等「設計範式」,並將其一致地套用到新的資料上,使簡報、文件與試算表的成品更為工整。
此外,其操作螢幕的「電腦操作」能力也有所提高,模型可對自己產生的結果進行檢查,在最終提交前重新發現視覺或功能上的問題。
提供範圍與價格
GPT-5.6系列將以24小時向全球陸續推出。API價格以每100萬token計:Sol為輸入5美元(約810日圓)、輸出30美元(約4,860日圓);Terra為輸入2.50美元(約405日圓)、輸出15美元(約2,430日圓);Luna為輸入1美元(約162日圓)、輸出6美元(約970日圓)。可使用的範圍會依ChatGPT、ChatGPT Work、Codex、API等方案而不同。
※1美元 = 162日圓(截至2026年7月10日)
此外,關於旗艦Sol,官方還計劃在專用晶片廠商Cerebras的硬體上提供每秒最高750token的高速方案,預計將進一步拓展到重視回應速度的用途。
總結
GPT-5.6的特點在於提供方式的轉變——從把一款模型當作萬用工具,轉向依工作的輕重在Sol、Terra、Luna之間分別選用。基準數值皆為自家公布,不宜全盤採信,但這次發布把程式設計、文件製作與資安領域的實力與價格的兼顧擺到了前台。並行代理、程式化的工具呼叫等面向開發者的機制,在實際業務中究竟能發揮多大作用仍有待觀察,第三方驗證與第一線的使用方式將成為關注焦點。
