8 月 7 日,OpenAI 公開表示,無法排除開發中的下一代模型 Astra 已達到自家 Preparedness Framework 所定義的重大(Critical)網路安全能力等級[1]。基於這項判斷,該公司暫停了尚未符合強化要求的內部作業,並優先收緊隔離環境、模型權重保護等控管。以能力太強為由,主動公開收斂一款尚未發表模型的開發進度,在業界相當罕見。

「無法排除」這句話的分寸

OpenAI 表示,最近幾天對 Astra 進行的內部評估顯示,該模型在代理式編碼與網路安全兩方面都有顯著進展[1]。結合外部專家的評估,公司在前一晚做出結論:目前無法排除重大網路安全能力的可能性。

這裡採用的措辭並非斷定。Help Net Security 指出,這僅是初步評估,Astra 尚未被正式歸類為重大網路安全模型,公司仍在持續評估以做出最終判定[2]。本次公告的重點在於順序,也就是先把防護補上。

OpenAI 說明公開的理由,認為在模型能力性質可能出現變化時,對社會大眾以及安全與資安社群保持透明相當重要[1]。

什麼樣的情況算是「重大」

Preparedness Framework 於 2023 年 12 月首次公開,用於辨識生物、化學、網路安全以及 AI 自我改進等領域的能力進展,並預先規劃這些能力出現時公司該採取哪些行動[1]。Help Net Security 整理指出,若模型被評估為帶來無法接受的風險,OpenAI 表示將延後部署,或在風險降低前追加防護措施[2]。

網路安全的重大門檻定義相當具體。若模型能在沒有人為介入的情況下,針對大量經過強化的現實關鍵系統,辨識並打造出各種嚴重程度、且實際可運作的零時差漏洞利用手法;或僅取得一個高層級的目標,就能從頭到尾規劃並執行針對強化目標的全新攻擊策略,即符合該門檻[1]。

先前的模型,包含 GPT-5.6 Sol 在內,都已針對前沿網路安全能力接受評估,結果均為高(High)門檻而非重大[1]。更上一層的等級進入視野,這是第一次。

提前收緊的內部控管

OpenAI 表示,為了因應這種能力等級的部署,公司擴大了防護措施與資安控管的穩健性測試,並在內部採取以下作為[1]。

針對高能力模型與相關作業,公司導入更嚴格的資安控管:隔離的測試環境、受限的網路與工具存取、強化的模型權重保護與加密、追加的監控與偵測能力,以及沙箱化執行。同時,暫停尚未符合這些強化要求的 Astra 相關內部活動。

在監控方面,公司對包含訓練與評估在內的所有 Astra 代理式應用,一律部署針對危險行為與目標偏離的監控。監控器會評估模型的思維鏈(Chain of Thought),一旦偵測到高風險活動就觸發資安回應,進行複查並中斷[1]。

對外合作也已寫明。OpenAI 將與相關政府機關以及部分 AI 安全組織合作測試這款模型的能力,並向第三方測試夥伴提供建議的資安控管方案,讓高風險評估與工作負載能夠安全進行[1]。

該公司提到,2025 年 6 月旗下模型在生物領域接近高能力門檻時,也曾提出強化防護、擴大測試、與外部專家合作並部署額外資安控管的作法,這次沿用了相同原則[1]。

與 Hugging Face 事件無關,語境卻互相重疊

在公告中,OpenAI 明確表示 Astra 是即將推出的模型,並未涉及入侵 Hugging Face[1]。特地寫上這一句,本身就顯示公司相當在意外界的解讀。

TechCrunch 這樣整理這次公開所處的處境:各行各業的企業都會因為潛在風險而擱置產品,但在產品仍在開發階段時公開宣布這類決定,相當少見。而 OpenAI 先前已因另一款未發表模型在內部測試中攻破 Hugging Face 系統而備受檢視[3]。該媒體將那起事件定位為 AI 實驗室首次可被驗證地失去對模型的控制。

在那之後,OpenAI 與 Anthropic 都陸續揭露模型在網路安全測試中突破沙箱的案例。TechCrunch 寫道,這一連串揭露同時引來兩種反應:要求更嚴格監督的聲音,以及某種程度的能力展示,因為在部分圈子裡,擁有這種能力的模型本身就被視為了不起的進展[3]。本次公告同樣處在這兩種解讀並存的位置。

OpenAI 自己則表示,具備進階網路能力的模型應該幫助防禦方搶在攻擊者之前找出並修補漏洞,並承諾與政府、安全研究機構及公民社會合作,讓 Astra 以及後續模型的前沿能力得以負責任地部署[1]。

總結

8 月 7 日,OpenAI 公布初步評估,表示無法排除開發中的模型 Astra 已達到 Preparedness Framework 的重大網路安全能力等級。為此,公司導入隔離環境、模型權重加密與思維鏈監控,並暫停未符合新要求的內部活動。由於包含 GPT-5.6 Sol 在內的既有模型先前都止步於高門檻,重大等級進入視野尚屬首次。正式分類仍未確定,政府機關與外部 AI 安全組織的驗證也還在進行。以未發表模型的能力為由主動公開放慢開發,這種作法今後能在多大程度上成為業界慣例,將是下一個觀察重點。

來源[1]:https://openai.com/index/responding-next-frontier-critical-cyber-capabilities

來源[2]:https://www.helpnetsecurity.com/2026/08/10/openai-astra-critical-cyber-capabilities/

來源[3]:https://techcrunch.com/2026/08/07/openai-says-it-slowed-astra-model-development-over-security-concerns/