OpenAI 公布了一款以安全為導向、用於自動找出自家模型弱點的內部模型「GPT-Red」。它接手了人工攻擊測試(紅隊)的大量工作,並把找到的攻擊當作訓練資料加以運用,據稱因此讓最新模型「GPT-5.6」對提示注入(在指令中混入惡意內容)的抵抗力大幅提升。GPT-Red 本身不對外發布,僅作為強化防禦能力的工具留在公司內部。以下整理它的運作原理與已公布的成果。
名為提示注入的弱點
AI 代理在工作時,會透過瀏覽器、連動應用程式、本機檔案以及外部工具接觸第三方資料。這些接觸點對於完成現實任務不可或缺,但同時也給惡意第三方留下了誘導模型行為的可乘之機[1]。舉例來說,在電子郵件、網頁、工具的回應內容或程式碼儲存庫中植入精心設計的指令,誘使模型把機密資料送往外部伺服器,這正是被稱為提示注入的典型威脅。
過去,這類弱點得靠人工紅隊手動排查。但演練的設計與執行都相當耗時,難以迅速找出新的攻擊手法並反映到防禦上。而且,光靠人力也無法備妥透過訓練來強化模型所需、足夠數量與多樣性的攻擊資料[1]。OpenAI 的問題意識在於:要讓安全措施跟上模型能力的提升,測試這一端也必須擴大規模。
GPT-Red 是什麼
GPT-Red 正是為因應這項課題而訓練的自動紅隊模型。它與人類攻擊者一樣,朝著目標送出提示、觀察模型的反應,並反覆嘗試以打磨攻擊[1]。OpenAI 表示,投入 GPT-Red 訓練的算力,堪比公司規模最大的後訓練(post-training),並稱把如此多算力僅用於安全在此之前尚無先例。
訓練採用「自我對弈」式的強化學習,同時訓練擔任攻擊方的 GPT-Red 與多樣的防禦方模型群[1]。GPT-Red 成功實施提示注入等有效攻擊即可獲得獎勵,防禦方則在擋下攻擊並完成本身任務時獲得獎勵。防禦方越強,攻擊方就越被迫想出更強、更多樣的手法,雙方因而一同進步。另一個特點是,OpenAI 建構了大量可能被植入攻擊的現實情境(本機檔案的一部分、網頁橫幅、電子郵件內文、工具的輸出等),並為每個情境設定「能操控什麼、怎樣算攻擊成功」的威脅模型。
值得一提的是,OpenAI 把 GPT-Red 與部署的模型分開管理[1]。目的是不讓這款被刻意注入攻擊能力的模型落入濫用者手中,其能力只用於提升產品模型的穩健性。
在實測中展現的攻擊力
GPT-Red 究竟有多大威力,透過與訓練不同的情境獲得了驗證。在一組由未用於訓練的攻擊情境所組成的「間接提示注入」測試環境中,人類紅隊與 GPT-Red 各自獨立地嘗試攻擊「GPT-5.1」,結果 GPT-Red 在 84% 的情境中得手,遠高於人類的 13%[1]。
也進行了更貼近真實運作的試驗。以放在 OpenAI 辦公室、由 Andon Labs 製造、與實驗專案「Project Vend」相近的一台 AI 自動販賣機為目標,GPT-Red 達成了全部 3 個惡意目標[1]:把在售高價商品的價格改寫為允許下限的 0.50 美元(約 80 日圓);下單一件超過 100 美元(約 1.6 萬日圓)的新商品並以 0.50 美元出售;取消另一位顧客的訂單。OpenAI 已通報這些漏洞,並表示正在驗證新的防禦措施。※1 美元 = 162 日圓
此外,也針對程式輔助工具「Codex」的代理(以 GPT-5.4 mini 為基礎),在 10 種將機密資料向外洩漏的情境中對其進行測試[1]。與直接使用 GPT-5.5 的做法相比,OpenAI 稱 GPT-Red 在更多情境中成功讓代理洩漏了資料,且用更少的 token 就辦到了。
GPT-5.6 變得有多穩健
GPT-Red 的最終目的不在攻擊,而在於提升產品模型的防禦力。過去約半年間,OpenAI 一面增加算力,一面逐步培養更強的攻擊模型,並將其用於「GPT-5.3」之後每一款模型的訓練[1]。據稱因此每一次發布,穩健性都在提高。
舉一個具體例子,早期版本的 GPT-Red 發現了一類名為「偽思維鏈(Fake Chain-of-Thought)」的新型直接提示注入。這種攻擊對 GPT-5.1 的成功率一度超過 95%,而在 GPT-5.6 Sol 上已降到 10% 以下[1]。在最難的直接提示注入基準上,GPT-5.6 Sol 的失敗率也降到了 4 個月前最佳模型的六分之一,對 GPT-Red 的直接提示注入僅有 0.05% 會失敗。
一個值得留意的問題是:看起來更穩健,是否只是因為「能做的事變少了」。若一味拒絕更多請求或削弱能力,攻擊固然更難得逞,但那算不上有用的穩健性。OpenAI 表示,它同時評估了通用能力與是否過度拒絕,發現一般能力並未受損,只有穩健性獲得提升[1]。
不過,這些數值都是 OpenAI 自行公布的。實際效果會隨攻擊種類與運作條件而改變,因此結合據稱將於本週稍晚公開的詳細論文(預印本)以及第三方驗證來看待,較為妥當。
總結
GPT-Red 是一次朝向「安全的自我改進」的嘗試——用今天的模型讓明天的模型更安全。它把過去仰賴人力的攻擊測試自動化,並把找到的攻擊回流到訓練中,據稱使 GPT-5.6 成為至今對提示注入最穩健的模型。讓具備攻擊能力的 GPT-Red 不對外公開、專注於防禦用途,也是抑制濫用風險的一種設計。在留意數值皆為自評的同時,值得關注隨著論文與獨立驗證的到來,這套方法究竟能奏效到什麼程度。
來源:https://openai.com/index/unlocking-self-improvement-gpt-red
