OpenAI 預告了一套名為 Private Safety Processing 的新機制,能在維持企業客戶零資料保留(ZDR)的前提下找出濫用行為。它不再逐筆判斷單次互動,而是把多輪相關的互動放在一起尋找危險徵兆,同時該公司表示自家員工始終無法讀取底下的提示詞與回覆。此機制預計自 2026 年 9 月開始提供,並同步公開技術白皮書。
只看一次互動會漏掉什麼
現行的 ZDR 相容安全機制是逐筆判斷的。OpenAI 認為瓶頸正在於此:最嚴重的風險很少會在單一請求裡顯露出來。
需要辨識的行為包括反覆試探安全防護以尋找缺口、把同一個目的分散到多個帳號,以及把有害意圖包裝成一般的技術研究。此外還有一種智慧代理特有的失效狀況:系統逐漸偏離使用者的原意,即使被要求停止仍持續執行動作。
OpenAI 的產品政策負責人向記者舉了一個例子。某人在一次對話中詢問某公司軟體的弱點,又在另一次對話中詢問遠端存取的方式,以及哪些資安產品能夠察覺。分開看都像是一般的技術研究,放在一起看就比較像是在為網路攻擊做準備。逐筆判斷無法把這兩次對話對起來。
存著,但沒有人讀
那麼,不看內容又要如何完成跨輪次的判斷?這正是這次公告的重點。
在 ZDR 部署下,客戶內容存放在客戶自己掌控的基礎設施上。OpenAI 另外還在準備第二種選項:內容放在 OpenAI 的基礎設施上,但加密金鑰只由客戶持有。OpenAI 員工沒有金鑰的複本,因此資料雖然在那裡卻打不開。
判斷本身由自動化流程負責。一旦觸發,傳到 OpenAI 的只是一個範圍明確的訊號,說明活動的類型,並不會附上提示詞或回覆。OpenAI 依此決定是否處置,員工依然無法開啟內容。客戶在自己的系統中調查這些警示,若要申訴處置結果或協助濫用調查,也可以自行決定提交相關內容。
Anthropic 給出了相反的答案
面對同一個難題,Anthropic 得出相反的結論。該公司對效能最強的一批模型強制要求保留 30 天的提示詞與輸出,即使先前的合約以零保留為前提,也沒有例外。
Anthropic 承認這項政策不受客戶歡迎,但主張要抓出橫跨多次請求的攻擊,保留資料不可或缺。該公司預計年內會提供一個選項,讓企業把這些資料保留在自己的雲端上。
兩家公司對問題的判讀幾乎一致:危險行為出現在請求與請求之間的關聯,而不在任何單獨一次請求裡面。分歧在於解方,Anthropic 想靠保留來發現,OpenAI 則想在不保留的前提下發現。企業能接受哪一種前提,很大程度取決於自己處理的資料性質。
適用範圍與例外
Private Safety Processing 針對符合條件的企業方案與 API 客戶,並不適用於個人版 ChatGPT。免費版、Plus、Go 與 Pro 使用者的資料設定維持原狀,ZDR 本來也不屬於這些方案的機制。
公告的註腳裡另外寫明了一項例外。美國法律要求 OpenAI 通報疑似兒童性虐待相關素材,因此被標記為疑似此類的影像即使在零資料保留的部署下仍會被保留,用於人工檢視與通報,這一點與現行做法相同。
試用已隨首批客戶展開,參與提供意見的公司中提到了 Glean 與 Abridge。Glean 的資訊安全長表示,正是不用於訓練的承諾與 ZDR,讓公司有信心在 OpenAI 的模型之上打造自家產品。據報導,測試對象還包括 Microsoft 與 Databricks。
能不能驗證要等到 9 月
目前公開的只有方針與概要,技術細節尚未釋出。所謂不讀內容卻能追蹤多輪互動之間關聯的說法,究竟如何成立,只能等 9 月的白皮書。
對歐洲客戶而言,這份資料關係到實務作業。由服務提供方保留資料的形式,在 GDPR 以及醫療、金融領域的產業規範下很難通過核准,而這正好是 OpenAI 所說客戶所處理的資料類別。近來歐洲一批以資料存放位置為賣點的新創增加,正是同一股壓力的另一面。
這次預告也為 OpenAI 安全面動作頻繁的一個月畫下句點。該公司在 8 月曾表示,因下一代模型可能觸及重大網路風險而暫停了部分開發。風險評估愈嚴格,為此需要觀察什麼的問題就愈尖銳。Private Safety Processing 正是試圖用盡可能少的觀察來回答這個問題。
總結
OpenAI 將自 2026 年 9 月起提供 Private Safety Processing,在維持零資料保留的同時跨多輪互動偵測濫用行為。判斷由自動化流程完成,傳到 OpenAI 的只是說明活動類型的訊號,而非提示詞或回覆本身,員工無法讀取內容。此外還會提供把內容放在 OpenAI 基礎設施、金鑰由客戶持有的選項。這條路線與強制保留 30 天的 Anthropic 形成對照,實際效果要等同月發布的白皮書之後才能判斷。
