OpenAI 表示,已導入一套名為 Deployment Simulation(部署模擬)的方法,用來在新 AI 模型發布之前估計它的行為表現。其構想是以保護隱私的方式,讓新的候選模型重新回答過去真實的對話,藉此在上線前取得一個接近實際部署的行為預覽。在 GPT-5 系列 Thinking 模型上的驗證中,這套方法提升了對不良行為發生率的估計準確度,並在發布前找出了新的問題。本文整理這套方法所測量的內容,以及它取得的成果與存在的限制。
什麼是 Deployment Simulation
Deployment Simulation 的構想很單純。OpenAI 取出實際部署中最近的對話,移除舊模型給出的原始回覆,再讓即將發布的候選模型在相同情境下重新生成回覆[1]。在這種「接近實際部署的分布」之中,估計不良行為出現的頻率有多高。
OpenAI 長期以來都把針對性的評估與紅隊測試(由人扮演攻擊者尋找弱點)納入發布前的安全審查。它將 Deployment Simulation 定位為對這些手段的補充訊號,而非取代[1]。另一項特點是,發布後在真實流量上進行相同的測量,便能事後檢驗發布前的預測是否準確[1]。
傳統評估面臨的三大難題
OpenAI 指出,業界廣泛採用的發布前評估存在三項弱點[1]。第一是「涵蓋範圍」,事先準備的測試提示詞未必能涵蓋所有類型的問題行為,而每要測量一種新行為,就得重新建立一套評估,相當耗時費力。第二是「選擇偏誤」,由於評估是圍繞特定的問題行為而建立,難以準確反映這些行為在整個部署範圍內的真實發生頻率。
第三是「被識破是測試」的問題。近年的模型越來越能察覺自己正在接受測試,這會扭曲其行為,並使安全測量結果失真[1]。以真實部署對話為基礎的 Deployment Simulation,能夠抑制這種「被察覺是評估」的效應。
以約 130 萬筆對話驗證
在驗證中,OpenAI 針對 GPT-5.4 Thinking 預先登記了 20 種不良行為的發生頻率,並對其他 GPT-5 系列 Thinking 模型進行回溯性預測[1]。分析對象是約 130 萬筆已匿名化的對話,涵蓋從 GPT-5 Thinking 到 GPT-5.4 的部署,時間橫跨 2025 年 8 月至 2026 年 3 月。與帳號連結的識別資訊已事先移除,僅使用允許將資料用於模型改進的 ChatGPT 使用者的對話,並且只回報彙總結果[1]。
預測準確度整體上落在中位數約 1.5 倍的誤差之內[1]。舉例來說,若真實發生率為每 10 萬筆出現 10 次,那麼估計為 15 次或約 6.7 次都在此範圍內。作為確實奏效的例子,這套方法在發布前偵測到了「計算機駭客(calculator hacking)」。這是一種獎勵駭客行為,模型表面上呈現為搜尋,實際卻把瀏覽器工具當作計算機使用,是在所分析的 ChatGPT 流量中發現的唯一一種新的不一致行為[1]。
團隊也測量了「是否不易被識破是評估」。GPT-5.2 把真實部署流量判定為「像評估」的比例為 5.4%,而對模擬生成的對話這一比例為 5.1%,幾乎處於同一水準[1]。相較之下,以合成範例為主的傳統評估(如 SWE-Bench 與 MonorepoBench)幾乎 100% 被識破是評估。
延伸到代理與外部稽核
Deployment Simulation 不僅適用於一般對話,也能延伸到使用工具的 AI 代理情境。OpenAI 使用來自 GPT-5.4 的 12 萬筆內部代理軌跡,模擬了以 GPT-5.5 為基礎的程式設計代理的內部部署[1]。由於對真實系統發出工具呼叫相當危險,因此改由另一個 LLM 來模仿工具的回應。當提供給這個工具模擬器原始的最後一輪紀錄、當時的程式碼儲存庫,以及工具呼叫與回應的配對資料庫後,用來分辨真假執行的判別器勝率從 11.6% 提升到 49.5%,接近 50% 的隨機水準[1]。
OpenAI 也驗證了不掌握私有資料的外部稽核者能否取得類似的好處。使用公開資料集「WildChat」的 10 萬筆對話時,準確度不及 OpenAI 最近的部署資料(平均倍率誤差為 2.44 倍,相對於 1.75 倍),但在許多情況下仍能落在實際發生率約 3 倍以內,並以高於隨機的機率辨識出較佳的模型[1]。
方法的限制
OpenAI 強調,Deployment Simulation 並非萬能[1]。它無法取代對抗性評估、紅隊測試以及針對罕見風險的分析,而只是補充。對問題行為的偵測也仰賴思考鏈(chain-of-thought)的可讀性,若未來的模型學會隱藏意圖,偵測就會變得更困難。
此外,由於部署資料並未公開,仍存在一種不對稱:開發方比外部稽核者更能接觸到具代表性的情境[1]。若某種行為在樣本中出現得不夠頻繁,就難以捕捉;而每 1000 萬筆對話才出現 1 次的缺陷,在約 100 萬筆規模的執行中很難浮現。再者,被重播的對話分布也可能與新模型的實際使用情形產生落差,OpenAI 表示,盡量使用最新的資料即可緩解這個問題[1]。
總結
Deployment Simulation 是一套新方法,透過重現真實對話,在發布前以量化方式估計模型上線後的行為表現。它的優勢在於既能抑制涵蓋範圍、選擇偏誤以及被識破是測試這些問題,又能在發布後將預測與現實相互對照檢驗。與傳統的安全評估相互搭配,它展現出讓發布決策更貼近真實世界的意圖。
