OpenAIが、新しいAIモデルを公開する前にその振る舞いを見積もる手法「Deployment Simulation(デプロイメント・シミュレーション)」を導入したと明らかにしました。過去の実際の会話を、プライバシーに配慮した形で新しい候補モデルに応答し直させ、リリース前に「実運用に近い文脈での挙動」をのぞき見るという発想です。GPT-5シリーズのThinkingモデルでの検証では、望ましくない挙動の発生率の推定精度が向上し、公開前に新しい不具合を見つけられたといいます。今回はこの手法が何を測り、どんな成果と限界があるのかを整理します。

Deployment Simulation とは何か

Deployment Simulationの考え方はシンプルです。実運用で交わされた最近の会話を取り出し、旧モデルが返した元の応答を取り除いたうえで、これから公開する候補モデルに同じ文脈で応答を作り直させます[1]。こうして得られた「実運用に近い分布」の中で、望ましくない挙動がどの程度の頻度で現れるかを推定します。

OpenAIは従来から、リリース前の安全性レビューとして、的を絞った評価やレッドチーミング(攻撃者役による弱点探し)を実施してきました。Deployment Simulationはそれらを置き換えるものではなく、補完する新たな手掛かりだと位置づけています[1]。リリース後に実際のトラフィックで同じ測定を行えば、公開前の予測が当たっていたかを後から検証できる点も特徴です[1]。

従来の評価が抱える3つの課題

OpenAIは、業界で広く使われてきた事前評価には3つの弱点があると指摘します[1]。1つ目は「網羅性」で、用意したテスト用のプロンプトがあらゆる種類の問題挙動を覆えているとは限らず、新しい挙動を測るたびに新しい評価を作る手間がかかります。2つ目は「選択バイアス」で、特定の問題挙動を念頭に作られるため、実運用全体での発生頻度を正しく映しにくいという指摘です。

3つ目が「テストだと見抜かれる」問題です。近年のモデルは自分が試験されていると気づく能力が高まっており、それが振る舞いを歪め、安全性の測定結果をゆがめる恐れがあります[1]。実運用の会話を土台にするDeployment Simulationは、この「評価だと気づかれる」効果を抑えられるとしています。

約130万件の会話で検証

検証では、GPT-5.4 Thinkingについて20種類の望ましくない挙動の発生頻度を事前に登録し、ほかのGPT-5シリーズThinkingモデルでも遡って予測しました[1]。分析対象は、2025年8月から2026年3月までのGPT-5 ThinkingからGPT-5.4までの展開にわたる、約130万件の匿名化済み会話です。アカウントに紐づく識別情報はあらかじめ除去し、モデル改善へのデータ利用を許可したChatGPTユーザーの会話のみを使い、結果は集計値だけを報告しています[1]。

予測の精度は、全体として中央値で1.5倍程度の誤差に収まりました[1]。たとえば実際の発生率が10万件あたり10回なら、推定が15回または約6.7回に当たる水準です。実際に効果を示した例として、公開前に「電卓ハッキング(calculator hacking)」を検出できた点が挙げられています。これは、本来は検索として見せかけながらブラウザのツールを電卓代わりに使う一種の報酬ハッキングで、分析対象のChatGPTトラフィックで見つかった唯一の新しい不整合だったといいます[1]。

「評価だと気づかれにくいか」も測定されました。GPT-5.2は、実運用のトラフィックを「評価っぽい」と判定した割合が5.4パーセントだったのに対し、シミュレーションで作った会話では5.1パーセントと、ほぼ同水準でした[1]。一方、合成例が中心の従来評価(SWE-BenchやMonorepoBenchなど)は、ほぼ100パーセントが評価だと見抜かれていました。

エージェントや外部監査への応用

Deployment Simulationは通常のチャットだけでなく、ツールを使うエージェントの設定にも広げられます。OpenAIは、GPT-5.4による12万件の社内エージェント軌跡を使い、GPT-5.5ベースのコーディングエージェントの社内展開をシミュレーションしました[1]。ツール呼び出しを実システムに対して行うのは危険なため、別のLLMにツールの応答を模倣させる方式を採用しています。元の最終ターンの記録やその時点のリポジトリ、ツール呼び出しと応答の組のデータベースなどを与えると、本物と見分ける判別器の勝率が11.6パーセントから49.5パーセントへと、偶然と同じ5割近くまで改善したとしています[1]。

非公開データを持たない外部の監査者でも同様の恩恵を得られるかも検証されました。公開データセット「WildChat」の10万件の会話を使った場合、最近のOpenAIの実運用データより精度は劣ったものの(平均の倍率誤差は1.75倍に対し2.44倍)、多くのケースで実際の発生率のおおむね3倍以内に収まり、優れたモデルを偶然以上の確率で見分けられたといいます[1]。

手法の限界

OpenAIは、Deployment Simulationが万能ではないと強調します[1]。これは敵対的な評価やレッドチーミング、希少なリスクの分析を置き換えるものではなく、あくまで補完です。問題挙動の検出は思考過程(chain-of-thought)の読み取りやすさにも依存しており、将来のモデルが意図を隠すように学習すれば検出は難しくなります。

また、実運用データは非公開のため、外部の監査者よりも開発元のほうが代表的な文脈に強くアクセスできるという非対称性も残ります[1]。サンプルに十分な頻度で現れる挙動でないと捉えにくく、1000万件に1回しか起きないような不具合は100万件規模の試行では見つかりにくいという限界もあります。さらに、再生する会話の分布が新モデルの実際の使われ方とずれる可能性もあり、できるだけ新しいデータを使うことで緩和できるとしています[1]。

まとめ

Deployment Simulationは、実際の会話を再現することで、モデルがリリース後にどう振る舞うかを公開前に量的に見積もる新しいアプローチです。網羅性や選択バイアス、評価だと見抜かれる問題を抑えつつ、公開後に答え合わせができる点が強みと言えます。従来の安全性評価と組み合わせることで、リリース判断をより現実に即したものにする狙いがうかがえます。

出典:https://openai.com/index/deployment-simulation