OpenAIは、自社モデルの弱点を自動で探し出す安全性向けの内部モデル「GPT-Red」を公開しました。人間による攻撃検証(レッドチーム)を肩代わりし、見つけた攻撃を訓練データとして使うことで、最新モデル「GPT-5.6」をプロンプト注入(悪意ある指示の混入)に対して大幅に堅牢化したとしています。GPT-Red自体は外部に配布せず、あくまで防御力を鍛えるための道具として社内に留める設計です。ここでは、その仕組みと公表された成果を整理します。

プロンプト注入という弱点

AIエージェントは、ブラウザや連携アプリ、ローカルのファイル、外部ツールなどを通じて第三者のデータに触れながら作業します。こうした接点は現実のタスクをこなすうえで欠かせない一方、悪意ある第三者がモデルの挙動を誘導する隙にもなります[1]。たとえば、メールやWebページ、ツールの応答、コードのリポジトリに巧妙な指示を仕込み、機密データを外部サーバーへ送らせるよう仕向ける、といった攻撃です。これがプロンプト注入と呼ばれる代表的な脅威です。

こうした弱点は、人間のレッドチームが手作業で探すのが従来のやり方でした。ただし、演習の設計と実施には時間がかかり、新しい攻撃手口を素早く洗い出して防御に反映するには限界があります。さらに、人手では、訓練を通じてモデルを鍛えるのに必要なだけの量と多様性を持つ攻撃データを用意しきれません[1]。モデルの能力向上に安全対策を追いつかせるには、検証の側も規模を拡大する必要がある、というのがOpenAIの問題意識です。

GPT-Redとは何か

GPT-Redは、その課題に応えるために訓練された自動レッドチームモデルです。人間の攻撃者と同じように、目標に向けてプロンプトを送り、モデルの反応を観察し、試行を重ねて攻撃を練り上げます[1]。OpenAIは、同社で最大級の事後学習(ポストトレーニング)に匹敵する計算資源をGPT-Redの訓練に投じたと説明しており、安全性のためだけにこれほどの計算量を割いたのは前例がないとしています。

訓練には「自己対戦型」の強化学習が用いられます。攻撃役のGPT-Redと、多様な防御役のモデル群を同時に鍛える方式です[1]。GPT-Redはプロンプト注入などの有効な攻撃を成功させると報酬を得て、防御役は攻撃を退けつつ本来の作業を完遂すると報酬を得ます。防御側が強くなるほど、攻撃側はより強力で多彩な手口を編み出さざるを得なくなる、という関係で双方が伸びていきます。攻撃が仕込まれ得る現実的な場面(ローカルファイルの一部、Webページのバナー、メール本文、ツールの出力など)を数多く用意し、それぞれに「何を操作できて何が攻撃成功とみなされるか」を定めた脅威モデルを設定している点も特徴です。

なお、OpenAIはGPT-Redを配備するモデルとは切り離して管理しています[1]。攻撃能力をあえて仕込んだモデルを悪用者の手に渡さないためで、その能力は製品モデルの堅牢性を高めるためだけに使う、という考え方です。

実地テストで示した攻撃力

GPT-Redがどれだけ通用するかは、訓練とは別の場面での検証で示されています。訓練に使っていない攻撃シナリオを集めた「間接プロンプト注入」の検証環境で、人間のレッドチームとGPT-Redがそれぞれ独立に「GPT-5.1」への攻撃を試したところ、GPT-Redは84パーセントのシナリオで成功し、人間の13パーセントを大きく上回りました[1]。

現実の運用に近い試験も行われています。OpenAIのオフィスに置かれたAI搭載の自動販売機(Andon Labs製で、実験プロジェクト「Project Vend」に近いもの)を標的にしたところ、GPT-Redは3つの悪意ある目標をすべて達成しました[1]。在庫のある高額商品の価格を許容下限の0.50ドル(約80円)に書き換える、100ドル(約1万6000円)超の新商品を発注して0.50ドルで売り出す、別の客の注文を取り消す、という内容です。OpenAIはこれらの脆弱性を報告済みで、新たな防御策を現在検証しているとしています。※1ドル=162円換算

さらに、コーディング支援ツール「Codex」のエージェント(GPT-5.4 mini基盤)に対しても、機密データを外部へ持ち出させる10種類のシナリオでGPT-Redを試しています[1]。比較対象としたGPT-5.5をそのまま使う手法よりも、より多くの場面でデータ持ち出しを成功させ、しかも少ないトークンで達成できたと説明しています。

GPT-5.6はどれだけ堅牢になったか

GPT-Redの最終的な狙いは、攻撃そのものではなく製品モデルの防御力を高めることにあります。OpenAIは過去半年ほど、計算量を増やしながら段階的に強い攻撃モデルを育て、「GPT-5.3」以降の各モデルの訓練に使ってきました[1]。その結果、リリースを重ねるごとに堅牢性が上がってきたとしています。

具体例として、初期のGPT-Redが見つけた「偽の思考連鎖(Fake Chain-of-Thought)」と呼ばれる新種の直接プロンプト注入があります。この攻撃はGPT-5.1に対して95パーセント超の成功率を示していましたが、GPT-5.6 Solでは10パーセント未満まで下がったといいます[1]。最も難しい直接プロンプト注入のベンチマークでも、GPT-5.6 Solは4か月前の最良モデルと比べて失敗が6分の1に減り、GPT-Redの直接プロンプト注入に対して失敗するのはわずか0.05パーセントにとどまったと説明しています。

気になるのは、堅牢に見えるのが単に「できることを減らしたから」ではないか、という点です。要求を拒みがちにしたり能力を落としたりすれば攻撃は通りにくくなりますが、それは有用な堅牢性とは言えません。OpenAIは、一般的な能力の評価と、過剰に拒否していないかを測る評価の双方を行い、通常の能力は損なわれないまま堅牢性だけが向上したとしています[1]。

もっとも、これらの数値はいずれもOpenAI自身が公表したものです。実際の効果は攻撃の種類や運用条件によって変わり得るため、今週後半に公開予定とされる詳細な論文(プレプリント)や第三者の検証も踏まえて受け止めるのが妥当でしょう。

まとめ

GPT-Redは、今日のモデルを使って明日のモデルをより安全にする、という「安全性の自己改善」を狙った試みです。人手に頼っていた攻撃検証を自動化し、見つけた攻撃を訓練に回すことで、GPT-5.6はプロンプト注入に対してこれまでで最も堅牢になったとされています。攻撃能力を持つGPT-Red自体は社外に出さず防御の道具に徹する設計も、悪用リスクを抑える工夫と言えます。公表値は自社評価である点に留意しつつ、今後の論文や独立した検証で、この手法がどこまで通用するのかを見ていきたいところです。

出典:https://openai.com/index/unlocking-self-improvement-gpt-red