OpenAIが、社内のセキュリティ運用を組み替えた取り組みを「Defense Factory」として公開しました。脆弱性を見つけ、再現し、修正案を作り、直ったことを確かめるまでを、AIエージェントが連続して回し続ける仕組みです。人間の役割は境界を決めることと例外を捌くことに寄っていきます。攻撃側がオープンウェイトのモデルを使って自動化を進めるなか、守る側も同じ速度で動かなければ追い抜かれる、という危機感が背景にあります。

守り手に残された時間

攻撃の自動化は、もう研究者の想定の話ではなくなっています。エージェントはセッションをまたいで学んだことを保持し、システムの構造を理解したうえで弱点をつなぎ合わせられます。単発では成立しなかった攻撃経路が、時間をかけて連鎖として組み上がるわけです。しかもエージェントは群れで動かせるため、人間が確認して修正する速度では規模の面で勝負になりません。

一方で、守る側には2つの持ち札があります。自社のコードにエージェントを直接触らせられること、そして広く出回っているオープンウェイトモデルより能力の高いフロンティアモデルを使えることです。この差が生む猶予をOpenAIは「守り手の窓」と呼んでいます。窓は開きっぱなしではなく、継続的な防御を実装しなければ閉じていく、という整理です。

社内のコードレッドが出発点だった

Defense Factoryは机上の設計図から始まったものではありません。モデルの能力が上がって自社システムをより深く点検できるようになったタイミングで、OpenAIは社内にコードレッドを宣言し、セキュリティ・アプリケーション・リサーチの各チームを集めた集中的なスプリントを実施しました。動員した人数は250人以上、対象となったサービス領域は100以上に及びます。

初日だけで、緊急または高優先度に分類された53件を処理しています。当時の責任者は、重大インシデントと同じ切迫感で防御を固めており、この作業は重要な事業運営を除くすべてに優先すると社内に伝えていました。このスプリントを一度きりで終わらせず、恒常的なループへ作り替えたものがDefense Factoryにあたります。

5つの工程を回し続ける

ループはインベントリ、発見、動的検証、担当割り当て、修正の検証という5つの工程で構成されます。それぞれの工程が共有のコンテキストを読み書きし、次の周回では前回作ったシステム地図や担当情報を再利用します。毎回ゼロから始めないので、周回を重ねるほど未解決のリスクと差分に集中できるという考え方です。

数字を並べると、この作り込みが何を解いたのかが見えてきます。担当の自動割り当ては受理率90.6パーセントに到達し、報告の37パーセントは重複として統合されました。隔離環境で実際に動かして再現できたのは19.5パーセントで、この動的検証を通した後の誤検知率は0.81パーセントまで下がっています。修正パッチの生成はすべてCodexが担い、差し戻しに至った割合は0.53パーセントでした。

つまずいた箇所も率直に公開されています。初期の重大度ラベルは粗すぎて、エージェントに与える指示の違いで分類が揺れました。判定基準とプロンプトにバージョンを付け、繰り返し評価できる仕組みと、レビュー担当者が付けた優先度とその理由の記録を足すことで安定させています。重複排除の精度が上がるまでは、あえて自動ルーティングを止めていたそうです。

使われている道具立て

構成要素は既存のツールとつなぐことを前提にしています。ソース管理はGitHubやGitLab、検査系はSnykやSemgrep、Tenable、課題管理はJiraやLinear、ServiceNowといった具合です。Defense Factoryはそれらの接着剤として位置付けられ、再現可能な隔離環境のうえでエージェントを走らせます。

エージェント側の実体はCodexで、デスクトップ版・CLI・セキュリティ向けCLIが用途に応じて使い分けられます。モデルは汎用のものに加えて、防御向けのDaybreak Blueと攻撃側の視点を担うDaybreak Redが使われています。検証環境が毎回作り直される点も重要で、前の実行の状態が次に混ざらないことが再現性の前提になります。

同様の方向に動いているのはOpenAIだけではありません。Cloudflare、Ramp、Googleの各チームもこのアプローチを試しており、それぞれ自社の取り組みを公開しています。

始めるための3つの入り口

OpenAIは、いきなり全体を組むのではなくワークフローを1つ選んで動かすことを勧めています。用意されているのは、社内に提案するための説明資料、防御目的で高度なサイバー向けモデルを使うための申請窓口であるDaybreak、そして脆弱性の検出から修正案の作成までを試せるCodex Securityプラグインの3つです。技術的な詳細を扱うブログ記事も近く公開される予定とされています。

まとめ

Defense Factoryは、新しいスキャナーでも新しいモデルでもなく、既存のツールをエージェントの手が届く形に並べ直した運用の設計図です。250人規模のスプリントで得た知見を、誤検知率0.81パーセント、差し戻し率0.53パーセントといった具体的な数字とともに公開している点に価値があります。自動化をいきなり全部に広げるのではなく、人間のレビューで信頼を積んでから手放していったという道筋も、そのまま参考にできる部分でしょう。