OpenAIは、サイバーセキュリティ向けの取り組み「Daybreak」を拡張し、防御担当者向けの新モデル「GPT-5.5-Cyber」の正式版を公開しました[1]。狙いは、AIが得意としてきた脆弱性の「発見」から一歩進み、修正パッチの作成までを高速に自動化することです。コード解析支援の「Codex Security」プラグイン更新や、オープンソースの保守を支える「Patch the Planet」も同時に発表されました。
「Daybreak」が狙うのは発見から修正への転換
OpenAIによると、AIはサイバーセキュリティの前提を大きく変えつつあります[1]。これまで深刻な脆弱性を見つけるには、専門知識と時間、複雑なシステムへの深い理解が必要でした。ところが最新のモデルは大規模なコードベースを読み解き、攻撃経路を推論し、隠れた問題を表面化できるようになっています。
その結果、ボトルネックは「発見」から「修正」へと移りました。脆弱性の報告だけでは誰も守れず、問題の検証、影響範囲の把握、パッチの開発とテスト、公開の調整、修正の展開まで踏み込んで初めて価値が生まれます。Daybreakは、この後半の工程をAIと人間の協働で底上げし、モデルの能力を現実のリスク低減につなげる取り組みだと位置づけられています[1]。
OpenAIは、最先端の防御能力が一部の組織に集中する状況を避けるべきだとも述べています。ソフトウェアは重要インフラから業務アプリ、政府ネットワークまで生活のあらゆる場面に関わるため、攻撃者に先んじて修正できるよう、防御側こそ広くこうした能力を使えるべきだという考え方です[1]。
サイバー防御特化モデル「GPT-5.5-Cyber」の実力
今回の中核となるのが、防御業務に特化したモデル「GPT-5.5-Cyber」の正式版です。当初の先行版は専門的な作業での過剰な拒否を減らすことに主眼を置いていましたが、今回の更新では脆弱性の発見と修正支援の能力そのものを引き上げています[1]。大規模なコードベースにわたって解析を持続し、脆弱なコードが実際に到達可能かを追跡し、管理された環境で問題を検証したうえで、パッチの開発・テストと人間によるレビュー用の証跡作成までを担えるとしています。
性能は複数のベンチマークで示されています。既知の脆弱性を再現できるかを測る「CyberGym」では、更新版のGPT-5.5-Cyberが単体モデル評価で85.6パーセントに達し、GPT-5.5の81.8パーセントを上回りました。これはOpenAIが単体モデルで計測した中で最も高いスコアだとしています[1]。
さらに、既知の脆弱性を実際に動く攻撃へ転用できるかを試す「ExploitGym」では39.5パーセント(GPT-5.5は25.95パーセント)、複雑なソフトウェアを対象に長期的な脆弱性発見と実証コード生成を評価する「SEC-bench Pro」では69.8パーセント(同63.1パーセント)と、いずれも従来モデルを上回りました[1]。
ただしOpenAIは、ベンチマークは物語の一部に過ぎないとも釘を刺しています。実務で重要なのは、本物の脆弱性を見つけ、対応すべき問題をノイズと区別し、安全に修正を適用できるかどうかであり、その評価は調整済みの情報公開が完了するのに合わせて継続しているとのことです[1]。なお、GPT-5.5-Cyberはより踏み込んだ挙動を許容するモデルであるため、対象は認証済みの防御担当者に限定され、強固な本人確認や監視、範囲を絞った制御とレビューが組み合わされます。多くの防御担当者にとっては、まず「Trusted Access for Cyber」付きのGPT-5.5とCodex Securityが出発点になるとしています[1]。
「Codex Security」とオープンソースを守る「Patch the Planet」
開発現場向けには、コード解析支援「Codex Security」プラグインの更新も発表されました。開発者の隣にセキュリティエンジニアがいるような状態を目指す設計で、チームのコードと脅威モデルを理解し、起こり得る脆弱性を特定し、影響箇所が到達可能かを判断し、検証の証跡を集め、対象を絞ったパッチを作って結果を検証します[1]。どの問題を調べ、どの変更を適用し、何を共有するかの判断は人間が握る仕組みです。
その規模感も具体的な数字で示されています。3月に研究プレビューとして公開された「Codex Securityクラウド」は、これまでに3万を超えるコードベースで3,000万件以上のコミットを解析しました。人間のレビュアーが手動で修正済みと判断した指摘は7万件を超え、自動で修正済みと判定された指摘は50万件以上に上ります[1]。OpenAIは、これが今やパッチ適用に求められる規模だと説明しています。
オープンソース保守者を支援する「Patch the Planet」も始動しました。セキュリティ企業のTrail of Bitsと立ち上げ、HackerOneやCalifと連携して専門の研究者に資金を提供し、Codex Securityや高性能モデルを使って保守者と直接協働する取り組みです[1]。cURLやGo、Python、Sigstore、pyca/cryptographyなど30を超えるプロジェクトが参加を表明しています。
背景には、広く使われるソフトウェアほど少人数で支えられているという現実があります。Linux FoundationとHarvard大学の調査では、調査対象となった主要プロジェクトの94パーセントで、1年間に追加されたコードの90パーセント超を10人未満の開発者が担っていました[1]。AIが脆弱性の発見を速めるほど保守者の負担も増えるため、Patch the Planetは専門家による人間のレビューを軸に据え、保守者に届く前に脆弱性とパッチの検証・重複排除を済ませる形で負担を抑えます。参加プロジェクトには、ChatGPT Proや条件付きのCodex Security利用、開発・自動化向けのAPIクレジットが提供されます[1]。
各国政府との連携と日本の位置づけ
OpenAIは、各国政府や機関とも防御能力の向上で連携を進めています。直近1か月で、オーストラリア、カナダ、フランス、ドイツ、日本、韓国、そしてEUのENISA(欧州連合サイバーセキュリティ機関)などと「Trusted Access for Cyber」のパートナーシップを結んだとしています[1]。英国政府ともサイバーや評価の分野で関係を深めているとのことで、日本もこの枠組みに名を連ねている点は国内の防御担当者にとっても見逃せません。
米国政府との関係では、AI標準・イノベーションセンター(CAISI)とGPT-5.5および5.5-Cyberの展開前テストを進めているほか、国家サイバー長官室(ONCD)や科学技術政策局(OSTP)とも、関連する大統領令や業界標準の実装で協力しているとしています[1]。重要インフラの運用者とも直接連携し、各システムに合わせた安全策づくりを進める計画です。
まとめ
OpenAIの「Daybreak」拡張は、AIによるサイバー防御の重心を「脆弱性を多く見つける」ことから「安全に修正を当てる」ことへと移す試みです。正式版のGPT-5.5-CyberはCyberGymで85.6パーセントという過去最高のスコアを記録し、Codex SecurityやPatch the Planet、各国政府との連携と合わせて、発見から修正までを一気通貫で支える体制を整えました。攻撃と防御の双方でAIの能力が高まるなか、防御側がその力をどこまで使いこなせるかが今後の焦点になりそうです。
