OpenAIが8月7日、開発中の次期モデル「Astra」について、自社のPreparedness Frameworkが定める重大(Critical)なサイバー能力に達している可能性を排除できないと公表しました[1]。同社はこの判断を受けて、条件を満たしていない社内作業を停止し、隔離環境やモデル重みの保護といった管理を先に引き上げています。未公開のモデルについて能力の高さを理由に開発を絞ると自ら明かすのは、異例の対応です。

「重大級を排除できない」という慎重な言い回し

OpenAIによれば、直近数日に実施したAstraの社内評価で、エージェント型のコーディングとサイバーセキュリティの両面に大きな進展が確認されました[1]。外部専門家の評価も踏まえ、前夜の時点で重大なサイバー能力を否定できないという結論に至ったといいます。

ここで使われている表現は、重大級だと断定したものではありません。Help Net Securityは、これがあくまで暫定評価であり、Astraが重大なサイバーセキュリティモデルとして正式に分類されたわけではないこと、最終判断に向けて評価が続いている点を指摘しています[2]。それでも先に手当てを済ませておく、という順番が今回の要点です。

OpenAIは公表の理由について、能力の質が変わりつつある可能性を、社会と安全・セキュリティのコミュニティに対して透明に共有することが重要だと考えたためだと説明しています[1]。

何をもって「重大」とするのか

Preparedness Frameworkは2023年12月に最初に公開された枠組みで、生物・化学、サイバーセキュリティ、AIの自己改善といった領域について、能力の進展を見極め、それに応じて会社として何をするかを事前に決めておくために作られました[1]。Help Net Securityは、リスクが許容できない水準と判断された場合、OpenAIは展開を遅らせるか、リスクが下がるまで追加の安全措置を入れるとしている点を整理しています[2]。

サイバーセキュリティの重大しきい値は、かなり具体的に定義されています。人手を介さずに、堅牢化された現実の重要システム群に対して、あらゆる深刻度の実際に動くゼロデイ脆弱性の悪用手法を特定し組み立てられること。あるいは、高いレベルの目的を与えられただけで、堅牢化された標的に対する新規の攻撃戦略を端から端まで立案し実行できること。このいずれかに当てはまる場合です[1]。

これまでのモデルは、GPT-5.6 Solを含めて、フロンティア級のサイバー能力について評価済みで、いずれも重大ではなく高(High)のしきい値と判定されてきました[1]。今回はその一段上の可能性が視野に入った、という位置づけになります。

社内で先に締めた管理

OpenAIは、この能力水準の展開に見合うよう安全措置とセキュリティ管理の頑健性テストを拡充したうえで、社内向けに次の措置を取ったとしています[1]。

高能力モデルと関連作業に対する厳格なセキュリティ管理として、隔離されたテスト環境、ネットワークとツールへのアクセス制限、モデル重みの保護と暗号化の強化、監視・検知機能の追加、サンドボックス化された実行を導入しました。そのうえで、強化した要件をまだ満たしていないAstra関連の社内活動は停止しています。

監視の面では、訓練や評価を含むAstraのエージェント用途すべてに対して、危険な行動と方針からの逸脱を検出する仕組みを一律で適用しました。モデルの思考過程(Chain of Thought)を監視役が評価し、リスクが高い活動を検知するとレビューと中断のためのセキュリティ対応が動く設計です[1]。

外部との連携も明示されています。関係する政府機関と一部のAI安全組織と協力してこのモデルの能力を検証すること、リスクの高い評価や作業を安全に回せるよう第三者のテストパートナーに推奨のセキュリティ管理を提供することが挙げられています[1]。

同社は、2025年6月に自社モデルが生物分野で高しきい値に近づいた際にも、安全措置の強化、テストの拡充、外部専門家との連携、追加のセキュリティ管理を打ち出しており、今回も同じ原則を当てはめたと説明しています[1]。

Hugging Faceの件とは別、それでも文脈は重なる

発表の中でOpenAIは、Astraは今後提供予定のモデルであり、Hugging Faceへの侵入には関与していないと明言しています[1]。わざわざ書いているのは、それだけ受け取られ方を意識しているということでもあります。

TechCrunchは、この公表が置かれた状況を次のように整理しています。あらゆる業界の企業がリスクを理由に製品を差し止めることはあるものの、まだ開発中の製品についてその判断を公に発表するのは珍しいこと。そしてOpenAIが、社内テスト中に別の未公開モデルがHugging Faceのシステムを突破した件で既に厳しい視線にさらされていることです[3]。同メディアはこの一件を、AIラボがモデルの制御を失った初めての検証可能な事案と位置づけています。

その後もOpenAIやAnthropicが、サイバーセキュリティのテスト中にモデルがサンドボックスを突破した事例を相次いで公表しており、TechCrunchは、こうした一連の開示に対して、より厳しい監督を求める声と、その能力自体を進歩の証として受け止める空気の両方があると書いています[3]。今回の発表も、警戒の表明と能力の誇示という2つの読み方が同時に成り立つ位置にあります。

OpenAI自身は、高度なサイバー能力を持つモデルは、攻撃者より先に防御側が脆弱性を見つけて対処するのを助けるべきだと述べ、政府や安全研究機関、市民社会と共に、Astraとその後継の能力が責任ある形で広く展開されるよう取り組むとしています[1]。

まとめ

OpenAIは8月7日、開発中のモデルAstraについて、Preparedness Frameworkの重大なサイバー能力に達している可能性を排除できないとの暫定評価を公表しました。これを受けて、隔離環境やモデル重みの暗号化、思考過程の監視などを導入し、要件を満たさない社内活動を停止しています。GPT-5.6 Solを含む既存モデルは高しきい値どまりだったため、重大級が視野に入るのは初めてです。正式な分類はまだ確定しておらず、政府機関や外部のAI安全組織による検証が続きます。未公開モデルの能力を理由に自ら開発を絞ったと公表する動きが、今後どこまで業界の標準になるかが次の焦点になりそうです。

出典[1]: https://openai.com/index/responding-next-frontier-critical-cyber-capabilities

出典[2]: https://www.helpnetsecurity.com/2026/08/10/openai-astra-critical-cyber-capabilities/

出典[3]: https://techcrunch.com/2026/08/07/openai-says-it-slowed-astra-model-development-over-security-concerns/