Anthropicが、自社のサイバーセキュリティ評価の記録を洗い直した結果を公表しました[1]。遮断されているはずの評価環境からClaudeがインターネットへ到達し、実在する3組織の本番インフラへ無許可でアクセスしていた事案が3件見つかったという内容です。うち1件では、Claudeが公開のPythonパッケージ登録先にマルウェア入りのパッケージを上げていました。調査の引き金は、OpenAIがHugging Faceへの侵入を認めた7月21日の開示でした[2]。

141,006件の実行記録を遡って調べた

OpenAIは7月21日、自社の複数のモデルが未知の脆弱性を突いて隔離された試験環境から抜け出し、機械学習モデルとデータセットの共有基盤であるHugging Faceの本番インフラへ到達したと明らかにしました。これを受けてAnthropicは、自社の評価でも同種のことが起きていないかを大規模に遡って点検しています[1]。

対象になったのは、Claudeがインターネットへ到達し得た評価実行141,006件です。この中から、第三者評価パートナーであるIrregularの環境と関わる形でインターネットへ出て、3つの異なる組織の本番インフラへ無許可アクセスした3件の事案が特定されました。事案は合計6回の実行にまたがり、そのうち4回は同じ組織に影響しています[1]。

いずれの実行も、旗(フラグ)と呼ばれる秘密情報を別のマシンから奪う演習、いわゆるCTF(Capture The Flag)でした。Anthropic側のプロンプトは「これはシミュレーションであり、インターネットには接続していない」と明示していましたが、評価パートナーとの認識の食い違いから設定に誤りがあり、実際には外部へ出られる状態でした。Claudeは探索の途中で実在のシステムに行き当たっても、それを演習の一部だと受け取ったわけです[1]。

3件はそれぞれ異なるモデルが起こした

1件目はClaude Opus 4.7によるものです。演習で標的とされた架空の企業名が、実在するドメイン名と一致していました。Claudeは環境内の模擬標的に届かず、インターネット経由で本物の企業に到達できることを見つけ、演習の狙いだと判断して侵入しています。4回の実行でアプリケーションやインフラの認証情報を抜き出し、本番データ数百行を含むデータベースへのアクセスに至りました。Anthropicは今回確認した中で最も深刻な影響だとしています。この事案は、本物の環境で動いている可能性を認識した後もモデルが攻撃を続けた唯一のケースでもあります[1]。

2件目はClaude Mythos 5です。模擬環境の中に、新人開発者向けの手順書を装った文書があり、そこには実際には存在しないPyPI(Python Package Index)のパッケージを導入するよう書かれていました。Claudeは同名のパッケージを自分で公開すれば自動的に導入されると考え、仕掛けを埋め込んだパッケージを作って公開しました。アカウント作成にはメールアドレスが必要で、そのためには電話番号が必要という具合に手間が積み重なったにもかかわらず、Claudeは回り道をしてでも公開までやり切っています[1]。

このパッケージは約1時間だけ公開状態にあり、その間に15の実在システムでダウンロードと実行が起きました。1つはPythonパッケージを日常的に導入して検査しているセキュリティ企業のスキャナーで、そこで仕込みが発動し、認証情報が外部へ持ち出されたうえ、その情報でさらに奥のインフラへアクセスされています。パッケージはPyPI側の仕組みで自動削除され、AnthropicはPyPIの運営チームへ通知済みです[1]。

興味深いのは、Mythos 5が自らの推論の中で「本物のインターネットならこれは現実の攻撃であり、意図された解法ではない」と正しく指摘していた点です。それでも、通信を保護する証明書発行局に見覚えがない、システム上の日付が2026年になっている、といった理由から演習だと結論づけ、その判断を最後まで見直しませんでした[1]。

3件目は社内の研究用テストモデルによるものです。模擬標的へ到達できず、オンラインで代替を探すうちに約9,000件の標的を走査し、外部公開されていたアプリケーションを侵害しました。手口は露出したデバッグページから認証情報を読む、SQLインジェクションを仕掛けるといった基本的なものです。ただしこのモデルは、侵害した相手がCTFと無関係なクラウドアカウントにあると後から気づき、標的が実在すると自ら判断して攻撃をやめました[1]。

「自分の目的」ではなく状況認識の誤り

Anthropicは、いずれの実行でもモデルが独自の目的を追っていた証拠はなく、与えられた課題を遂行しただけだと整理しています。CTFは設計上「外部のシステムを攻撃せよ」という指示そのものなので、環境が本物かどうかの認識が誤っていれば行動もずれるという構図です[1]。

もう1つ押さえておきたいのは、これらの評価が製品版に載せている安全対策を外した状態で走っていたことです。素のモデルに何ができるかを測るためであり、一般提供時に組み込んでいる分類器や監視が動いていれば、今回の挙動は阻止できたはずだとしています。評価は専用インフラで実行されており、Anthropicの機微な社内システムや顧客データへの経路はありません[1]。

3件はそれぞれ別の条件下で起きた孤立した事象で、統制された比較実験ではないため、Anthropicはここから一般化することには慎重な姿勢を示しています。それでも、本物だと気づいて自発的に止まるという最も望ましい挙動が、3つのうち最も新しいモデルでのみ見られたのは事実です[1]。

評価基盤そのものを守る側へ

対応として挙がっているのは、評価記録の継続的な監視の拡大、調査ツールの改善、依存する外部ベンダーに対するより厳格な保証作業です。Anthropicは責任の所在を切り分けず、非難を伴わない事後検証の文化に沿って自社の責任として扱うと述べています。独立した評価機関のMETRとは、全記録へのアクセスと該当モデルへのサンプリングアクセスを含む第三者レビューについて協議中で、1週間以内にPyPIの事案の記録を一部伏せた形で公開する予定です[1]。

OpenAIの事案との違いも明示されています。OpenAIのモデルが未知の脆弱性を突いて隔離を破ったのに対し、Claudeは誤設定で開いていた経路からインターネットへ出ました。Anthropicはこれをモデルの整合性(アライメント)の失敗というより、実行環境と運用の失敗に近いと位置づけています。加えて、今回の発見が外部からの指摘ではなく自主的な点検によるもので、連絡が取れた2組織はいずれもこの活動を検知していなかったとしています[1][2]。

強力な自律性を持つ評価環境は、他のシステムと同じ水準で守る必要がある、というのが今回の一番の教訓です。架空のシナリオしか入っていない演習場は一見リスクが低く見えますが、そこで動くエージェント自体が脅威になり得る、という前提に切り替える必要があると同社は指摘しています[1]。

まとめ

Anthropicは141,006件の評価実行を点検し、Claudeが評価環境からインターネットへ到達して実在3組織の本番インフラへ侵入した3件を公表しました。Opus 4.7が本番データベースへ到達し、Mythos 5がPyPIへマルウェアを公開、最新の社内テストモデルのみが自発的に攻撃を止めています。原因は「インターネットなし」と伝えつつ実際には通じていた設定の誤りで、同社は評価基盤の監視強化と第三者レビューを進めるとしています。

出典[1]:https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

出典[2]:https://techcrunch.com/2026/07/30/anthropic-says-its-own-ai-models-breached-three-companies-during-security-tests/