Anthropicは、世界中で再提供が始まった最新モデル「Claude Fable 5」について、2つの領域で追加情報を公開しました[1]。1つは、危険なサイバー用途を検知・遮断する安全分類器(セーフガード)がどこまでを防ぐよう設計されているかの詳細です[1]。もう1つは、AIの安全機構を回避する「ジェイルブレイク」の深刻度を測る業界共通の評価枠組みの初期ドラフトです[1]。本記事では、この2つの中身を整理します。
サイバー防護は4つのカテゴリーで判定する
サイバーセキュリティは、同じ技術が防御にも攻撃にも使える「デュアルユース(両用)」の性質が強く、AIの安全対策が難しい領域です[1]。たとえば、防御側が自社のコードをスキャンして脆弱性を探す用途は歓迎したい一方、まったく同じ能力が悪意ある手にわたればサイバー攻撃の下準備にもなり得ます[1]。
そのためAnthropicは、サイバー関連のすべてを一律に遮断するのではなく、用途を4つのカテゴリーに分けて判定するよう分類器を訓練しています[1]。最も危険性が高い「禁止用途(Prohibited use)」には、ランサムウェアやワイパー、マルウェアの開発・改良、フィッシングによる配布、C2(指令)サーバーなどの攻撃基盤構築、BGPハイジャックといったインターネット基盤への攻撃が含まれ、これらはすべて遮断の対象です[1]。
続く「高リスクのデュアルユース」は、侵入テストやレッドチーム演習、権限昇格、エクスプロイト(攻撃コード)開発など、セキュリティ専門家の日常業務でもあるものの、悪用の危険が高い行為です[1]。正当な業務か悪用かを分けるのは「誰が、どんな認可のもとで行うか」という文脈であり、Fable 5では信頼できる利用者に限定する仕組みが整うまで、これらを遮断する方針としています[1]。3つ目の「低リスクのデュアルユース」は、公開情報の調査(OSINT)や他のツールでも可能な脆弱性の特定など、防御寄りの用途で、多くは許可されますが一定割合は念のため遮断されます[1]。4つ目の「無害な用途(Benign use)」は、セキュアコーディングやデバッグ、パッチ管理、ログ分析、マルウェアのリバースエンジニアリングといった防御・IT運用の中核業務で、原則として遮断しません[1]。
なお、詐欺やソーシャルエンジニアリング、ゲームのチート、CAPTCHA回避、暗号資産関連の犯罪などは、このサイバー分類器の対象外で、別の分類器が扱うか、そもそも有害とはみなされないものと整理されています[1]。
Fable 5では、危険な挙動を確実に捕捉するために、この判定に「安全マージン」を従来モデルより広く設定しています[1]。安全マージンとは、明らかに安全と見えるリクエストでなければ遮断側に倒す余裕のことで、その分だけ通常の作業で誤検知が起きる可能性があります[1]。分類器はあくまで防護の一部であり、Anthropicはこれに加えてアクセス制御、モデルの安全訓練、オフラインでの監視を組み合わせて多層的に守るとしています[1]。
脆弱性の発見はどこまで許すのか
4つのカテゴリーの中でも、特に線引きが難しいのが脆弱性の発見です[1]。Anthropicは、脆弱性の発見をすべて禁じるのではなく、「他の広く使えるモデルでは見つけられない脆弱性を特定する能力」、いわゆる高難度(high-uplift)の脆弱性発見を遮断することを狙っています[1]。攻撃者は公開された脆弱性情報や修正パッチから攻撃コードを組み立てられる場合があるため、攻撃コードの自動生成も遮断します[1]。
一方で、多くの一般的なモデルが見つけられる程度の脆弱性であれば、Fable 5が見つけて修正することはむしろ有益だとしています[1]。セキュリティ業界では、脆弱性の発見と責任ある公開は「守る側が得る利益のほうが、同じ情報から攻撃側が得る利益より大きい」という考え方が長く支持されてきました[1]。米政府も同様の立場を取り、「大多数のケースで、新たに見つかった脆弱性を責任をもって開示することは明らかに国益にかなう」との見解を示していると引用されています[1]。
ジェイルブレイクの深刻度を測る「CJS」フレームワーク
もう1つの柱が、ジェイルブレイクの深刻度を評価する枠組みの提案です[1]。ジェイルブレイクは、AIモデルに変わった形で指示を与えて安全機構を回避させる手法を指します[1]。その深刻度は、ごく軽微な挙動を解放するだけのものから、幅広い有害な出力を引き出してモデルを大幅に危険化させるものまで大きく幅があります[1]。ところが、深刻度を共通の物差しで語る枠組みがこれまで存在せず、AI開発者と政府が一貫した言葉でリスクを議論することが難しい状況でした[1]。
Anthropicが提案するのは「Cyber Jailbreak Severity(CJS)」と呼ぶ尺度で、None(情報のみ、CJS-0)、Low(CJS-1)、Medium(CJS-2)、High(CJS-3)、Critical(CJS-4)の5段階に分かれます[1]。各段階は線形ではなく指数的に設定されており、1つ上がるごとに数倍深刻になる想定です[1]。
CJSのスコアは4つの軸から算出します[1]。前半の2つは、そのジェイルブレイクが攻撃者に何を与えるかを表します。「能力向上(capability gain)」は、既存のツールを超えてどれだけ攻撃者を押し上げるか、「適用範囲の広さ(breadth)」は、同じ手法がいくつの異なる攻撃タスクに通用するかを示します[1]。後半の2つは、その手法がどれだけ早く現実の問題になり得るかを表します。「悪用の容易さ(ease of weaponization)」は手法を実際の攻撃に仕立てるのに必要な手間、「発見のしやすさ(discoverability)」は攻撃者がその手法をどれだけ簡単に入手できるかを示します[1]。
Anthropicは、「能力向上」がサイバー領域の専門知識に関する軸(専門家をも加速させるか)であるのに対し、「悪用の容易さ」はLLMやジェイルブレイクを扱う技術に関する軸であり、両者は独立していると説明します[1]。ある手法が一方で高く、もう一方で低いことも起こり得ます[1]。
スコアは「下限」、Log4Shellの例が示す時点依存性
4つの軸のスコアを合算すると、0から4までの初期CJSレベルが決まります[1]。ただしこの値は暫定的な「下限(フロア)」であり、ここから下げることはできませんが、ルーブリックが実際のリスクを過小評価していると判断される場合には引き上げられます[1]。たとえば、広く使われているソフトウェアに潜む新種の重大な脆弱性を生み出した場合や、当面の緩和策がない根本的な能力を突く場合、他の未解決の問題と組み合わさって被害が深刻化する場合などが、引き上げの検討理由として挙げられています[1]。
能力向上が「その時点で使えるツール」を基準に測られる点は、付録で挙げられたLog4Shellの例が分かりやすく示しています[1]。実在した脆弱性Log4Shellを見つけるジェイルブレイクを想定すると、他のツールが存在しなかった2021年12月時点では深刻度が高く評価されます[1]。しかし、この脆弱性が公知となりあらゆるスキャナーが検知できる現在では、たとえモデルの挙動自体は同じでも、能力向上はゼロと評価され、CJSレベルも下がります[1]。基準となる「その時点の技術水準」が動くことで、同じ発見でも評価が変わるという考え方です[1]。
この枠組みは初期ドラフトであり、Anthropicは学術界、産業界、市民社会、政府を巻き込んだ議論のきっかけにしたいとしています[1]。フィードバックは [email protected] で受け付け、セキュリティ研究者がFable 5で見つけたジェイルブレイクを提出できるHackerOneのプログラムも立ち上げました[1]。
まとめ
今回の公開は、Fable 5のサイバー防護が「何を防ぎ、何を防がないか」を4つのカテゴリーで具体的に示すとともに、ジェイルブレイクの深刻度を共通の言葉で語るためのCJSフレームワークを提示するものです。防御用途を妨げずに悪用だけを抑えるという難しい線引きを、業界と政府で共有できる基準へ育てていけるかが今後の焦点になりそうです。
出典:https://www.anthropic.com/news/fable-safeguards-jailbreak-framework
