Anthropicが、Claude Fable 5の生物学分野におけるセーフガードを更新しました[1]。生物学に関わる質問を投げると能力の低いモデルへ自動的に切り替わる「フォールバック」が、同社の検証で約85パーセント減ったとしています。健康や学習目的の素朴な問い合わせまで弾かれていた状態から、ようやく実用に近い線引きへ寄せた格好です。

生物学の質問がほぼ全て止められていた理由

Fable 5は公開時点で、生物学に関する問い合わせのほぼ全てをブロックする設定で出荷されていました[1]。Anthropicはこれを事故ではなく意図的な選択だったと説明しています。

背景にあるのは、モデルの能力そのものです。同社の評価では、Fable 5は一部の複雑な生物学タスクで専門家を上回り、別のタスクでは実務的な支援まで行えるとされています[1]。新しい治療法を開発する研究者にとっては強力な相棒になりますが、同じ能力は悪意を持った人物が生物兵器を開発する際の後押しにもなり得ます。Anthropicは、Fable 5がそうした人物に対して他のどこでも手に入らない水準の助力を与えかねないと自ら認めています[1]。

やっかいなのは、有益な用途と有害な用途を見分けるのが本質的に難しい点です。病気の治療法を研究するには、その病気を引き起こす危険な物質そのものを扱う必要がある場合があります。Anthropicが挙げているのは生ワクチンの例で、防ぎたい病原体と同じものを培養する工程が避けられません[1]。高血圧治療薬カプトプリルも、ヒトの血圧を急降下させるヘビ毒の成分を単離するところから開発が始まっています[1]。

この曖昧さは、意図を隠したい側にとって好都合でもあります。危険な作業を通常の研究に見せかける手口が成立してしまうためです。Anthropicは米国のインテリジェンス・コミュニティによる2026年の年次脅威評価を引き合いに出し、合成生物学やゲノム編集の進展が新種の生物学的脅威につながり得ること、複数の国家が攻撃的な生物・化学兵器計画を維持しているとみられることに言及しています[1]。

そこで同社は、生物学の入口を広く閉じたまま公開に踏み切り、他分野の利用者に先にモデルを届ける道を選びました。誤検知が大量に出るのは織り込み済みで、それでも公開を数週間から数か月遅らせるよりはましだという判断です[1]。

分類器の憲法を書き直した

Fable 5の生物学ガードは、安全分類器と呼ばれる小型の自動判定システムが担っています[1]。守るべき生物学タスクや有害な出力を検知すると、リクエストはOpus 5へ回されます。Opus 5はFable 5ほどの生物学的能力を持たないため、悪用時の助力も限定される、という設計です。利用者から見えている「フォールバック」の正体がこれにあたります。

分類器を精密に作るのは簡単ではありません。対象内と対象外の境界を学習させたうえで、誤検知と見逃しの両方を抑え、さらにジェイルブレイク(回避操作)にも耐える必要があります[1]。Anthropicは同種の分類器をサイバーセキュリティ分野でも運用しており、その仕組みについては以前に公開しています[2]。

今回の更新でAnthropicが手を入れたのは、分類器の憲法と呼ばれるルール集です[1]。守るべき内容と許容する内容を切り分ける規則を数週間かけて書き直し、無害な用途を細かく明示的に除外しました。社内外の専門家から意見を集めたうえで、新しい憲法に沿った学習データを作り直し、分類器を再訓練しています。再訓練後は、有害・デュアルユースの研究内容には引き続き反応しつつ、良性の用途では発火しにくくなっていることを検証したとしています[1]。

緩んだ範囲と、残された線引き

実際の使い勝手として変わるのは、日常的な健康や教育の質問です。検査値の読み解き、症状の理解、学習目的で生物学を調べるといった用途では、フォールバックに当たる場面が大幅に減ります[1]。医療従事者が臨床業務でFable 5から受けられる支援も広がります。

生物学以外も含めたフォールバック全体の件数も、あわせて下がる見込みです。Anthropicの試算では、Claude.aiで約67パーセント、Coworkで55パーセント、Claude Codeで17パーセント、Claude Platformで7パーセントの減少を見込んでいます[1]。製品によって差が大きいのは、もともと生物学関連の質問が占める割合が違うためと読めます。

一方で、緩めていない領域もはっきり示されています。ウイルス学、毒性学、分子設計といったデュアルユースと判断される依頼は、これまで通りOpus 5へ回されます[1]。つまり専門的な生物学研究や創薬の現場では、まだFable 5をそのまま使える状態ではありません。Anthropicはこの差を埋める手段として、審査を通った研究者に先端モデルを開放する信頼済みアクセスの仕組みを挙げており、その整備に取り組むとしています[1]。

安全側の余裕から生じる誤検知も、完全にはなくならないと同社は明言しています[1]。リスクが極めて低い依頼であっても、分類器の安全マージンに入っていれば発火する余地は残ります。

まとめ

AnthropicはClaude Fable 5の生物学セーフガードを見直し、分類器の憲法を書き直すことで生物学関連のフォールバックを約85パーセント削減しました。検査値の解釈や学習目的の質問といった日常的な用途では、能力の低いモデルへ回される場面が大きく減ります。ただしウイルス学や毒性学、分子設計は引き続き対象外で、研究用途の全面開放は信頼済みアクセスの整備待ちという段階です。安全性を優先して広く閉じた入口を、実データと専門家の意見をもとに少しずつ開けていく進め方が具体的な数字で示された事例と言えます。

出典 [1] https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards

出典 [2] https://www.anthropic.com/news/fable-safeguards-jailbreak-framework