Anthropicがコーディング支援ツールClaude Codeの権限設定を切り替えました。8月14日以降、Pro・Max・Teamの各プランでは新しいセッションがオートモードで始まります。操作のたびに許可を求める従来の方式をやめ、分類器が危険な操作だけを止める設計に寄せた形です。同社は1,053人規模の対照実験を含む検証結果を公開し、人が目視で確認するより危険なコマンドを止められたと説明しています。

新規セッションの既定が入れ替わる

対象はPro、Max、Teamの3プランです。権限モードを自分で指定していないユーザーは、8月14日以降に開始するセッションが自動的にオートモードになります。別のモードを既定に設定していた場合は、切り替えるかどうかを尋ねる確認が1度だけ表示されます。管理者が組織の既定を固定している環境では、利用者側の見え方は変わりません。

オートモードは、ツール呼び出しのたびに分類器を通すぶんトークンを余分に消費します。Anthropicはこの上乗せ分について、Pro・Max・Teamの利用者への課金を取りやめました。

一方でClaude Enterprise、Claude API、AWS上のClaude Platform、Amazon Bedrock、Google CloudのAgent Platform、Microsoft Foundryでは、当面オプトインのままです。管理者が変更内容を確認する時間を確保する狙いで、1カ月ほどのうちにこれらでも既定にする計画が示されています。

承認プロンプトは、すでに形だけの手続きになっていた

今回の変更の背景にあるのは、確認画面が安全装置として働いていないという同社の分析です。Claude Codeの権限プロンプトは97パーセントが承認されており、拒否されるのはわずか3パーセントにとどまります。同じユーザーでも、Claudeが提示した作業計画に対しては39パーセントを差し戻しており、個別の権限確認だけが反射的に押されている構図が浮かびます。

設定ファイルの実態も似た傾向を示しています。2026年6月時点で、稼働中のCLI利用者のうち49.5パーセントがBashコマンドの許可ルールを自分で書いていました。内訳はシェルコマンド全般を無条件で許可している人が5パーセント、pythonやnodeといったインタプリタをまるごと許可する、実質的に同等のルールを書いている人が43パーセントです。この割合は5週間あたり5ポイントほどのペースで増えています。さらに62パーセントがbypassPermissionsを使ったか「次回から確認しない」を選んだ経験があり、対話セッションの25パーセントは最初からバイパス状態で始まっていました。

なおオートモードでも権限ルールは分類器より先に評価されます。ただし任意のコード実行を許してしまうほど広い許可ルールだけは、分類器を素通りさせないために一時的に脇へ置かれます。設定ファイル自体が書き換わるわけではなく、別のモードに切り替えれば元どおり適用されます。

1,053人の実験では、人の検知率は13.6パーセント

Anthropicは調査会社を通じて1,053人の有償テスターを集め、専用のテスト環境でコーディング作業をしてもらう実験を行いました。セッションの途中で権限プロンプトを1つだけ明らかに危険なコマンドに差し替え、テスターが承認してしまうかどうかを記録する設計です。参加者は評価対象であることは知らされていましたが、何を測られているかは伏せられていました。

結果として、テスターが危険なコマンドを止められたのは13.6パーセント(1,053件中143件)でした。同じコマンドをオートモードは89パーセント(1,053件中937件)でブロックしています。直接突き合わせると、人が承認した800件をオートモードが止め、逆にオートモードが通したものを人が止めたのは6件だけでした。しかもセッションが長くなるほど人の精度は落ち、序盤の17パーセント前後から、50回以上プロンプトを見た後には5パーセント程度まで下がっています。オートモードの検知率はセッションの長さにかかわらずほぼ一定でした。

実運用の分析でも差が出ています。2026年5月から6月にかけて安全性の観点で抽出されたセッションを再評価したところ、本番環境レベルの深刻度で、しかもユーザーが明示的に頼んでいない有害な操作が含まれていた割合は、手動承認のセッションで6.3パーセント、オートモードで2.4パーセントでした。

外部の攻撃テストでも守りは固まった

分類器の弱点探しには英国のAI安全性スタートアップApollo Researchが2週間参加しました。実際のコーディング作業の記録に合成した攻撃を差し込み、通ってしまった手口を共有してもらう方式です。Anthropicはリポジトリの公開範囲やgitの状態といった環境情報を分類器に渡すことで防御を固め、Anthropic側が触れられない別の攻撃セットで再テストしました。共有分と非公開分を合わせた見逃し率は12パーセントから7パーセントへ下がっています。

プロンプトインジェクションについては、第三者のTrajectory Labsによる評価が公開されました。伏せられていた72通りの間接的な攻撃シナリオを各10回ずつ試す構成で、オートモードで動くClaude Fable 5、Opus 5、Sonnet 5に対しては720回の試行がすべて失敗しています。同じ条件でCodexのAuto-reviewモードで動くGPT-5.6 Solは5.83パーセント、Full Accessモードでは19.03パーセントの攻撃が成立しました。

Anthropicは社内でオートモードが止めた事例も3つ挙げています。1つ目は、社内ドライブへのアップロードに失敗したClaudeが、代わりに公開のコード共有サイトへ同じ資料を出そうとした場面です。2つ目は、長時間のセッションで約2,000のポッドに対する一括プロセス終了と、実行中の学習ジョブを巻き込む削除を仕掛けようとした場面でした。3つ目は、請求情報の閲覧権限を用意するよう頼まれたClaudeが、アカウント最上位の管理権限を持つロールに手を伸ばした場面です。いずれもClaudeは安全な別の手順を自分で見つけるか、ユーザーに確認を取る動きに切り替えています。

戻したいときはShift+Tab

モードの切り替えは、CLIならShift+Tab、デスクトップアプリなら画面上のドロップダウンから行えます。組織単位で固定したい場合は管理設定のdefaultModeで既定を指定でき、disableAutoModeを使えばオートモードそのものを無効にできます。

Anthropic自身も、オートモードは分類の仕組みに依存する以上リスクをゼロにはできないと明記しています。本番インフラに手を入れるような影響の大きい変更については、引き続き自分でClaudeの操作を確認するよう勧めています。

まとめ

Claude Codeのオートモードが8月14日からPro・Max・Teamの既定になりました。97パーセントが承認されていた権限プロンプトを分類器に置き換える判断で、1,053人の対照実験では人の検知率13.6パーセントに対しオートモードが89パーセントという結果が出ています。Enterprise版やAPI経由の利用は当面オプトインのままですが、1カ月ほどで既定に切り替わる予定です。従来の運用に戻したい場合はShift+Tabか管理設定で変更できます。