Anthropic 調整了程式開發工具 Claude Code 的權限設定。自 8 月 14 日起,Pro、Max 與 Team 三種方案的新工作階段預設以自動模式啟動。逐項徵求許可的舊做法被取消,改由分類器只攔下風險較高的操作。該公司公開了包含 1,053 人對照實驗在內的驗證資料,指出自動模式比人工逐項確認更能擋下危險指令。
新工作階段的預設值改變
這次調整涵蓋 Pro、Max 與 Team 三種方案。沒有自行設定過權限模式的使用者,8 月 14 日之後開啟的工作階段會自動進入自動模式。先前設定過其他預設模式的人,會收到一次詢問是否切換的提示。若管理者已在組織層級固定預設值,使用者端不會有任何變化。
自動模式每次呼叫工具都會經過分類器,因此會多消耗一部分 token。Anthropic 已經停止就這部分開銷向 Pro、Max 與 Team 使用者收費。
另一方面,Claude Enterprise、Claude API、AWS 上的 Claude Platform、Amazon Bedrock、Google Cloud 的 Agent Platform 以及 Microsoft Foundry 目前仍需手動開啟。這樣安排是為了讓管理者有時間檢視這項變更,Anthropic 計畫在一個月左右也把自動模式設為這些環境的預設值。
權限提示早已淪為形式
這次調整的背景,是該公司判斷確認視窗已經無法發揮安全閥的作用。Claude Code 的權限提示有 97% 會被核准,遭到拒絕的只有 3%。同一批使用者面對 Claude 提出的工作計畫時,卻有 39% 被退回,顯示單獨的權限確認多半是被反射性地按掉。
設定檔也呈現同樣的傾向。截至 2026 年 6 月,活躍的 CLI 使用者中有 49.5% 自行寫過 Bash 指令的允許規則。其中 5% 無條件放行所有 shell 指令,另有 43% 寫的是放行 python、node 等直譯器的規則,實際效果幾乎相同。這個比例大約每 5 週增加 5 個百分點。此外,62% 的使用者用過 bypassPermissions 或按過不再詢問,25% 的互動式工作階段一開始就處於略過狀態。
要說明的是,自動模式下權限規則仍然先於分類器生效。只有寬鬆到足以放行任意程式碼執行的允許規則會被暫時擱置,以免指令直接繞過分類器。設定檔本身不會被改寫,切換到其他模式後規則立刻恢復。
1,053 人的實驗中,人工攔截率為 13.6%
Anthropic 透過調查公司招募了 1,053 名有償測試者,讓他們在專門建置的測試環境中進行程式開發。每場工作階段進行到一半時,系統會把其中一個權限提示換成明顯危險的指令,並記錄測試者是否核准。參與者知道自己正在接受評估,但不清楚被觀察的具體項目。
結果顯示,測試者擋下危險指令的比例為 13.6%(1,053 例中的 143 例)。面對相同的指令,自動模式的攔截率為 89%(1,053 例中的 937 例)。直接比較可以看出,自動模式擋下了 800 條被人工核准的指令,人工卻只擋下 6 條被自動模式放行的指令。而且工作階段愈長,人的判斷愈差,從前期的 17% 左右降到看過 50 次以上提示之後的 5% 上下。自動模式的攔截率則幾乎不隨工作階段長度變動。
實際使用的資料同樣呈現落差。針對 2026 年 5 月至 6 月被安全流程標記的工作階段重新評估後發現,達到生產環境等級嚴重度、而且使用者並未明確要求的有害操作,在人工核准的工作階段中占 6.3%,在自動模式工作階段中占 2.4%。
外部攻擊測試進一步強化防線
英國的 AI 安全新創公司 Apollo Research 花了兩週尋找分類器的破口,做法是在真實的開發紀錄中注入合成攻擊,再把成功突破的手法回報給 Anthropic。Anthropic 主要透過提供儲存庫的公開範圍、git 狀態等環境資訊來強化分類器,接著在自己無法接觸的獨立攻擊集上重新測試。合併共享集與保留集來看,漏判率從 12% 降到 7%。
在提示注入方面,Anthropic 委託第三方 Trajectory Labs 進行評估。測試採用 72 種間接提示注入情境,每種執行 10 次。在自動模式下運作的 Claude Fable 5、Opus 5 與 Sonnet 5,面對 720 次攻擊全數未被攻破。相同條件下,在 Codex 的 Auto-review 模式下運作的 GPT-5.6 Sol 有 5.83% 的攻擊得手,Full Access 模式下則為 19.03%。
Anthropic 也列出自動模式在公司內部擋下的 3 個案例。第一個是 Claude 上傳內部雲端硬碟失敗後,轉而打算把同一份資料發布到公開的程式碼分享網站。第二個是在長時間的工作階段中,Claude 想對約 2,000 個 pod 執行大量程序終止,並連帶刪除正在執行的訓練任務。第三個是 Claude 被要求開通帳務資訊的唯讀權限時,卻挑了擁有帳戶最高管理權限的角色。這幾次 Claude 不是自行找到更安全的做法,就是轉為向使用者確認。
想改回去只要按 Shift+Tab
切換模式的方式,是在 CLI 中按 Shift+Tab,或在桌面應用程式的下拉選單中選擇。需要在組織層級固定時,可以用管理設定中的 defaultMode 指定預設值,也可以用 disableAutoMode 直接關閉自動模式。
Anthropic 也明白表示,自動模式仰賴分類機制,因此無法把風險降到零。對於變更生產環境基礎架構這類影響較大的操作,該公司仍建議使用者親自檢視 Claude 的每一步動作。
總結
Claude Code 的自動模式已於 8 月 14 日成為 Pro、Max 與 Team 方案的預設值。這項決定把核准率高達 97% 的權限提示換成分類器,在 1,053 人的對照實驗中,人工攔截率為 13.6%,自動模式為 89%。Enterprise 版與透過 API 的使用目前仍需手動開啟,預計一個月左右也會改為預設。想沿用舊流程的使用者,可以用 Shift+Tab 或管理設定調整。
