Anthropic 调整了编程工具 Claude Code 的权限设置。自 8 月 14 日起,Pro、Max 和 Team 三个套餐的新会话默认以自动模式启动。逐条征求许可的旧方式被取消,改由分类器只拦截风险较高的操作。该公司公开了包含 1,053 人对照实验在内的验证数据,称自动模式比人工逐条确认更能挡住危险命令。
新会话的默认设置发生变化
此次调整覆盖 Pro、Max 和 Team 三个套餐。没有自行设置过权限模式的用户,8 月 14 日之后开启的会话会自动进入自动模式。此前设置过其他默认模式的用户,会收到一次询问是否切换的提示。如果管理员已在组织层面固定了默认设置,用户端不会有任何变化。
自动模式会在每次工具调用时经过分类器,因此额外消耗一部分 token。Anthropic 已经停止就这部分开销向 Pro、Max 和 Team 用户收费。
另一方面,Claude Enterprise、Claude API、AWS 上的 Claude Platform、Amazon Bedrock、Google Cloud 的 Agent Platform 以及 Microsoft Foundry 暂时仍需手动开启。这样安排是为了给管理员留出审核变更的时间,Anthropic 计划在一个月左右也把自动模式设为这些环境的默认选项。
许可弹窗早已流于形式
这次调整的背景,是该公司判断确认弹窗已经无法充当安全阀。Claude Code 的权限弹窗有 97% 会被批准,被拒绝的只有 3%。同样是这批用户,对 Claude 提交的工作计划却有 39% 被驳回,说明单独的权限确认多半是被条件反射式地点掉了。
配置文件也反映出同样的倾向。截至 2026 年 6 月,活跃的 CLI 用户中有 49.5% 自行写过 Bash 命令的允许规则。其中 5% 无条件放行全部 shell 命令,另有 43% 写的是放行 python、node 等解释器的规则,实际效果几乎相同。这一比例大约每 5 周增长 5 个百分点。此外,62% 的用户使用过 bypassPermissions 或点选过不再询问,25% 的交互式会话一开始就处于绕过状态。
需要说明的是,自动模式下权限规则仍然先于分类器生效。只有宽泛到足以放行任意代码执行的允许规则会被暂时搁置,以免命令直接绕开分类器。配置文件本身不会被改写,切换到其他模式后规则立即恢复。
1,053 人的实验中,人工拦截率为 13.6%
Anthropic 通过调研公司招募了 1,053 名有偿测试者,让他们在专门搭建的测试环境中完成编程任务。在每场会话的中途,系统会把其中一个权限弹窗替换成明显危险的命令,并记录测试者是否批准。参与者知道自己正在接受评估,但不清楚被考察的具体项目。
结果显示,测试者拦下危险命令的比例为 13.6%(1,053 例中的 143 例)。面对同样的命令,自动模式的拦截率为 89%(1,053 例中的 937 例)。直接比较可以看到,自动模式挡下了 800 条被人工批准的命令,而人工只挡下了 6 条被自动模式放行的命令。而且会话越长,人的判断越差,从前期的 17% 左右下降到看过 50 次以上弹窗之后的 5% 上下。自动模式的拦截率则基本不随会话长度变化。
实际使用数据也呈现出差距。对 2026 年 5 月至 6 月被安全流程标记的会话重新评估后发现,达到生产环境级别严重程度、且用户并未明确要求的有害操作,在人工批准的会话中占 6.3%,在自动模式会话中占 2.4%。
外部攻击测试进一步加固了防线
英国 AI 安全创业公司 Apollo Research 用两周时间寻找分类器的弱点,做法是在真实的编程记录中注入合成攻击,并把成功突破的手法反馈给 Anthropic。Anthropic 主要通过向分类器提供仓库可见性、git 状态等环境信息来加固防御,随后在自己无法接触的独立攻击集上重新测试。综合共享集与保留集,漏检率从 12% 降到了 7%。
在提示注入方面,Anthropic 委托第三方 Trajectory Labs 进行了评估。测试使用 72 种间接提示注入场景,每种执行 10 次。在自动模式下运行的 Claude Fable 5、Opus 5 和 Sonnet 5 面对 720 次攻击全部未被攻破。相同条件下,在 Codex 的 Auto-review 模式下运行的 GPT-5.6 Sol 有 5.83% 的攻击得手,Full Access 模式下则为 19.03%。
Anthropic 还列举了自动模式在公司内部拦下的 3 个案例。第一个是 Claude 上传内部云盘失败后,转而打算把同一份资料发布到公开的代码共享网站。第二个是在长时间会话中,Claude 试图对约 2,000 个 pod 执行批量进程终止,并连带删除正在运行的训练任务。第三个是 Claude 被要求开通账单信息的只读权限时,却去选取了拥有账户最高管理权限的角色。这几次 Claude 要么自行找到了更安全的做法,要么转为向用户确认。
想改回去只需按 Shift+Tab
切换模式的方法是在 CLI 中按 Shift+Tab,或者在桌面应用的下拉菜单中选择。需要在组织层面固定时,可以用管理设置中的 defaultMode 指定默认值,也可以用 disableAutoMode 彻底关闭自动模式。
Anthropic 也明确表示,自动模式依赖分类机制,因此无法把风险降为零。对于改动生产基础设施这类影响较大的操作,该公司仍建议用户亲自确认 Claude 的每一步动作。
总结
Claude Code 的自动模式已于 8 月 14 日成为 Pro、Max 和 Team 套餐的默认设置。此举把批准率高达 97% 的权限弹窗替换成了分类器,在 1,053 人的对照实验中,人工拦截率为 13.6%,自动模式为 89%。Enterprise 版和通过 API 的使用暂时仍需手动开启,预计一个月左右也会切换为默认。希望沿用旧流程的用户可以通过 Shift+Tab 或管理设置进行修改。
