Anthropic 的浏览器扩展「Claude in Chrome」已于 2026 年 8 月 26 日转为正式提供。此前只面向部分方案的试用,如今只要是付费方案的用户,都可以从 Chrome 网上应用店安装。与此同时,逐个操作请求人工批准的方式被取消,凡是通过安全性判定分类器检查的动作,都会自动执行。
逐个操作的批准环节被取消
这次变更中体感差别最大的,是批准对话框的处理方式。以往每打开一个链接、每输入一段文字,都要请求用户许可;正式版中,Claude 会对自己判断为安全的动作自动放行。其机制与 Claude Code 的自动模式相同,在执行前由分类器核对动作内容,与最初的委托要求对不上的一律拦截。
对于不习惯自动批准的人,设置中仍保留了退回手动批准的选项。能够自行决定放权的范围,这一点在实际业务使用时是重要的判断依据。
让无法对接的工具,连同已登录的界面一起可用
Anthropic 之所以在浏览器扩展上投入,是因为现场仍留有大量无法通过连接器对接的业务工具。企业内部的仪表盘、长期沿用的核心系统、合作方提供的供应商门户,没有公开 API 的界面并不少见。
Claude in Chrome 把这些界面按「看到什么就是什么」的方式处理。它读取当前打开的页面内容,在用户已经登录的会话中完成文字的读写、点击链接、页面间跳转以及表单填写。由于不需要额外交出认证信息,上手前的门槛也相应降低。
提示词注入防护分为三层
在浏览器中自主行动的智能体,始终绕不开在网页、邮件、表单输入框中植入恶意指令的攻击,也就是提示词注入。比如委托它撰写邮件回复时,收件箱中某一封信里隐藏的指令可能要求「把其他邮件转发给攻击者」。Anthropic 表示,从试用版到正式提供之间的这段时间,正是用来加固这方面防御的。
防护措施大致分为三部分。第一是模型自身的抗性强化:把来自内部自动攻击工具、外部红队以及实际运行监控的攻击案例整理成库,每当有新的攻击奏效就补充进去并投入训练。
第二是称为探针的检查环节。网页内容是以工具执行结果的形式送达模型的,因此需要扫描这些结果,寻找被植入指令的迹象。一旦发现疑似攻击的描述,Claude 会把该内容视为可疑,必要时先与用户确认再行动。探针最早随 Claude Opus 4.5 引入,此后覆盖的攻击类型不断扩大。
第三就是前面提到的执行前核查,把页面跳转、文字输入等具体动作与委托内容比对后再放行。把作用于模型、输入与输出的不同性质关卡叠加起来,是本次架构的特点。
如何看待攻击成功率的数字
Anthropic 也公开了评测结果。试用阶段构建的初期评测集,对 Fable 5、Opus 5、Sonnet 5 的攻击成功率均为 0,作为指标已经饱和,因此被停用。
现行评测使用的是专业外部红队准备的更强攻击。在关闭附加防护的状态下,抵达模型的攻击中,Opus 4.5 有 17.6%成功,Opus 5 为 3.8%。即便叠加 2025 年 11 月时最强的防护——探针,Opus 4.5 仍有 16.7%被攻破。
另一方面,在 Opus 4.8 之后的模型上同时启用探针与安全性分类器时,针对 Sonnet 5、Opus 5、Mythos 5 没有出现成功的攻击。只有 Fable 5 残留 0.3%的成功率,Anthropic 称已人工确认这些均发生在影响较小的情形下,并正在推进处置。
不过,这些只是针对特定评测集的数字。提示词注入是攻击方不断变换手法的领域,0%这一数值未必能长期维持。Anthropic 自身也写道,仍需持续投入攻击的自动发现、红队演练以及分类器的强化。
使用步骤,以及尚未支持的部分
安装只需从 Chrome 网上应用店添加扩展。在 Enterprise 方案中,管理员可以在组织设置中管理是否允许使用,并把可运行的域名限定在批准范围内。
限制也依然存在。处理本地文件、或与浏览器之外的应用程序联动时,仍需要桌面版应用。此外,Chrome 之外的 Chromium 系浏览器以及移动环境尚不支持。由于在浏览器中开始的工作可以在桌面、移动和 Web 各端应用中继续,把它理解为多了一个入口更贴近实情。
总结
Claude in Chrome 的正式提供,与其说是功能追加,不如说是用安全侧的验证把「批准环节能省到什么程度」这件事推到位。在探针与执行前分类器叠加的结构下,现行评测中主要模型的攻击成功率已降至 0%。越是日常需要操作没有 API 的内部系统的环境,越容易感受到这次更新的效果。
