OpenAI 更新了 ChatGPT Work 的云端浏览器,让任务可以在需要登录的网站上继续推进。用户通过专用表单自行输入账号,随后把剩下的操作交还给 ChatGPT。输入的用户名和密码不会传给模型,ChatGPT 也不会保存。财务软件、水电燃气的账户页面等此前卡在登录界面的场景,因此进入了可自动化的范围。
云端浏览器运行在哪里
云端浏览器是 ChatGPT Work 专用的浏览器,运行在云端的另一台计算机上,而不是用户自己的设备。它可以读取网页、点击按钮、在表单中填写信息,并按顺序执行各个步骤。即使关闭对话窗口,任务仍会继续运行,只有在需要补充信息、登录或确认时才会暂停。
可用范围是付费方案,Free 和 Go 不在其中。能否使用还取决于所在地区、灰度推进的进度以及工作区的权限设置。用户不需要单独选择云端浏览器,ChatGPT 会根据请求内容自行判断是否调用;如果已连接的应用能够直接完成任务,则优先使用后者。
登录信息不在模型的视野内
这次更新的核心是登录环节的处理方式。当 ChatGPT 走到登录页面时会暂停,并给出一个安全的登录表单。用户在其中填写用户名和密码,如果网站要求,还可以输入双重验证或安全验证码。
在该表单中输入的凭据会直接送往远端浏览器。模型看不到内容,ChatGPT 也不会保存这些凭据。在弹出表单之前,另有一个审核模型会检查该请求以及信息的输入目的地是否存在钓鱼或伪装的迹象。用户本人也可以确认网址、预览登录表单,并在继续之前查看真实网站。
完成登录后,该登录状态会一直保持到会话过期为止。下次遇到同一网站的任务时,不必重新登录即可直接开始工作。
访问网站与关键操作各有一道关卡
默认情况下,打开新网站之前一定会先征求用户许可。在设置中的 Cloud browser 里可以选择 3 种策略:每次都由本人确认的「始终询问」、由 ChatGPT 检查网址并仅在可疑时暂停的「自动批准」,以及允许所有网站的策略,最后一种并不推荐。针对单个网站的允许与屏蔽,优先级高于上述默认策略。
网站访问权限与操作本身的批准是两回事。确认预订、完成付款这类难以撤销,或者会带来金钱、法律、账户层面承诺的操作,ChatGPT 会在执行前于对话中请求确认。允许了某个网站,并不意味着站内的关键操作也自动放行。
任务陷入僵局时,ChatGPT 会请用户接管浏览器。用户也可以主动要求接管,届时会收到一个可直接操作云端浏览器的链接。
与本地浏览器彻底分离
云端浏览器与设备上安装的浏览器完全是两套东西。它拥有自己的 Cookie、浏览数据和登录会话,不会读取用户打开的标签页、浏览历史、已保存的密码、扩展程序或现有的登录状态。即便在日常使用的浏览器里已经登录,云端浏览器这一侧仍需重新登录。
想要清除已保存的数据时,可以进入设置中的 Cloud browser,在 Browser data 中按全部网站或单个网站进行删除。清除后会从该网站登出,下次相关任务会再次要求登录。
此外,也有网站限制来自自动化浏览器代理的访问。本地浏览器能正常打开的页面,在云端浏览器这边被拦下的情况是可能出现的。这属于网站运营方的判断,OpenAI 为希望放行的运营方提供了加入允许列表的操作指引。
官方设想的使用场景
OpenAI 举出的例子包括:查询餐厅空位、向商家索取报价、寻找符合行程的机票、比较商品供货情况与本地库存、结合已连接的邮箱和物流网站追踪包裹、准备政务窗口的预约、登录水电燃气账户比较套餐、查找并收藏符合条件的租房信息,以及在财务软件中核对发票并更新记录。
任务能推进到哪一步,取决于网站的实现方式、本人的权限以及流程的复杂程度。也存在只能由用户亲自完成最后一步的情形。
风险并未消失
OpenAI 表示已针对提示注入、钓鱼和意料之外的操作进行测试,同时明确指出这些防护并不能消除全部风险。使用时值得留意的习惯是:不要把密码、验证码、支付信息直接粘贴到对话框中;凭据一律通过安全的登录流程输入;一旦发现 ChatGPT 打开了错误的网站或开始使用错误的信息,立即中止任务。
请求的写法同样影响结果。把「在哪个网站、做什么、做到什么程度」写得越具体,确认的往返就越少,出现意外操作的空间也越小。
总结
云端浏览器能够越过登录界面之后,可以交给 ChatGPT Work 的工作范围延伸到了企业实际运转的系统内部。让凭据不进入模型,以及把网站许可与操作批准分成两层确认,正是支撑这一延伸的前提。先把访问权限保持在「始终询问」,从出错也无妨的小事开始尝试,是比较务实的做法。
