Cloudflare 在 7 月 1 日预告的机器人默认设置调整,已于 9 月 15 日正式生效。在展示广告的页面上,用于 AI 训练和 AI 智能体的爬虫将被默认拦截,只有以搜索索引为目的的抓取仍然放行。受影响的是新增域名,以及从未修改过设置的免费套餐站点。如果你的站点属于其中之一,值得打开控制台确认一遍。

放行搜索,拦住训练与智能体

Cloudflare 这次把 AI 相关机器人的行为拆成三类:搜索(Search)、智能体(Agent)和训练(Training)。搜索指收集并索引内容,以便日后回答与之相关的问题;智能体指代替用户实时访问页面、当场完成某项任务;训练则指抓取内容用于训练或微调模型。

9 月 15 日起生效的默认值并非对三类一视同仁。只有在展示广告的页面上,训练和智能体两类才会被拦截,搜索依然放行。Cloudflare 给出的理由是,广告的存在本身就是一个信号,说明站点所有者希望这个页面被人阅读;而搜索是最自然地把访问者带回站点的行为,放行对多数站点所有者更有利。

不投放广告的站点不受此次默认值调整影响。对作品集站点或以获取商机为目的的站点来说,被 AI 的回答引用本身就是一种推广,因此反而可能需要与默认值相反的设置。这些选项随时可以在控制台的安全设置中修改。

受影响的是新增域名和免费套餐

适用范围被刻意收窄了。覆盖的是新签约的客户,以及现有客户新添加的站点。此外,截至 9 月 15 日未在控制台修改过设置的现有免费套餐用户,同样被应用了新的默认值。

换句话说,已经自行配置过偏好的付费客户不会有任何自动变化。真正需要留意的是免费套餐一侧。不少站点是若干年前为了加速和防御 DDoS 才接入 Cloudflare,此后再没打开过控制台。这些站点等于在所有者毫无察觉的情况下,被套上了一份内容使用策略。

为什么混合型爬虫被点名

这次调整明确瞄准的是混合型爬虫。如果运营方为搜索、智能体和训练分别部署了名称不同的机器人,站点所有者就能允许其中一个、拒绝另一个。可一旦三种用途被塞进同一个机器人,同意出现在搜索结果里,也就等于同意被用于训练。

Cloudflare 联合创始人兼首席执行官 Matthew Prince 表示,希望此次默认值调整能促使混合型爬虫把搜索与智能体用途、训练用途分离开来。该公司还指出,目前最大的搜索引擎所能获取的信息量约为领先 AI 公司的 2 倍,原因正是站点很难在保持可被发现的同时,把自己与 AI 使用切割开。

需要注意的是,多用途爬虫会按其全部行为进行判定,并适用所有可用规则中最严格的一条。因此在选择拦截训练的站点上,谷歌、苹果和微软的 Googlebot、Applebot、BingBot 等多用途爬虫也会一并被拦截。考虑到对可被发现程度的影响,这一点值得在动手改设置前停下来想一想。

数字背后的理由

Cloudflare 列出的数据中,站点运营者感受最直接的是带宽。该公司的数据显示,AI 爬虫的抓取流量中,超过 50% 花在重新抓取内容并未更新的页面上。什么都没变的页面被反复取走,站点这边浪费带宽,AI 公司那边浪费算力。Cloudflare 凭借能够察觉内容是否发生变化的位置优势,正与主要 AI 公司一起测试用于提示页面是否值得重新抓取的信号,并计划在今年内广泛开放。

在商业层面,Cloudflare 称过去一年间媒体机构与 AI 平台之间签订了超过 50 份大型内容授权协议。该公司还把去年推出的 Pay Per Crawl 升级为 Pay Per Use,让内容方在内容真正产生价值时获得报酬,而不是在机器人抓取的那一刻。首批合作伙伴为 Ceramic.ai 和 You.com。

robots.txt 里多了一个新字段

与此同时,写入 robots.txt 的新信号 use 也进入了测试阶段。它在 Content Signals 初版的 3 个字段之外增加了第 4 个可选字段,取值有三级:immediate(可以交互,但不保存也不再利用)、reference(可索引、可摘录并回链,这是默认值)、full(可总结并完整复现)。

这些并非拦截手段,而是用来表达站点所有者的意愿。已经启用 Cloudflare 托管 robots.txt 的站点会被自动加上 use=reference。该公司也已开始追踪各个机器人的内容使用方式,并表示将剥夺无视这些信号的机器人的已验证(Verified)状态。按现行标准,完整复现内容的机器人无法获得已验证状态。

总结

Cloudflare 的新默认值已于 9 月 15 日生效,在展示广告的页面上默认拦截 AI 训练与智能体爬虫。适用对象是新增域名,以及未修改过设置的免费套餐用户。以搜索为目的的抓取仍然放行,但未将搜索与训练分离的混合型爬虫会在所有广告页面上被拦截。全球超过 20% 的网站域名位于 Cloudflare 之后,这让一项默认设置几乎具备了行业标准的分量。AI 公司是否愿意按用途拆分自己的机器人,将在很大程度上决定接下来的格局。