一次说清:Bot Preference Sync 功能上线

💡 原文英文,约2100词,阅读约需8分钟。
📝

内容提要

Cloudflare推出Bot Preference Sync功能,帮助网站所有者同步AI机器人偏好设置与robots.txt文件。该功能允许用户配置搜索、代理和训练类机器人的访问权限,并自动更新robots.txt。新客户默认启用,出版网站可选择默认禁止训练。此功能旨在提高透明度,让网站所有者更好地控制内容使用。

🔎

延伸解读

偏好与执行不一致的风险

文章指出,网站所有者常面临 robots.txt 声明与实际执行规则不一致的问题。例如,robots.txt 禁止某个爬虫,但实际并未阻止,这可能导致爬虫忽视声明或尝试绕过规则。Bot Preference Sync 通过同步声明与执行,减少这种不一致带来的风险,帮助网站所有者更有效地控制内容使用。

不同业务模式的差异化策略

文章强调,不同网站对 AI 爬虫的需求各异:电商网站可能希望所有内容被爬取和训练,以提升在 AI 搜索中的曝光;而依赖广告的出版商则可能希望保留搜索索引但禁止训练。Bot Preference Sync 允许按类别(搜索、代理、训练)设置策略,并针对出版商提供默认禁止训练的选项,体现了灵活性。

透明度成为爬虫准入条件

Cloudflare 要求混合用途爬虫(同时用于搜索和训练)提供透明度,包括尊重 robots.txt 的“禁止训练”声明、提供退出 AI 摘要的选项、提供 URL 级可见性等。不满足条件的爬虫在网站禁止训练时仍会被阻止。这一机制将透明度作为爬虫访问的“入场券”,旨在保护网站所有者权益。

新功能的默认设置与自定义限制

Bot Preference Sync 对新客户默认开启,但非出版商默认不添加任何阻止规则。对于已有自定义规则的客户,该功能不会读取复杂逻辑,因此需要手动关闭同步以保持精细控制。这提醒用户,自动化同步适合类别级策略,而特殊安排仍需手动管理。

Q&A

Cloudflare的Bot Preference Sync功能是什么?

Bot Preference Sync是Cloudflare推出的一项功能,它可以将网站所有者在Cloudflare仪表板上配置的AI机器人偏好(如允许、阻止或禁止训练)自动同步到网站的robots.txt文件中,确保声明的偏好与实际执行的规则保持一致。该功能对所有客户(从免费版到企业版)开放,并可在任何时间开启或关闭。

Bot Preference Sync如何与现有的robots.txt文件配合?

如果网站已有robots.txt文件,Bot Preference Sync会将生成的规则前置到现有内容之前,保留原有的Disallow指令,从而不覆盖已有的设置。

Bot Preference Sync对搜索、代理和训练类机器人分别提供哪些选项?

对于搜索和代理类机器人,选项包括:允许、在提供广告的页面上阻止、或全局阻止。对于训练类机器人,选项为“禁止”(Disallow),即写入“no training”偏好到robots.txt,允许合作的混合用途爬虫在提供透明度的情况下仍可访问内容用于搜索索引,但不会用于训练。

Cloudflare如何确保机器人遵守robots.txt中的“禁止训练”偏好?

Cloudflare要求执行搜索和训练的混合用途机器人必须满足透明度要求,包括尊重robots.txt中的“no training”偏好、提供退出AI摘要的方式、提供URL级别的可见性和搜索指标,并公开证明禁止训练不影响传统搜索结果。符合这些标准的机器人会在Cloudflare Radar的AI机器人透明度部分公开跟踪,而不提供透明度的爬虫在禁止训练时仍会被阻止。

Bot Preference Sync的默认设置是什么?

对于所有新客户,Bot Preference Sync默认开启。对于出版网站(通过广告变现的网站),在引导过程中可以选择“我通过此域名上的页面广告变现”,这将默认将训练设置为“禁止”。对于非出版网站,新客户在引导域名时默认不添加任何阻止或禁止规则,由客户自行选择。

Bot Preference Sync是否支持自定义规则?

Bot Preference Sync主要处理类别级别的策略决策,不会直接读取具有更复杂逻辑的单个自定义规则。如果客户需要更精细的安全策略,可以关闭同步功能,并手动定制robots.txt文件以匹配自定义策略。

Bot Preference Sync何时对所有客户可用?

Bot Preference Sync将在未来一周内向所有客户(所有计划)开放,客户可以关注Cloudflare的changelog以获取可用性信息,并留意仪表盘和收件箱中的确认偏好提示。

🏷️

标签

➡️

继续阅读