两全其美:在搜索引擎中保持可发现性,同时禁止AI训练

💡 原文英文,约2900词,阅读约需11分钟。
📝

内容提要

Cloudflare推出新设置,允许网站禁止AI训练爬虫,同时保持搜索引擎收录。该设置通过robots.txt区分搜索、训练和代理三类爬虫行为。苹果、谷歌、微软已承诺遵守。原有阻止设置也适用于混合用途爬虫,可能影响搜索。新域名将获推荐配置,广告变现网站默认更严格。

🔎

延伸解读

混合用途爬虫的困境与解决方案

文章指出,苹果、谷歌、微软等公司的爬虫同时用于搜索和AI训练,网站主若屏蔽训练可能连带失去搜索收录。Cloudflare的新设置通过robots.txt区分搜索、训练和代理三类行为,允许网站仅禁止AI训练而保留搜索。这解决了长期存在的两难选择,但需注意该设置仅对承诺遵守的“Accountable”爬虫有效。

新设置对现有用户的影响

对于已使用Cloudflare的网站,现有设置将自动迁移。若之前选择“Block AI Bots”,新设置下训练行为将变为“Disallow AI Training”,搜索和代理行为保持不变。但若想完全屏蔽混合用途爬虫(包括搜索),需手动选择“Block”。此外,“Block on pages with ads”现在也会影响混合用途爬虫的搜索收录,广告变现网站需留意。

新域名的推荐配置差异

从9月15日起,新域名 onboarding 时会根据是否通过广告变现获得不同预设。非广告网站训练行为默认为“Allow”,而广告网站则默认为“Disallow AI Training”,且代理行为被屏蔽。这是因为广告收入依赖人类访问,而AI训练和代理抓取不会带来广告展示。用户可在 onboarding 时或之后随时调整这些设置。

AI摘要控制的未来方向

文章提到,AI摘要与训练不同,它影响用户发现和访问网站的方式。目前Cloudflare已要求混合用途爬虫运营商提供摘要退出机制,并计划明年初让用户控制内容在摘要中的使用量。数据表明,超过一半消费者阅读搜索摘要,且这些消费者结束搜索的可能性高40%以上,但通过AI搜索引荐的转化率是传统搜索的3到5倍以上。

Q&A

Cloudflare 新推出的 Disallow AI Training 设置是什么?

Disallow AI Training 是 Cloudflare 推出的一项新设置,允许网站禁止 AI 训练爬虫,同时保持搜索引擎收录。它通过在 robots.txt 中发布 no-training 偏好,让混合用途爬虫(如 Applebot、Googlebot、Bingbot)继续为搜索抓取,但禁止用于 AI 训练。

为什么网站所有者需要在 AI 训练和搜索可发现性之间做选择?

因为一些大型互联网组织使用混合用途爬虫,同一个爬虫既用于搜索又用于 AI 训练。如果网站拒绝其中一个用途,就会同时拒绝另一个,导致要么允许 AI 训练,要么失去搜索可发现性。

哪些公司被 Cloudflare 认定为 Accountable?它们需要满足什么条件?

Apple、Google 和 Microsoft 被认定为 Accountable。要获得该认定,爬虫运营商必须提供或承诺提供:通过 robots.txt 或类似标准让网站选择退出 AI 训练的机制;让网站选择退出 AI 摘要的机制;URL 级别的可见性,显示哪些页面可用于训练及搜索表现;以及保证退出 AI 训练不会影响传统搜索结果。

新的 Block 设置和 Disallow AI Training 有什么区别?

Block 设置会阻止所有爬虫,包括混合用途爬虫,因此会影响搜索收录。而 Disallow AI Training 只阻止 AI 训练,允许 Accountable 混合用途爬虫继续为搜索抓取,从而保持搜索可发现性。

对于新域名,Cloudflare 推荐什么配置?

从 9 月 15 日起,新域名 onboarding 时会根据网站是否通过广告盈利提供两种预设配置。不通过广告盈利的网站:Search 允许,Training 允许,Agent 允许。通过广告盈利的网站:Search 允许,Training 禁止 AI 训练,Agent 在含广告页面阻止。用户可以在 onboarding 时或之后更改这些设置。

现有客户需要做什么来适应新设置?

几乎不需要做任何事。现有设置会自动迁移。如果希望完全阻止混合用途爬虫,需要手动选择 Block。之前配置过 Search/Training/Agent 控制的域名,其设置会按新定义保留实际效果。

Cloudflare 对 AI 摘要的下一步计划是什么?

Cloudflare 计划让网站所有者控制其内容在 AI 摘要中的使用量,目标是在明年初实现一次设置即可控制,而不是分别与每个运营商协商。同时,将推动 ai-prefs 等开放标准,并继续与爬虫运营商合作。

🏷️

标签

➡️

继续阅读