VPN技术

Cloudflare推出“禁止AI训练”设置:网站可保留搜索收录并限制混合爬虫训练用途

2026年9月16日 · admin
easyvpn24 ad

据 Cloudflare 于 2026 年 9 月 15 日发布的消息,该公司推出一项新的 Disallow AI Training 设置,目标是让网站所有者在继续被搜索引擎发现和收录的同时,拒绝同一类爬虫将内容用于 AI 训练。来源显示,问题的关键在于部分大型互联网公司使用“混合用途爬虫”:同一个爬虫既承担搜索索引任务,也可能服务于 AI 训练。过去,站长如果屏蔽这类爬虫,可能连搜索可见性也一并损失;如果放行,又可能默认接受内容被用于模型训练。Cloudflare称,Apple、Google 和 Microsoft 已经遵守或承诺在指定时间内遵守这一设置。

从“全放行或全屏蔽”到更细的爬虫控制

来源文章指出,许多网站并不反对搜索引擎爬取,因为搜索仍是内容被用户、自动化代理和合规机器人发现的重要入口。Cloudflare披露,在其平台上选择屏蔽搜索机器人的站点不足 1%;但在 AI 训练方面,已有 17% 的站点启用了某种阻止训练的机制。这说明站长对“搜索发现”和“训练使用”的态度并不相同。

过去依靠 robots.txt 这样的公开规则,难以彻底解决混合用途爬虫带来的边界问题。因为当一个爬虫同时代表搜索和 AI 训练时,网站很难只拒绝其中一种用途。Cloudflare的新设置试图把这两个场景拆开:允许内容继续进入搜索索引,但通过统一的策略向相关爬虫表达“不得用于训练”的要求。

  • 搜索收录:网站仍可被用户通过搜索发现,减少流量和品牌曝光损失。
  • AI训练限制:站点可明确拒绝内容被同一爬虫用于模型训练。
  • 平台统一配置:站长可在 Cloudflare 侧设置,而不是分别与每个爬虫运营方沟通。
  • 合规承诺:来源显示,Apple、Google、Microsoft 已遵守或承诺在指定时间内遵守。

对跨境网站与账号运营的影响

对跨境内容站、电商站、SaaS 官网、独立开发者博客以及媒体类网站而言,这类控制具有现实意义。很多团队依赖 Google、Bing 等搜索入口获得海外访问量,同时又担心原创内容、产品文档、定价页面或教程被大规模采集后用于 AI 训练,削弱用户直接访问网站的动力。新的控制方式如果被主要平台实际执行,将有助于降低“为了搜索流量不得不接受训练抓取”的被动处境。

从账号与平台运营角度看,跨境团队通常会同时维护官网、广告账户、搜索站长工具、支付服务商后台和云服务控制台。若站点流量主要来自海外搜索,贸然屏蔽大厂爬虫可能影响获客;但完全开放又可能带来内容资产被二次利用的顾虑。Cloudflare此类设置提供的是一种中间路径:保留可发现性,同时对内容用途设边界

AI摘要将成为下一阶段重点

Cloudflare还提到,混合用途爬虫只是AI训练问题中较难处理的一部分,接下来更值得关注的是 AI Summaries,即搜索或智能代理在结果页中生成内容摘要。来源认为,简单的全站允许或全站拒绝并不够细,因为摘要中使用多少内容,与是否使用同样重要。Cloudflare称,针对 AI 摘要的退出机制已经是其对混合用途爬虫运营方提出的要求之一,并希望在明年初让网站可以统一控制自己的内容被纳入摘要的程度。

这对依靠订阅、广告或直接访问变现的网站尤其关键。如果用户在搜索页或AI代理界面中已经获得足够答案,可能不会再点击进入原站,进而影响广告展示、注册转化、订阅付费和支付链路。对跨境业务来说,这不仅是内容版权问题,也关系到流量来源、账号增长和支付转化的稳定性。

站长应关注的操作与风险

目前,站点管理者需要确认自己使用的CDN、WAF、托管平台或反爬策略是否支持类似的细粒度控制,并持续观察主要搜索与AI平台的执行情况。对于远程办公团队,还应明确谁负责站点安全策略、搜索收录状态和内容授权规则,避免不同地区成员在后台重复或冲突配置。

总体来看,Cloudflare此次更新反映出开放互联网正在重新划分搜索、AI训练和AI摘要之间的边界。对跨境网站而言,关键不再是简单地“屏蔽AI”或“全面开放”,而是根据业务模式、内容价值和获客依赖度,建立更可审计、更可调整的访问规则。