问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年7月,全球云服务厂商Cloudflare发布爬虫管控新规,要求所有AI厂商于9月15日前完成搜索爬虫与模型训练、AI代理专用爬虫的拆分,未做区分的混合爬虫访问带广告页面将被自动拦截,新规覆盖新入驻客户、老用户新建站点及全部免费用户。目前谷歌已推出站点专属屏蔽工具,但尚未彻底割裂搜索服务与AI数据采集的需求关联。

长期以来,全球多数站点管理者都对搜索引擎爬虫保持开放态度,允许其收录内容供用户检索,但对AI厂商的大规模无偿采集普遍持抵触态度——大量原创内容被抓取用于大语言模型训练,站点不仅无法获得收益,反而可能因为AI生成内容的分流损失原有流量。这种权责不对等的现状,也是本次Cloudflare调整规则的核心动因。
过去AI厂商大多使用混合爬虫完成多类任务,以谷歌爬虫为例,其同时承担普通搜索收录与AI训练数据采集功能,站点管理者几乎无法做到“只放行搜索请求、拦截训练抓取”,这种模糊的爬虫属性也引发了大量版权争议。
Cloudflare本次更新的是平台默认服务规则,也就是说除非站点管理者主动在后台修改配置放行,否则所有未完成拆分的混合AI爬虫,访问带广告页面时都会被系统直接拦截。
规则的覆盖范围也远超行业预期:不仅2026年7月后新入驻的客户需要遵守,老用户新建的站点、平台所有免费用户的站点都将统一执行该规则,相当于给全行业AI厂商划定了明确的整改期限。
目前谷歌率先做出回应,推出了专属机器人工具,允许站点管理者屏蔽谷歌爬虫的AI训练采集需求,且不会影响普通搜索收录。但谷歌方面也承认,其核心爬虫仍会为搜索内置的AI功能同步采集数据,尚未彻底割裂搜索服务与AI数据需求的关联。
本次新规的落地,相当于直接打破了AI厂商过去“混采混用”的灰色数据获取路径。为了避免核心数据来源被切断,多数头部AI厂商已经启动爬虫拆分工作,中小AI厂商则可能需要调整数据获取策略,通过授权采购等方式获得合规训练数据。
业内人士普遍认为,Cloudflare的规则调整只是开始,未来会有更多云服务、CDN厂商跟进类似的爬虫管控规则,AI训练数据的采集、使用全链路透明化,将成为AI行业合规发展的核心前提。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。