AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Cloudflare发布爬虫管控新规 9月起未拆分混合AI爬虫将遭拦截

2026年7月,全球云服务厂商Cloudflare发布爬虫管控新规,要求所有AI厂商于9月15日前完成搜索爬虫与模型训练、AI代理专用爬虫的拆分,未做区分的混合爬虫访问带广告页面将被自动拦截,新规覆盖新入驻客户、老用户新建站点及全部免费用户。目前谷歌已推出站点专属屏蔽工具,但尚未彻底割裂搜索服务与AI数据采集的需求关联。

配图

长期以来,全球多数站点管理者都对搜索引擎爬虫保持开放态度,允许其收录内容供用户检索,但对AI厂商的大规模无偿采集普遍持抵触态度——大量原创内容被抓取用于大语言模型训练,站点不仅无法获得收益,反而可能因为AI生成内容的分流损失原有流量。这种权责不对等的现状,也是本次Cloudflare调整规则的核心动因。

过去AI厂商大多使用混合爬虫完成多类任务,以谷歌爬虫为例,其同时承担普通搜索收录与AI训练数据采集功能,站点管理者几乎无法做到“只放行搜索请求、拦截训练抓取”,这种模糊的爬虫属性也引发了大量版权争议。

Cloudflare本次更新的是平台默认服务规则,也就是说除非站点管理者主动在后台修改配置放行,否则所有未完成拆分的混合AI爬虫,访问带广告页面时都会被系统直接拦截。

规则的覆盖范围也远超行业预期:不仅2026年7月后新入驻的客户需要遵守,老用户新建的站点、平台所有免费用户的站点都将统一执行该规则,相当于给全行业AI厂商划定了明确的整改期限。

目前谷歌率先做出回应,推出了专属机器人工具,允许站点管理者屏蔽谷歌爬虫的AI训练采集需求,且不会影响普通搜索收录。但谷歌方面也承认,其核心爬虫仍会为搜索内置的AI功能同步采集数据,尚未彻底割裂搜索服务与AI数据需求的关联。

本次新规的落地,相当于直接打破了AI厂商过去“混采混用”的灰色数据获取路径。为了避免核心数据来源被切断,多数头部AI厂商已经启动爬虫拆分工作,中小AI厂商则可能需要调整数据获取策略,通过授权采购等方式获得合规训练数据。

业内人士普遍认为,Cloudflare的规则调整只是开始,未来会有更多云服务、CDN厂商跟进类似的爬虫管控规则,AI训练数据的采集、使用全链路透明化,将成为AI行业合规发展的核心前提。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。