全球网络服务巨头Cloudflare于近日正式发布爬虫管理新规,要求所有AI企业在2026年9月15日前,将用于搜索引擎的爬虫和用于AI训练、智能体研发的爬虫完成技术分离,未按要求完成报备的AI爬虫将被接入Cloudflare服务的全球大量出版商站点默认屏蔽。此举旨在解决AI训练无授权抓取出版内容的行业痛点,为AI企业向出版商支付内容授权费落地规则基础。

过去数年,全球出版业与AI大模型厂商的版权纠纷始终处于白热化状态:从《纽约时报》起诉OpenAI未经授权使用其新闻内容训练GPT系列模型,到欧盟《人工智能法案》明确要求通用大模型披露训练所用版权内容,产业链各方始终在寻找兼顾AI技术发展和内容创作者权益的平衡点。
作为覆盖全球超20%活跃网站的网络基础设施服务商,Cloudflare的规则调整之所以引发全行业关注,核心原因在于其掌握了大量出版商站点的流量入口权限——此前由于AI训练爬虫和普通搜索爬虫未做技术区分,出版商根本无法精准识别哪些爬虫是为了给站点导流,哪些是为了爬取内容训练大模型,只能要么全开放要么全屏蔽,陷入两难境地。
根据此次发布的新规,AI企业的合规要求十分明确:所有企业必须在9月15日前向Cloudflare提交两类爬虫的独立标识信息,包括专属User-Agent字段、固定IP段等,未完成报备的AI训练爬虫将会被所有接入Cloudflare服务的出版商站点默认拦截。
值得注意的是,Cloudflare同步上线了配套的内容授权结算体系,出版商可以在后台自主选择是否对合规的AI训练爬虫开放站点内容,一旦选择开放,Cloudflare会根据爬虫的抓取量直接向AI企业结算授权费用,不需要出版商和AI企业单独对接洽谈,大幅降低了中小内容生产者的变现门槛。
此次规则调整被业内普遍视为AI产业链利益分配机制成型的标志性事件。此前的版权纠纷多为头部出版商和头部AI企业的个案诉讼,很难覆盖数量庞大的中小内容生产者,也没有形成可复制的利益分配模式,而Cloudflare的新规则从基础设施层面实现了爬虫识别、授权、结算的全流程自动化,为全行业提供了可落地的解决方案。
有行业分析师测算,新规落地后,头部大模型厂商的训练数据采购成本可能会上涨15%到20%,但与此同时,AI企业获取合规内容的成本也会比单独洽谈授权低30%以上,整体来看有利于降低整个行业的合规风险。长期来看,公共内容有偿用于AI训练将成为行业共识,内容创作者的权益保障将逐步完善。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。