AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

多家美媒封禁时光机爬虫 防范AI训练版权滥用

2026年4月,据Wired披露,包括《纽约时报》、Reddit、《今日美国》母公司在内的至少23家美国主流媒体与内容平台,已先后封禁互联网档案馆旗下“时光机(Wayback Machine)”的专用爬虫。这一动作的核心目的,是阻止AI开发企业绕过版权限制,抓取受保护的历史内容用于大语言模型训练,也让AI训练版权争议浮出了新的切面。

不少行业观察者注意到,本次封禁事件本身就充满了耐人寻味的矛盾性。《今日美国》所属的甘尼特传媒集团,刚刚在近期一篇揭露美国移民政策统计漏洞的深度报道中,依靠时光机存档的历史网页数据完成了核心论据支撑,转头就将时光机爬虫列入了封禁名单。

该集团发言人公开回应称,目前已经全面封禁所有非授权爬虫程序,包括时光机专属的`ia_archiverbot`,这是应对当前日益严峻的AI内容侵权风险的必要举措。

这波封禁针对的并不是互联网档案馆的公共存档服务本身,而是AI企业刻意钻空子的“绕路抓取”套路。

近年来,主流内容机构已经纷纷针对性封禁了OpenAI、谷歌等头部AI企业的训练爬虫,禁止其直接抓取平台内容用于模型训练。但不少AI开发者另辟蹊径,转而从互联网档案馆的公开存档中批量抓取已经被存档的受版权内容,相当于绕开了媒体直接设置的版权屏障。

目前行业内已经形成两种主流限制方案:一类是完全屏蔽,《纽约时报》和Reddit直接拉黑了时光机的专用爬虫,禁止其抓取任何新的平台内容;另一类是接口过滤,《卫报》等媒体并未完全禁止爬虫访问,仅将自家媒体内容从互联网档案馆的公开批量抓取接口中移除,避免被AI批量获取。截至目前,已有至少23家主流新闻站点加入了限制阵营。

本次事件也折射出当前AI行业和内容行业之间难以调和的结构性矛盾。互联网档案馆作为非盈利机构,原本承担着保存公共数字遗产、向公众开放历史网页查询的公共职能,如今却因为AI训练的版权争议,无辜沦为双方博弈的牺牲品。

而内容媒体一边依赖公共存档完成深度调查等公共属性内容生产,一边又要限制存档工具的正常抓取,本质上也是全球AI版权规则仍处于空白阶段的无奈选择。目前美国多家头部媒体已经先后对OpenAI、微软等AI巨头提起版权诉讼,此次封堵时光机爬虫,意味着内容行业正在把版权防控的网络从AI企业本身延伸到所有可能的内容渠道,未来双方的对峙大概率会进一步升级。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。