2026年4月28日,伦敦帝国理工学院、互联网档案馆与斯坦福大学联合发布研究报告,对2022至2025年33个月的网页样本分析显示,截至2025年中期全球35%新发布网站内容全部或部分由AI生成,较2022年底ChatGPT发布前的近乎零占比实现爆发式增长,AI内容语义相似度较人类原创高33%,正深度改变互联网话语体系。
2022年底ChatGPT的正式上线,被普遍视为生成式AI走入大众视野的标志性节点,而短短三年后,这项技术已经完成了对互联网内容生态的深度渗透。
本次研究的样本覆盖了2022年到2025年的数千万条网页存档,依托互联网档案馆的全量网页快照资源,数据具备极强的代表性。研究团队指出,2022年底ChatGPT发布前,市场上几乎没有成规模的AI生成公开网页内容,而到2025年中期,每三个新上线的网站中,就有至少一个的内容全部或部分由AI生成。
这种渗透速度甚至远超研究团队此前的预估——在2023年的同类调研中,行业普遍预测AI生成网站占比达到30%的时间点是2027年,实际落地时间提前了整整两年。这背后与建站工具的AI化普及直接相关,目前全球主流的SaaS建站平台均已内置AI内容生成功能,普通用户只需输入关键词就能快速生成全站内容,大幅降低了建站的内容成本。
相比占比的快速提升,AI内容对网络生态的隐性影响更值得警惕。研究的技术分析环节得出了两个核心结论:
第一是语义收缩效应:由于大语言模型的生成逻辑天然倾向于向训练数据的平均值收敛,AI生成内容的语义相似度比人类原创内容高出33%。这意味着很多小众、边缘、个性化的观点会被AI内容挤出公共网络空间,长期演化可能导致整个网络生态的思想光谱收窄,创造力被削弱。
第二是情感偏倚效应:AI生成文本的积极情感得分比人类原创内容高出107%,呈现出明显的“人工乐观”倾向。这一现象源于大模型训练阶段的“对齐”要求——为了避免输出冒犯性内容,模型被训练得更倾向于输出积极、中立、顺从的表述,长期来看会无形中边缘化人类的异议性、批判性观点,压缩公共讨论的空间。
目前全球范围内尚未出台统一的AI生成内容强制标识规范,普通用户在浏览网页时,很难区分内容是来自人类创作还是AI生成,这也进一步放大了上述影响的传导效率。
不少行业专家指出,下一步需要从两个层面应对AI内容的渗透:一是建立公开网页的AI内容溯源与标识机制,让用户拥有知情权;二是在大模型训练环节优化算法逻辑,避免过度的内容趋同,保留不同立场、不同风格的表达空间。更值得警惕的是,若AI生成内容占比持续提升,未来大模型的训练数据将大量来自AI产出内容,可能陷入“数据自循环”的内卷陷阱,进一步拉低内容的独特性与价值。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。