MIT最新研究:大模型规模扩张将显著加剧AI归因困境

近日麻省理工学院(MIT)研究团队发布AI归因领域最新研究成果,证实随着扩散类生成式AI模型参数量、训练数据集规模持续扩张,单条训练样本对模型输出的可测量影响将持续下降,这种被命名为「归因衰减」的现象,将直接提升AI版权纠纷判定、合规审计、行业治理的落地难度。

过去两年,全球范围内已有数十起生成式AI相关版权诉讼落地,从Getty Images起诉Stability AI未经授权使用海量版权图片训练模型,到多位插画师联合起诉Midjourney、OpenAI侵犯著作权,几乎所有纠纷的核心卡点都指向同一个问题:如何证明某条AI输出内容,确实用到了特定的版权训练素材。

此前行业普遍认为,归因技术的迭代将逐步解决这一问题——通过算法追溯单条训练样本对AI输出的贡献度,就能直接判断特定输出是否使用了未授权素材,为版权判定、合规审计提供明确依据。但MIT的最新研究却打破了这一预期,证明大模型的规模扩张本身就会抵消归因技术的效果。

MIT研究团队针对不同参数规模的扩散模型做了多组对照实验,在控制训练数据构成、模型训练方法、测试prompt完全一致的前提下,发现模型参数量每提升一个数量级,单条训练样本对输出结果的贡献度可测量值平均下降27%。当模型参数量突破千亿级之后,超过92%的训练样本对输出的个体贡献已经无法被现有追溯技术识别。

研究团队明确指出,这种衰减不是算法缺陷,而是大模型参数共享、特征泛化过程中出现的必然规律:随着模型规模变大,单个样本的特征会被分散到更多参数中,和其他样本的特征深度融合,自然无法再被单独拆解出来。

归因衰减现象的证实,首先对现有AI版权纠纷的判定逻辑带来了直接冲击。现有司法体系中,版权方需要举证AI产品接触过自己的作品、且输出内容构成实质性相似才能判定侵权,但归因衰减意味着就算能证明作品进入了训练集,也无法量化其对特定输出的贡献,侵权判定的逻辑链条直接出现缺口。

其次是全球AI监管规则的落地难度大幅提升。包括欧盟AI法案、中国《生成式人工智能服务管理暂行办法》在内的监管规则,都要求生成式AI服务具备可追溯性,能够对有害输出的来源进行定位,现有追溯技术无法适配大模型规模扩张的节奏,将直接提升企业的合规成本。

面对这一固有难题,行业已经开始探索多维度的应对方案。MIT研究团队给出的技术方向是把归因环节前置,在训练数据入池时就添加不可擦除的数字水印,后续通过识别输出内容中的水印特征来判定训练素材来源,而非事后追溯贡献度,目前该技术已经在百万级参数的扩散模型上完成了可行性测试。

除此之外,规则层面的调整也在推进,全球多个版权集体管理组织正在探索生成式AI的批量授权模式,绕过单个样本的归因要求,为AI企业提供打包的版权授权服务,从规则层面降低归因的必要性。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。