内容提要
MIT CSAIL研究发现“归因衰减”现象:生成式AI模型训练数据规模越大,单个训练样本对输出的影响越小。通过精确删除数据验证,大型模型中移除任何单张图片、某艺术家全部作品或某人所有照片,生成结果几乎不变。该发现对版权归属、合理使用等法律问题有重要影响,表明模型输出可能无法归因于特定训练数据。
延伸解读
归因衰减的机制
研究发现,生成式AI模型训练数据规模越大,单个训练样本对输出的影响越小。通过精确删除数据验证,大型模型中移除任何单张图片、某艺术家全部作品或某人所有照片,生成结果几乎不变。这种“归因衰减”现象表明,模型输出可能无法归因于特定训练数据。
对版权法律的影响
该发现对版权归属、合理使用等法律问题有重要影响。如果模型输出与任何单个训练数据无关,那么这些输出可能被视为原创作品,而非衍生作品。这引发了关于作者如何获得补偿、输出是否可版权化以及合理使用边界的新问题。
行业责任与未来方向
研究者指出,AI公司有责任确保其输出不侵犯版权,并可通过采用类似“扩散集成”的方法来证明输出非衍生。然而,该研究主要针对扩散模型,对于大型语言模型是否同样存在归因衰减,仍需进一步探索。
Q&A
什么是归因衰减?
归因衰减是MIT CSAIL研究人员发现的一种现象,指生成式AI模型训练数据规模越大,单个训练样本对输出的影响越小。在足够大的规模下,移除任何单张图片、某艺术家全部作品或某人所有照片,生成结果几乎不变。
MIT的研究人员是如何精确验证归因衰减的?
他们构建了一种名为“扩散集成”的架构,由许多在数据不同切片上训练的小组件组成。要移除某个训练样本,只需关闭看到该样本的组件,无需重新训练,从而实现了精确的删除和反事实模型。
归因衰减对版权法有什么影响?
如果模型输出无法归因于任何特定训练数据,那么这些输出可能不被视为衍生作品,这会影响合理使用、版权归属以及作者补偿等法律问题。
归因衰减现象在什么条件下成立?
归因衰减在训练数据规模足够大时成立。研究发现,随着数据集增大,反事实半径(原始输出与移除单个样本后最不同输出之间的距离)按逆幂律缩小,且在不同数据集、不同度量方式下均成立。
扩散集成模型与常规扩散模型相比表现如何?
在图像质量上,扩散集成模型与常规扩散模型相当。有趣的是,数据量越大,集成模型相对于单模型的表现越好,表明它们可能更具数据效率。
归因衰减对AI行业有什么启示?
该发现表明,公司可以通过修改模型来确保输出不可归因,从而证明其输出不侵犯版权。研究人员认为,这是行业的一项义务,而非漏洞。
归因衰减是否适用于大型语言模型?
目前尚不清楚。该研究主要针对扩散模型,大型语言模型是否表现出相同的衰减现象仍是开放问题。