当AI艺术没有作者:研究发现生成的图像往往无法追溯到训练数据

当AI艺术没有作者:研究发现生成的图像往往无法追溯到训练数据

💡 原文英文,约1700词,阅读约需6分钟。
📝

内容提要

MIT CSAIL研究发现“归因衰减”现象:生成式AI模型训练数据规模越大,单个训练样本对输出的影响越小。通过精确删除数据验证,大型模型中移除任何单张图片、某艺术家全部作品或某人所有照片,生成结果几乎不变。该发现对版权归属、合理使用等法律问题有重要影响,表明模型输出可能无法归因于特定训练数据。

🔎

延伸解读

归因衰减的机制

研究发现,生成式AI模型训练数据规模越大,单个训练样本对输出的影响越小。通过精确删除数据验证,大型模型中移除任何单张图片、某艺术家全部作品或某人所有照片,生成结果几乎不变。这种“归因衰减”现象表明,模型输出可能无法归因于特定训练数据。

对版权法律的影响

该发现对版权归属、合理使用等法律问题有重要影响。如果模型输出与任何单个训练数据无关,那么这些输出可能被视为原创作品,而非衍生作品。这引发了关于作者如何获得补偿、输出是否可版权化以及合理使用边界的新问题。

行业责任与未来方向

研究者指出,AI公司有责任确保其输出不侵犯版权,并可通过采用类似“扩散集成”的方法来证明输出非衍生。然而,该研究主要针对扩散模型,对于大型语言模型是否同样存在归因衰减,仍需进一步探索。

Q&A

什么是归因衰减?

归因衰减是MIT CSAIL研究人员发现的一种现象,指生成式AI模型训练数据规模越大,单个训练样本对输出的影响越小。在足够大的规模下,移除任何单张图片、某艺术家全部作品或某人所有照片,生成结果几乎不变。

MIT的研究人员是如何精确验证归因衰减的?

他们构建了一种名为“扩散集成”的架构,由许多在数据不同切片上训练的小组件组成。要移除某个训练样本,只需关闭看到该样本的组件,无需重新训练,从而实现了精确的删除和反事实模型。

归因衰减对版权法有什么影响?

如果模型输出无法归因于任何特定训练数据,那么这些输出可能不被视为衍生作品,这会影响合理使用、版权归属以及作者补偿等法律问题。

归因衰减现象在什么条件下成立?

归因衰减在训练数据规模足够大时成立。研究发现,随着数据集增大,反事实半径(原始输出与移除单个样本后最不同输出之间的距离)按逆幂律缩小,且在不同数据集、不同度量方式下均成立。

扩散集成模型与常规扩散模型相比表现如何?

在图像质量上,扩散集成模型与常规扩散模型相当。有趣的是,数据量越大,集成模型相对于单模型的表现越好,表明它们可能更具数据效率。

归因衰减对AI行业有什么启示?

该发现表明,公司可以通过修改模型来确保输出不可归因,从而证明其输出不侵犯版权。研究人员认为,这是行业的一项义务,而非漏洞。

归因衰减是否适用于大型语言模型?

目前尚不清楚。该研究主要针对扩散模型,大型语言模型是否表现出相同的衰减现象仍是开放问题。

🏷️

标签

➡️

继续阅读