Anthropic为何买书扫描后销毁

Anthropic为何买书扫描后销毁

💡 原文中文,约5100字,阅读约需13分钟。
📝

内容提要

Anthropic公司实施“巴拿马计划”,斥资数千万美元购买旧书,切脊扫描后打成纸浆,用于AI训练。此举因法律上仅购买一份并销毁原件,被视为“转换性使用”而合法,但公众反感,需保密。核心是版权规则滞后,旧书(2022年前)被视为干净训练数据,避免模型崩塌。

🔎

延伸解读

“转换性使用”的法律逻辑

Anthropic买书扫描后销毁,法律上被视为“转换性使用”,因为购买实体书后扫描并销毁原件,并未增加副本数量,不构成复制和传播。这解释了为何销毁原件可能合法,而保存原件反而可能侵权。但这一逻辑依赖法官对“转换”的认定,存在不确定性。

旧书为何成为“干净”训练数据

2022年前出版的旧书不含AI生成内容,被视为“干净”训练数据,可避免模型崩塌。这类似二战前沉船中的低背景钢,因未受核污染而用于精密仪器。ISBNdb利用这一点,专门收购旧书供AI训练,既满足法律要求,又保证数据质量。

版权规则滞后于AI时代

纸质书、电子书、AI模型三种形态的版权规则各不相同。纸质书允许买家自由处置,电子书限制复制和传播,而AI训练权定价模糊,导致出版社和AI公司难以达成协议。Anthropic钻了纸质书规则的漏洞,以低成本获取训练数据,但公众反感,只能秘密进行。

Q&A

Anthropic公司为什么要买旧书扫描后销毁?

Anthropic公司实施“巴拿马计划”,购买旧书扫描后销毁,主要是为了获取训练AI模型的文本数据。这样做在法律上被视为“转换性使用”,因为只购买一份并销毁原件,不构成复制和传播,从而规避版权问题。同时,旧书(尤其是2022年前出版的)被视为更干净的训练数据,避免模型崩塌。

什么是“巴拿马计划”?

“巴拿马计划”是Anthropic公司内部对批量购买旧书、扫描并销毁的项目的代号。从2024年开始,Anthropic花费数千万美元从二手书商处购买旧书,外包给Datamation公司进行扫描,扫描后原书被回收打成纸浆。该计划旨在获取训练数据,同时避免版权纠纷。

为什么扫描旧书后要销毁原件?

销毁原件是为了在法律上构成“转换性使用”,避免版权侵权。因为只购买一份并销毁,世界上仍只有一份副本,不构成复制和传播,从而合法。如果保留原件,可能被视为新增副本,引发版权问题。

为什么旧书被视为“干净”的训练数据?

旧书(尤其是2022年前出版的)被视为“干净”的训练数据,因为那时生成式AI尚未普及,书中不含AI生成内容。使用这些数据训练模型可以避免“模型崩塌”,即模型因大量AI生成内容循环训练而语言偏离人类。

Anthropic为什么不用谷歌扫描的4000万册书?

谷歌扫描的4000万册书使用受限,版权期内的书只能用于搜索和展示小段落,不能用于训练模型。谷歌本身也面临出版商起诉,指控其将扫描书用于训练Gemini。因此,Anthropic不能直接使用谷歌的数据,只能自行购买扫描。

为什么Anthropic不直接购买电子书的训练权?

因为出版商尚未确定训练权的定价,无法估算训练一本书相当于购买多少本。传统按销量分成的模式不适用于AI训练,出版商担心训练导致销量下降,因此定价困难。Anthropic宁愿钻现有规则的空子,购买实体书扫描销毁,成本更低。

ISBNdb公司是做什么的?

ISBNdb公司原本维护图书ISBN编码数据库,现在也提供图书收购、扫描和销毁服务。它帮助AI公司购买旧书并扫描,同时签订严格保密协议,广告语是“世界上最好的AI训练数据,正躺在书架上”。

为什么公众对销毁旧书感到反感?

公众对销毁旧书感到反感,因为人们赋予书籍人格和感情,听到书被打成纸浆,尤其是孤本或稀有书被毁,容易产生情绪反应。尽管法律上可能合法,但公众情感上难以接受,因此公司需要保密。

🏷️

标签

➡️

继续阅读