切书不为偷?Anthropic巴拿马计划被曝光

切书不为偷?Anthropic巴拿马计划被曝光

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

Anthropic公司实施“巴拿马计划”,购买并销毁上百万本旧书,扫描成数字文件供AI训练,以获取高质量数据。法官裁定此举合法,因未复制扩散。此举引发伦理争议,被视为现代版“焚书”,虽法律合规,但不可逆地损失了实体文化遗产。

🔎

延伸解读

法律与伦理的裂缝

法官的判决将盗版下载与实体书购买切割处理:前者因复制扩散被判侵权,后者因未产生额外副本而被视为合理使用。这一逻辑为AI公司提供了操作指南,但伦理上仍存争议。文章指出,法律合规并不等于道德正当,尤其当涉及不可再生的孤本时,这种“合法”行为可能造成无法挽回的文化损失。

数据质量与模型崩溃

文章提到,2022年后AI生成内容污染互联网,导致模型训练可能遭遇“模型崩溃”。因此,战前出版的实体书因其高质量、人工编辑和逻辑性成为稀缺资源。Anthropic的联合创始人本·曼恩认为,书能教AI写出更好的文章,而非模仿低质量网络用语。这解释了为何公司愿意投入巨资获取旧书,也凸显了高质量数据在AI训练中的关键价值。

不可逆的文化损失

与谷歌图书扫描后归还实体书不同,“巴拿马计划”是一次性销毁。文章强调,绝版书或孤本一旦被切碎,其物理形态便永久消失,即使数字副本存在,也无法替代原件的触感、批注等独特信息。这种不可逆性引发对知识载体价值的反思,提醒读者在追求技术进步时,需权衡对文化遗产的潜在损害。

Q&A

Anthropic的“巴拿马计划”具体是什么?

Anthropic公司实施了一项名为“巴拿马计划”的行动,购买并销毁上百万本旧书,用液压机切掉书脊,扫描成数字文件,用于训练AI模型,以获取高质量数据。

为什么Anthropic要购买旧书而不是直接使用网络数据?

因为2022年后AI生成的内容污染了互联网,大模型抓取网络数据可能导致“模型崩溃”。而战前出版的旧书内容干净,由人类撰写、编辑校对,质量高,能教AI写出更好的文章,因此成为稀缺的优质数据源。

法官为什么裁定Anthropic销毁实体书扫描是合法的?

法官认为,购买实体书并销毁,只产生一份数字副本,没有复制扩散,因此不构成侵权,属于合理使用。这与从盗版网站下载电子书不同,后者涉及复制和传播,被判侵权。

“巴拿马计划”引发了哪些伦理争议?

争议在于,虽然法律合规,但销毁实体书是不可逆的,导致人类文明实体遗产损失,尤其是孤本和稀有书籍。有人批评这是现代版“焚书”,为了训练AI而牺牲文化载体,被认为“邪恶”。

Anthropic在实施“巴拿马计划”时采取了哪些保密措施?

他们通过中间商匿名采购,使用ISBNdb服务,合同包含保密协议,对外话术称为“数字保存”,内部文件明确表示不想让别人知道该计划。

“巴拿马计划”对旧书市场和AI行业可能产生什么影响?

该计划可能导致旧书店收到更多匿名订单,液压机销量上涨,其他AI公司可能效仿。同时,稀有书籍的实体版本可能进一步减少,加剧文化遗产的损失。

🏷️

标签

➡️

继续阅读