【开源许可与版权工程】AI 训练数据的版权:从 Books3、Common Crawl 到生成式模型侵权
内容提要
本文系统梳理AI训练数据的版权合规问题,涵盖美国、欧盟、日本、中国法律框架及主要判例,分析Common Crawl、Books3等数据集的许可风险,并提供预训练、微调、RAG场景的工程合规清单,强调数据溯源、opt-out尊重及风险分级管理。
延伸解读
数据集许可的“雷区”与工程应对
文章指出,Common Crawl 本身不授予版权,风险由使用者承担;Books3 是盗版数据集,商业使用风险极高;LAION-5B 仅存链接,但商业使用需自行评估 opt-out。工程上应建立数据溯源表(DBOM),对每个子集单独评估许可,并定期回溯源站 opt-out 状态。
fair use 抗辩的边界:同赛道风险高
美国判例显示,Google Books 支持转换性使用,但 Warhol 案和 ROSS 案收紧边界。若训练目标产品与原作同赛道(如用新闻训练新闻摘要),fair use 抗辩风险极高。工程团队应避免在内部文档中表述“替代某平台”,并对高版权风险来源做白名单管理。
欧盟 opt-out 机制与 AI Act 披露义务
欧盟 DSM 指令第 4 条允许商业 TDM,但权利人可通过 robots.txt、X-Robots-Tag、TDMRep 等机器可读方式 opt-out。EU AI Act 要求 GPAI 提供者公开训练数据摘要。工程上需实现多层 opt-out 解析,并留存“合法访问”证据,按模板生成摘要。
合成数据的风险:ToS 违约而非版权
用 GPT-4 等竞品 API 生成数据训练模型,主要风险是违反 API 服务条款(如禁止训练竞品),而非著作权侵权。字节跳动因疑似违规使用 OpenAI 输出被暂停账号即是例证。工程上应避免依赖竞品 API 蒸馏核心模型,并做好合成数据溯源。
Q&A
Common Crawl 数据集可以直接用于商业 AI 训练吗?
不可以直接使用。Common Crawl 本身不拥有爬取内容的版权,其服务条款声明不授予对内容的任何权利。使用 Common Crawl 训练等同于自己爬取全网,版权风险由使用者承担。此外,许多新闻出版商已通过 robots.txt 屏蔽了 CCBot,训练前需进行二次 opt-out 过滤。
Books3 数据集为什么被认为是法律红线?
Books3 包含约 19.6 万本盗版电子书,来源是 BitTorrent 私有追踪器 Bibliotik,没有任何合法授权。商业使用 Books3 训练模型在美国几乎无法主张合理使用,因为四要素均对被告不利。该数据集已被下架,但曾用于训练 GPT-J、LLaMA 等模型。
欧盟的 TDM 例外对商业 AI 公司有什么限制?
欧盟 DSM 指令第 4 条允许商业主体进行文本和数据挖掘,但权利人可以通过机器可读方式(如 robots.txt、X-Robots-Tag、TDMRep)声明 opt-out。商业公司必须尊重这些 opt-out 信号,且必须合法获取作品。此外,EU AI Act 要求 GPAI 提供者公开训练数据摘要并遵守版权政策。
日本著作权法对 AI 训练有何特殊规定?
日本《著作权法》第 30 条之 4 规定,在“不以享受作品所表现的思想或感情为目的”的前提下,可以在必要限度内使用作品,包括 AI 训练。这被视为对 AI 训练最友好的条款,但仅保护训练环节,生成环节仍受一般著作权规则约束。若不当损害著作权人利益,仍可能构成侵权。
在中国进行商业 AI 训练,数据合规有哪些要求?
中国《著作权法》合理使用不覆盖商业 AI 训练,《生成式人工智能服务管理暂行办法》要求使用具有合法来源的数据和基础模型,不得侵害他人知识产权。企业需证明数据合法来源,建立知识产权预审机制,并对高版权风险类别进行白名单管理。
使用 LAION-5B 数据集训练商业模型需要注意什么?
LAION-5B 只包含图像 URL 和文本描述,但训练时需实际下载图像,复制行为发生在训练方。商业使用不能套用科研 TDM 例外,需依赖欧盟第 4 条并尊重 opt-out。此外,原版 LAION-5B 曾含 CSAM 链接,建议使用清理版 Re-LAION-5B。
预训练、微调和 RAG 场景分别有哪些合规清单?
预训练需数据溯源、opt-out 尊重、禁用高风险数据集;微调需注意标注合同、用户数据授权、合成数据 ToS;RAG 需将向量化视为复制,保留出处,多租户隔离,并处理 opt-out。
用 GPT-4 生成数据来训练自己的模型有什么法律风险?
主要风险是违反 OpenAI 的 API 服务条款,因为条款禁止使用输出训练竞争模型。这属于合同违约,而非著作权侵权。此外,如果 GPT-4 输出逐字包含受版权保护的文本,可能引发著作权诉讼。