内容提要
《纽约时报》诉OpenAI和微软案解封文件显示,两家公司内部早知AI抓取网络内容会形成“末日循环”,损害出版业与自身模型。微软高管称其为“史上最大劳动盗窃”,并嘲讽“合理使用”。文件还承认GPT-4擅长逐字复述受版权内容,AI摘要导致新闻网站推荐流量大跌。
延伸解读
内部文件与公开立场的割裂
解封文件显示,微软和OpenAI内部早已将AI抓取网络内容定性为“史上最大劳动盗窃”和“对合理使用的彻底嘲弄”,但两家公司对外却试图与这些言论切割。微软称涉事高管的观点仅代表个人,不代表公司立场。这种内部认知与公开辩护之间的反差,是本案值得关注的核心矛盾之一。
“末日循环”为何是自我伤害
微软内部文件承认,AI内容策略开启了“末日循环”:模型依赖网络内容训练,但AI摘要又截断了内容创作者的流量和收入,导致优质内容供给萎缩,最终反过来损害模型自身。这种“产品摧毁自身供应链”的逻辑,意味着即便从商业利益出发,当前模式也难以长期持续。
逐字复述能力带来的版权风险
OpenAI内部员工承认GPT-4“记住了大量数据,因此极擅长逐字复述”。文件列举了ChatGPT直接输出《纽约时报》等媒体文章长段原文的实例。这说明模型输出与受版权保护内容之间的边界并不清晰,对依赖原创内容的出版机构构成直接威胁,也可能成为诉讼中的关键证据。
推荐流量下滑的连锁影响
OpenAI自己的媒体与经济专家将新闻网站推荐流量下降直接归因于AI摘要,并推测搜索推荐量可能下降高达60%。对出版业而言,这意味着不仅内容被用于训练,连原本通过搜索获得的读者入口也在收窄。流量与收入的双重挤压,正是文件中所称损害“数百万人”生计的具体路径。
Q&A
OpenAI和微软内部文件承认了哪些关于AI抓取网络内容的问题?
内部文件承认AI抓取网络内容会形成“末日循环”,损害出版业和自身模型;微软高管称其为“史上最大劳动盗窃”,并嘲讽“合理使用”;还承认GPT-4擅长逐字复述受版权内容,AI摘要导致新闻网站推荐流量大跌。
什么是“末日循环”?
“末日循环”指AI内容策略会同时损害模型性能和整个网络:终端产品威胁其关键供应商的经济基础,即AI抓取内容导致内容生产者受损,进而破坏AI自身的训练数据来源。
微软高管如何评价AI公司抓取数据的行为?
微软应用科学总监Brent Hecht称其为“人类历史上最大的劳动盗窃”,并说微软的辩护是对“合理使用”概念的“完全嘲弄”。
GPT-4在版权内容处理上有什么问题?
OpenAI内部承认GPT-4“记忆了大量数据,因此非常擅长 regurgitation(逐字复述)”,能输出受版权保护的长篇内容,尽管公司知道防止记忆对减少版权侵权很重要。
AI摘要对新闻网站流量造成了什么影响?
OpenAI自己的媒体和经济专家将《纽约时报》等网站推荐流量下降直接归因于Google的AI Overviews等AI摘要,并推测搜索推荐流量可能下降了60%。
微软和OpenAI对内部文件的批评有何回应?
微软发言人Alex Haurek称这些评论仅反映一名员工的个人观点,不是法律分析,不代表公司观点;另一份文件称Hecht的角色是对抗性的,持有分歧的学术观点。