报告称,Tumblr的所有者正在与OpenAI和Midjourney达成训练数据协议

报告称,Tumblr的所有者正在与OpenAI和Midjourney达成训练数据协议

💡 原文英文,约500词,阅读约需2分钟。
📝

内容提要

Tumblr和WordPress.com的所有者正在与AI公司Midjourney和OpenAI进行谈判,以提供从用户帖子中抓取的训练数据。Automattic计划推出新的设置,允许用户选择退出与第三方的数据共享。尚不清楚数据的具体用途和是否已发送给AI公司。

🔎

延伸解读

谈判进展与数据用途不明

报道称Automattic与OpenAI和Midjourney的谈判已“迫在眉睫”,但具体条款、数据用途以及是否已发送数据均不明确。内部消息提到已抓取2014至2023年所有Tumblr公开帖子,甚至可能误含非公开内容。这种不透明性意味着用户目前难以知晓自己的数据是否已被用于训练,也增加了后续维权的难度。

用户选择退出机制即将推出

Automattic计划推出新设置,允许用户选择退出与第三方(包括AI公司)的数据共享。同时,公司表示将默认阻止主要AI平台的爬虫,并只分享未选择退出的公开内容。这一机制看似赋予用户控制权,但实际效果取决于设置的默认状态、操作便捷性以及是否追溯既往数据。用户需关注该设置的具体上线时间和范围。

创意社区与平台盈利的冲突

Tumblr以创意社区著称,而许多艺术家和写作者已抗议作品被用于AI训练。Automattic在收购Tumblr后一直面临盈利挑战,与AI公司合作可能带来新收入,但可能引发用户反弹。类似DeviantArt的案例表明,平台在商业化和用户信任之间难以平衡。此次谈判若处理不当,可能加剧用户流失。

行业趋势与法律风险

越来越多公司通过提供训练数据与AI工具制造商合作,例如Reddit与谷歌的年度协议、Shutterstock与OpenAI的合作。然而,这种直接交易在法律上正变得更具风险,因为公开抓取数据的合法性受到挑战。Automattic的谈判也处于这一趋势中,其最终协议可能面临版权和隐私方面的审查,值得持续关注。

❓

Q&A

Tumblr和WordPress.com的母公司正在与哪些AI公司谈判提供训练数据?

Automattic正在与Midjourney和OpenAI进行谈判,以提供从用户帖子中抓取的训练数据。

Automattic计划推出什么新设置来让用户控制数据共享?

Automattic计划推出一个新的设置,允许用户选择退出与第三方(包括AI公司)的数据共享。

Automattic已经抓取了哪些Tumblr数据?

Automattic已经抓取了2014年至2023年间所有Tumblr公共帖子内容的初始数据,可能还包括一些非公开内容。

Automattic如何默认处理AI爬虫?

Automattic默认阻止主要AI平台的爬虫,并只分享未选择退出的公共内容。

创意社区对AI训练数据的使用有何反应?

创意社区(如艺术家和作家)抗议他们的作品被用于训练,导致一些在线平台面临反对声浪。

Automattic在盈利方面面临什么挑战?

Automattic在盈利模式上面临挑战,尤其是在收购Tumblr后,它尝试了多种方法但效果不佳,并宣布缩减对Tumblr的雄心。

🏷️

标签

➡️

继续阅读