OpenAI承认不能排除用你的聊天记录训练模型:关闭开关也没用!

OpenAI承认不能排除用你的聊天记录训练模型:关闭开关也没用!

💡 原文中文,约4400字,阅读约需11分钟。
📝

内容提要

OpenAI内部模型用一万个智能体在88小时内解决了纳维-斯托克斯方程,但版本不符悬赏条件。研究员指控其Codex数据可能被用于训练,OpenAI承认“不能排除”,并涉署名争议。用户关闭开关仍难保数据隐私,引发信任危机。

🔎

延伸解读

“不能排除”的法律与公关含义

OpenAI的“不能排除”在法律上属于“既不确认也不否认”,在公关上则是一种模糊策略。这种表述既避免了直接承认使用用户数据,又为潜在的法律纠纷留有余地。对于用户而言,这意味着即使关闭了“Improve the model for everyone”开关,数据仍可能以“去标识化”形式被用于模型改进,而用户无法获得明确保证。

“去标识化”不等于保护智力产出

“去标识化”仅移除身份信息,但无法保护研究思路、证明方向等智力产出。OpenAI可以声称未“偷取”特定用户数据,但模型可能已吸收其独特贡献。这揭示了数据隐私保护中的灰色地带:技术手段无法完全防止智力成果被间接利用,用户需警惕将未公开的创意或研究放入AI工具。

关闭开关的局限性

OpenAI帮助文档称关闭开关后“新对话不会用于训练”,但“训练”与“改进”之间存在模糊空间。模型可能通过微调、RAG或上下文学习等方式间接利用数据,而无需传统训练。OpenAI承认“不能排除”数据流向,表明其数据管理体系存在连自身都无法厘清的漏洞,用户应审慎评估数据风险。

Q&A

OpenAI是否承认使用用户聊天记录训练模型?

OpenAI在声明中表示,虽然不太可能,但不能排除去标识化数据帮助改进了模型。这相当于承认用户数据可能被用于训练,即使关闭了“Improve the model for everyone”开关。

关闭“Improve the model for everyone”开关后,我的数据还会被用于训练吗?

根据OpenAI的官方文档,关闭该开关后,新的对话不会用于训练模型。但OpenAI在声明中表示“不能排除”去标识化数据被用于改进模型,这意味着即使关闭开关,数据仍可能以某种方式被使用。

OpenAI解决纳维-斯托克斯方程的过程是怎样的?

OpenAI从8月28日开始训练一个内部模型,9月1日启动评估,纳维-斯托克斯小组动用约一万个并发智能体,在88小时内得出解,消耗约1300亿token,计算成本约2250万美元。但解决的是带外力版,不符合克雷数学研究所悬赏的无外力版条件。

OpenAI解决的是哪个版本的纳维-斯托克斯方程?是否符合悬赏条件?

OpenAI解决的是带外力版的纳维-斯托克斯方程,而克雷数学研究所悬赏的是无外力版,因此不符合获奖条件。克雷数学研究所主席Martin Bridson也确认了这一点。

Buckmaster和Alpöge指控OpenAI的什么行为?

他们指控OpenAI可能使用了他们在Codex中的会话记录和草稿来训练模型,因为他们的研究思路与OpenAI的证明路径高度相似。OpenAI回应称没有访问特定用户数据,但不能排除去标识化数据被用于改进模型。

OpenAI在署名争议中做了什么?

OpenAI的数学家Sébastien Bubeck曾向Buckmaster提出一种方案,要求最终论文中不包含Alpöge的名字,因为Alpöge受雇于Anthropic。Buckmaster拒绝了,并称受到威胁。Bubeck否认了相关指控。

“去标识化”数据为什么仍然存在隐私风险?

去标识化只移除身份信息,但研究思路、证明方向等智力产出仍可能被模型吸收。OpenAI可以声称没有偷特定用户的数据,但承认不能排除其思路被用于改进模型,这构成了隐私漏洞。

OpenAI解决纳维-斯托克斯方程的计算成本是多少?

OpenAI在解决纳维-斯托克斯方程的过程中,纳维-斯托克斯部分消耗约1300亿输出token,按公开API价格换算,相当于2250万美元的计算成本。

🏷️

标签

➡️

继续阅读