内容提要
OpenAI内部模型用一万个智能体在88小时内解决了纳维-斯托克斯方程,但版本不符悬赏条件。研究员指控其Codex数据可能被用于训练,OpenAI承认“不能排除”,并涉署名争议。用户关闭开关仍难保数据隐私,引发信任危机。
延伸解读
“不能排除”的法律与公关含义
OpenAI的“不能排除”在法律上属于“既不确认也不否认”,在公关上则是一种模糊策略。这种表述既避免了直接承认使用用户数据,又为潜在的法律纠纷留有余地。对于用户而言,这意味着即使关闭了“Improve the model for everyone”开关,数据仍可能以“去标识化”形式被用于模型改进,而用户无法获得明确保证。
“去标识化”不等于保护智力产出
“去标识化”仅移除身份信息,但无法保护研究思路、证明方向等智力产出。OpenAI可以声称未“偷取”特定用户数据,但模型可能已吸收其独特贡献。这揭示了数据隐私保护中的灰色地带:技术手段无法完全防止智力成果被间接利用,用户需警惕将未公开的创意或研究放入AI工具。
关闭开关的局限性
OpenAI帮助文档称关闭开关后“新对话不会用于训练”,但“训练”与“改进”之间存在模糊空间。模型可能通过微调、RAG或上下文学习等方式间接利用数据,而无需传统训练。OpenAI承认“不能排除”数据流向,表明其数据管理体系存在连自身都无法厘清的漏洞,用户应审慎评估数据风险。
Q&A
OpenAI是否承认使用用户聊天记录训练模型?
OpenAI在声明中表示,虽然不太可能,但不能排除去标识化数据帮助改进了模型。这相当于承认用户数据可能被用于训练,即使关闭了“Improve the model for everyone”开关。
关闭“Improve the model for everyone”开关后,我的数据还会被用于训练吗?
根据OpenAI的官方文档,关闭该开关后,新的对话不会用于训练模型。但OpenAI在声明中表示“不能排除”去标识化数据被用于改进模型,这意味着即使关闭开关,数据仍可能以某种方式被使用。
OpenAI解决纳维-斯托克斯方程的过程是怎样的?
OpenAI从8月28日开始训练一个内部模型,9月1日启动评估,纳维-斯托克斯小组动用约一万个并发智能体,在88小时内得出解,消耗约1300亿token,计算成本约2250万美元。但解决的是带外力版,不符合克雷数学研究所悬赏的无外力版条件。
OpenAI解决的是哪个版本的纳维-斯托克斯方程?是否符合悬赏条件?
OpenAI解决的是带外力版的纳维-斯托克斯方程,而克雷数学研究所悬赏的是无外力版,因此不符合获奖条件。克雷数学研究所主席Martin Bridson也确认了这一点。
Buckmaster和Alpöge指控OpenAI的什么行为?
他们指控OpenAI可能使用了他们在Codex中的会话记录和草稿来训练模型,因为他们的研究思路与OpenAI的证明路径高度相似。OpenAI回应称没有访问特定用户数据,但不能排除去标识化数据被用于改进模型。
OpenAI在署名争议中做了什么?
OpenAI的数学家Sébastien Bubeck曾向Buckmaster提出一种方案,要求最终论文中不包含Alpöge的名字,因为Alpöge受雇于Anthropic。Buckmaster拒绝了,并称受到威胁。Bubeck否认了相关指控。
“去标识化”数据为什么仍然存在隐私风险?
去标识化只移除身份信息,但研究思路、证明方向等智力产出仍可能被模型吸收。OpenAI可以声称没有偷特定用户的数据,但承认不能排除其思路被用于改进模型,这构成了隐私漏洞。
OpenAI解决纳维-斯托克斯方程的计算成本是多少?
OpenAI在解决纳维-斯托克斯方程的过程中,纳维-斯托克斯部分消耗约1300亿输出token,按公开API价格换算,相当于2250万美元的计算成本。