内容提要
数学家借助AI证明流体方程有限时间爆破,但争议焦点转向数据边界:研究过程存入AI平台后,平台是否可能利用未公开数据?OpenAI被指接触相关进展,双方各执一词。文章强调,当AI参与高价值工作,用户需区分工具与平台竞争风险,数据训练、访问、审计边界须事先明确并可验证。
延伸解读
数据边界:三道独立权限需分清
文章指出,推理时是否检索、数据是否用于训练或评估、内部人员能否访问,是三道不同的权限。回答其中一道,不能替代另外两道。这提醒用户,在询问平台数据使用情况时,应分别确认每个环节,避免因笼统回答而忽略潜在风险。
公开政策与实际操作的差距
OpenAI 的公开政策虽明确个人版内容可能用于训练且可退出,但无法回答具体案例中的问题。用户需了解自己使用的产品类型、账户设置及数据流程,不能仅依赖默认政策。采购时应要求合同明确数据控制、访问权限和审计能力,而非口头承诺。
工具与平台的竞争风险
当平台既提供工具又参与同类研究时,用户与平台间存在潜在竞争。即使未交换细节,平台知晓研究路线也可能带来优势。文章强调,高价值工作应区分数据敏感等级,核心内容需进入有合同保障和审计的环境,避免将完整研究过程交给可能竞争的云端平台。
Q&A
数学家借助AI证明了什么数学结果?
数学家Tristan Buckmaster和Levent Alpöge借助Claude、Codex等模型,公开了三个流体方程相关的结果,其中最受关注的是三维不可压Euler方程在光滑外力下的有限时间爆破,并用Lean进行了形式化验证。
关于OpenAI是否接触了未公开数据,双方的说法是什么?
Buckmaster声称OpenAI的内部模型可能接触了他们的Codex会话,并获得了约100页的证明,但OpenAI的Sébastien Bubeck否认了这些说法,称其虚假且具有煽动性,并表示会给出更完整回应。目前尚无定论。
为什么说研究过程进入AI平台后,数据边界问题变得复杂?
因为研究过程包含未公开的猜想、草稿和推导,可能涉及研究优先权和未来方向。即使平台不直接泄露数据,仅知道“哪条路线值得集中资源”也可能有价值。平台与用户同时做研究时,仅靠口头解释难以消除疑问。
OpenAI的公开数据政策是什么?
OpenAI的公开政策规定:个人版ChatGPT和Codex的内容可能被用于训练,用户可在数据控制中退出;Codex完整环境有单独设置。ChatGPT Business、Enterprise和API的输入输出默认不用于训练,除非组织明确选择加入数据共享。
企业在采购AI时,除了能力和价格,还应关注哪些数据相关指标?
企业应关注训练边界、内部访问权限、数据隔离、留存删除和可审计性等指标,这些与准确率同等重要。
对于不同敏感级别的数据,文章建议如何使用AI工具?
公开资料可用通用工具;一般内部资料需明确数据控制;核心代码、未公开研究、客户机密和战略判断等应使用有合同承诺、访问控制、留存策略和审计能力的环境;高风险内容可考虑受控部署或隔离环境,甚至不交给模型。
文章认为数学结果是否成立与数据争议是什么关系?
文章认为两者是独立问题:即使OpenAI的证明正确,也不自动回答数据来源和署名问题;反之,沟通争议也不能证明数学证明不成立。