内容提要
数学家Andreas Thom指控OpenAI在数学突破中使用了未公开的用户对话数据,却拒绝透明说明。此前已有学者质疑OpenAI模型受益于其与ChatGPT的交互。OpenAI仅否认直接访问,未排除去标识化数据间接影响。Thom认为这属不诚实,若用户研究被用于竞赛,缺乏同意与署名在伦理上不可接受。此事加剧数学界对OpenAI的不信任。
延伸解读
争议核心:去标识化数据能否洗脱嫌疑
OpenAI回应称未直接访问用户数据,但承认无法排除去标识化数据间接影响模型。数学家Thom指出,去标识化仅移除姓名,不消除数学思想的知识内容。这一区分成为双方争论焦点:公司以技术性措辞回避实质问题,而研究者认为这等同于变相使用其成果。
举证责任倒置:研究者为何难以自证
Thom强调,只有OpenAI掌握训练数据全貌,外部研究者无法逆向工程其训练流程。因此,若公司否认使用用户数据,应主动披露相关数据集与设置以自证清白。这种信息不对称使研究者处于被动,也加剧了学界对OpenAI透明度的质疑。
伦理红线:竞赛中利用用户未公开研究
Thom认为,若用户提供的非公开研究被用于改进模型,而公司又用该模型与用户竞赛发表,且未经同意、披露或署名,这在伦理上不可接受。此事触及AI研发中用户数据利用的边界,尤其在学术优先权敏感的数学领域,可能引发更广泛的伦理讨论。
学界反应:不信任加剧与保密倾向
此次争议并非孤立事件。此前已有学者质疑OpenAI模型受益于其与ChatGPT的交互,而公司对千禧年大奖难题的回应也采用类似模糊措辞。多名研究者向The Verge表示,担心此类行为会迫使数学家更加保密,甚至因传闻而引发与科技巨头的竞赛,进一步恶化数学界的开放氛围。
Q&A
数学家Andreas Thom为什么指控OpenAI不诚实?
Thom指控OpenAI不诚实,是因为他询问OpenAI其与ChatGPT的交互是否被用于训练或推理过程,但OpenAI的回复只否认直接访问,未排除去标识化数据间接影响,他认为这缺乏证据和解释,属于不诚实。
OpenAI对使用用户数据的具体回应是什么?
OpenAI否认直接访问任何特定用户数据,但表示不能排除去标识化数据间接帮助改进了模型。
为什么数学家担心OpenAI的行为会影响数学研究?
数学家担心,如果知道接近重大突破的传闻可能引发与资源丰富的科技巨头的竞赛,他们会变得更加保密,从而推动数学领域进入更秘密的状态。
Thom认为用户研究被用于竞赛在伦理上有什么问题?
Thom认为,如果用户提供的非公开研究帮助改进了模型,而公司随后用这些模型与用户竞赛发表成果,且未经同意、未适当披露或署名,这在伦理上是不可接受的。
OpenAI在非sofic群结果中做了什么修改?
OpenAI在宣布非sofic群结果后,因未承认Thom和Kun的近期贡献而受到批评,随后悄悄修改了其书面报告。
Thom如何描述去标识化数据的问题?
Thom表示,去标识化可能移除了名字,但并没有移除数学思想的知识内容。