OpenAI安全团队持续地震!负责人离职,三名员工因泄密被开

OpenAI安全团队持续地震!负责人离职,三名员工因泄密被开

💡 原文中文,约2400字,阅读约需6分钟。
📝

内容提要

OpenAI安全透明度负责人David Robinson离职,他曾负责撰写模型“system card”并起草安全框架。此前OpenAI已解雇三名安全员工,安全团队持续动荡。Robinson曾公开担忧高能力AI风险,呼吁员工推动公司更认真应对。

🔎

延伸解读

安全透明度职能为何关键

安全透明度团队负责将OpenAI内部复杂的安全评估、红队测试和部署决策,转化为公众可理解的system card等公开材料。这些文档详细说明模型训练方法、安全评估结果、高风险领域能力及防护措施,是外界了解OpenAI技术安全工作的主要窗口。Robinson作为该职能负责人,其离职可能影响相关报告的连续性和深度。

Preparedness Framework 2.0的监管意义

Robinson是OpenAI《Preparedness Framework 2.0》的主要起草人。该框架追踪前沿模型在生物化学、网络安全和AI自我改进等方面的严重风险,并规定模型达到High或Critical能力阈值时需采取的评估与防护措施。例如Deep Research的生物学评估已接近High门槛。这一框架是OpenAI风险管控的核心文件,其起草者离职可能带来执行层面的不确定性。

安全团队动荡的连锁反应

在Robinson离职前,OpenAI已解雇三名安全员工,理由是将敏感信息分享给外部AI安全机构。其中Tomek Korbak曾担任与METR、Redwood Research的技术联系人。安全团队从Dario Amodei时期就变动频繁,近期更有多名高管离职。这种持续的人员流失可能削弱安全工作的连贯性,并影响外部对OpenAI安全承诺的信心。

Robinson的公开担忧与内部倡导

Robinson在离职前多次公开表达对高能力AI风险的担忧,认为OpenAI内部对模型影响的认识正在形成,但变化速度可能不够快。他赞同“竞相发展RSI并非囚徒困境,而是疯狂且傲慢”的观点,并呼吁留下的员工利用内部影响力推动公司更认真应对AI风险。这些言论反映了安全倡导者与公司发展节奏之间的张力。

❓

Q&A

OpenAI安全透明度负责人David Robinson为什么离职?

据BI报道,Robinson本人尚未公开说明离职原因,OpenAI也没有公布继任者。

OpenAI安全透明度负责人具体负责哪些工作?

用Robinson自己的话说,他所做的工作是帮助外界理解并信任OpenAI为保障系统安全所开展的技术工作。他和团队扮演技术部门与公众之间的“翻译器”,把内部的技术发现、风险判断和部署决定整理成外界能看懂的公开材料,产出包括system card、Deployment Safety Hub、安全研究博客和公开治理文件。

OpenAI的system card是什么?包含哪些内容?

system card是模型的风险说明书,几乎每次OpenAI发布重要模型时都会撰写。其中需要写明:一款模型训练所用的方法、接受了哪些安全评估、在生物和网络攻击等高风险领域达到了什么能力、内部采取了什么安全措施、采取措施后还有什么风险等等。篇均几十页,可类比为食品包装上的“营养成分表”。

OpenAI《Preparedness Framework 2.0》新增了哪些追踪能力?

第二版框架新增了三类需追踪的能力:生物与化学能力、网络安全能力,以及AI自我改进能力。

OpenAI为什么解雇三名安全员工?

据《华尔街日报》报道,三人分别是Jasmine Wang、Tomek Korbak和Mikita Balesni,主要从事安全与模型对齐研究。OpenAI给的理由是,内部调查发现三人把公司敏感信息分享给了一家外部AI安全机构,其中还有OpenAI基础设施架构的内容。

Robinson离职前对高能力AI风险有哪些公开表态?

离职之前,Robinson曾在X上多次公开谈论高能力AI带来的风险。9月初,他表示OpenAI内部的人正在逐渐意识到高能力AI模型可能产生的影响,并说“OpenAI的确每天都在发生重大变化,但我不知道这种变化是否足够快”。在最新一则X中,他转发另一名研究人员的帖子并表示百分百赞同:我不认为竞相发展RSI真是什么囚徒困境——它可能就像普通人直观看到的那样,既疯狂又傲慢。他还对AI staff说,如果现在选择继续留下来,就应该思考如何利用自己在公司内部的影响力,推动公司更认真地应对AI风险。

🏷️

标签

➡️

继续阅读