内容提要
OpenAI安全透明度负责人David Robinson离职,他曾负责撰写模型“system card”并起草安全框架。此前OpenAI已解雇三名安全员工,安全团队持续动荡。Robinson曾公开担忧高能力AI风险,呼吁员工推动公司更认真应对。
延伸解读
安全透明度职能为何关键
安全透明度团队负责将OpenAI内部复杂的安全评估、红队测试和部署决策,转化为公众可理解的system card等公开材料。这些文档详细说明模型训练方法、安全评估结果、高风险领域能力及防护措施,是外界了解OpenAI技术安全工作的主要窗口。Robinson作为该职能负责人,其离职可能影响相关报告的连续性和深度。
Preparedness Framework 2.0的监管意义
Robinson是OpenAI《Preparedness Framework 2.0》的主要起草人。该框架追踪前沿模型在生物化学、网络安全和AI自我改进等方面的严重风险,并规定模型达到High或Critical能力阈值时需采取的评估与防护措施。例如Deep Research的生物学评估已接近High门槛。这一框架是OpenAI风险管控的核心文件,其起草者离职可能带来执行层面的不确定性。
安全团队动荡的连锁反应
在Robinson离职前,OpenAI已解雇三名安全员工,理由是将敏感信息分享给外部AI安全机构。其中Tomek Korbak曾担任与METR、Redwood Research的技术联系人。安全团队从Dario Amodei时期就变动频繁,近期更有多名高管离职。这种持续的人员流失可能削弱安全工作的连贯性,并影响外部对OpenAI安全承诺的信心。
Robinson的公开担忧与内部倡导
Robinson在离职前多次公开表达对高能力AI风险的担忧,认为OpenAI内部对模型影响的认识正在形成,但变化速度可能不够快。他赞同“竞相发展RSI并非囚徒困境,而是疯狂且傲慢”的观点,并呼吁留下的员工利用内部影响力推动公司更认真应对AI风险。这些言论反映了安全倡导者与公司发展节奏之间的张力。
Q&A
OpenAI安全透明度负责人David Robinson为什么离职?
据BI报道,Robinson本人尚未公开说明离职原因,OpenAI也没有公布继任者。
OpenAI安全透明度负责人具体负责哪些工作?
用Robinson自己的话说,他所做的工作是帮助外界理解并信任OpenAI为保障系统安全所开展的技术工作。他和团队扮演技术部门与公众之间的“翻译器”,把内部的技术发现、风险判断和部署决定整理成外界能看懂的公开材料,产出包括system card、Deployment Safety Hub、安全研究博客和公开治理文件。
OpenAI的system card是什么?包含哪些内容?
system card是模型的风险说明书,几乎每次OpenAI发布重要模型时都会撰写。其中需要写明:一款模型训练所用的方法、接受了哪些安全评估、在生物和网络攻击等高风险领域达到了什么能力、内部采取了什么安全措施、采取措施后还有什么风险等等。篇均几十页,可类比为食品包装上的“营养成分表”。
OpenAI《Preparedness Framework 2.0》新增了哪些追踪能力?
第二版框架新增了三类需追踪的能力:生物与化学能力、网络安全能力,以及AI自我改进能力。
OpenAI为什么解雇三名安全员工?
据《华尔街日报》报道,三人分别是Jasmine Wang、Tomek Korbak和Mikita Balesni,主要从事安全与模型对齐研究。OpenAI给的理由是,内部调查发现三人把公司敏感信息分享给了一家外部AI安全机构,其中还有OpenAI基础设施架构的内容。
Robinson离职前对高能力AI风险有哪些公开表态?
离职之前,Robinson曾在X上多次公开谈论高能力AI带来的风险。9月初,他表示OpenAI内部的人正在逐渐意识到高能力AI模型可能产生的影响,并说“OpenAI的确每天都在发生重大变化,但我不知道这种变化是否足够快”。在最新一则X中,他转发另一名研究人员的帖子并表示百分百赞同:我不认为竞相发展RSI真是什么囚徒困境——它可能就像普通人直观看到的那样,既疯狂又傲慢。他还对AI staff说,如果现在选择继续留下来,就应该思考如何利用自己在公司内部的影响力,推动公司更认真地应对AI风险。