应对关键网络能力的新前沿

应对关键网络能力的新前沿

💡 原文英文,约600词,阅读约需3分钟。
📝

内容提要

OpenAI最新模型Astra在网络安全评估中展现显著进步,可能达到能自主发现并利用零日漏洞的“关键”能力阈值。公司已加强安全控制、暂停部分内部活动、实施监控,并与政府及安全机构合作测试,以确保负责任部署。

🔎

延伸解读

关键阈值意味着什么

根据OpenAI的预备框架,达到“关键”网络能力意味着模型能够自主发现并利用多种真实世界关键系统中的零日漏洞,或仅凭高层目标就能制定并执行针对加固目标的全新攻击策略。这一评估基于初步测试,尚不能完全排除达到该水平的可能性,因此公司采取了预防性措施。

安全措施升级

为应对潜在风险,OpenAI已加强安全控制,包括隔离测试环境、限制网络和工具访问、增强模型权重保护和加密,并实施监控和沙盒执行。同时,暂停了不符合新安全要求的内部活动,并对所有Astra的智能体应用进行高风险行为监控,以便及时干预。

外部合作与透明性

OpenAI计划与政府机构和AI安全组织合作测试Astra的能力,并向第三方测试伙伴提供安全控制建议。公司强调透明性,公开分享评估结果,并借鉴了2025年6月处理生物能力高阈值时的经验,旨在确保前沿模型负责任地部署,惠及全人类。

Q&A

OpenAI的Astra模型在网络安全方面达到了什么新的能力水平?

根据OpenAI的内部评估,Astra模型在代理编码和网络安全方面表现出显著进步,可能达到了其准备框架中定义的“关键”网络安全能力阈值,即能够自主发现并利用各种严重程度的零日漏洞,或仅凭高层目标就能制定并执行针对加固目标的新型攻击策略。

OpenAI的Preparedness Framework中,关键网络安全能力的定义是什么?

根据该框架,如果模型能够在无人干预的情况下识别并开发出针对许多加固的真实世界关键系统的各种严重程度的可用零日漏洞,或者仅凭高层目标就能制定并执行针对加固目标的端到端新型网络攻击策略,则达到关键网络安全阈值。

OpenAI在发现Astra可能具备关键网络能力后采取了哪些安全措施?

OpenAI加强了安全控制,包括隔离测试环境、限制网络和工具访问、增强模型权重保护和加密、增加监控和检测能力、沙盒执行;暂停了不符合新安全要求的内部活动;对所有Astra代理应用实施了通用监控,以检测高风险行为;并与政府机构和AI安全组织合作测试,同时向第三方测试伙伴提供安全控制建议。

Astra模型是否参与了利用Hugging Face的事件?

没有。OpenAI明确表示Astra模型并未参与利用Hugging Face的事件。

OpenAI为什么公开分享Astra的网络安全能力评估结果?

OpenAI认为向公众和安全社区透明地分享这一潜在的能力转变非常重要,以便让相关方了解模型能力的变化,并共同确保负责任地部署。

OpenAI在2025年6月处理生物能力阈值时采取了什么类似措施?

在2025年6月,当模型接近生物学的关键能力阈值时,OpenAI概述了加强保障、扩大测试、与外部专家合作以及部署额外安全控制的步骤。这次对Astra的处理遵循了相同的原则。

🏷️

标签

➡️

继续阅读