OpenAI构建了一个它不希望大多数人使用的模型

OpenAI构建了一个它不希望大多数人使用的模型

💡 原文英文,约900词,阅读约需3分钟。
📝

内容提要

OpenAI发布GPT-5.6 Cyber,专为网络安全设计,通过Daybreak Red提供,可执行漏洞利用等高危任务,测试中成功率达95%。该模型发现多个零日漏洞,但成本高且报告简略。同时推出Daybreak Blue供防御用途,并强调安全控制,防止滥用。

🔎

延伸解读

双轨制设计:防御与进攻的明确分工

Daybreak Blue和Red的划分反映了网络安全工作的不同需求。Blue面向防御任务,如代码审查、恶意软件分析,而Red则用于漏洞利用开发。这种分工有助于组织根据工作性质选择合适的工具,同时保持安全控制。但需注意,即使通过Blue访问,模型仍可能拒绝某些高度双重用途的请求,因此防御团队仍需评估其适用性。

性能权衡:并非全面超越

GPT-5.6 Cyber在漏洞利用测试中表现优异,但在漏洞发现和报告撰写方面不如Sol。其报告更简短,且推理预算更大,导致成本更高。这表明,虽然Cyber擅长特定攻击性任务,但在需要详细分析和文档化的场景中,Sol可能更合适。团队应根据任务需求选择模型,避免盲目追求高能力。

安全控制与合规要求

OpenAI强调安全控制,建议将安全代理与生产系统隔离,并限制其访问范围。Daybreak用户需验证身份、接受监控并签署法律声明,个人账户还需使用硬件安全密钥。这些措施旨在防止滥用,但也增加了使用门槛。组织在采用这些模型时,需确保自身合规流程与这些要求匹配。

Q&A

OpenAI发布的GPT-5.6 Cyber是什么?

GPT-5.6 Cyber是OpenAI于周一发布的专为网络安全设计的模型,通过Daybreak Red提供,能够执行漏洞利用、构建攻击链等高危任务,在内部测试中成功率达95%。

Daybreak Red和Daybreak Blue有什么区别?

Daybreak Red提供GPT-5.6 Cyber,用于攻击性安全任务,如寻找零日漏洞和构建漏洞利用链;Daybreak Blue提供GPT-5.6 Sol,用于防御性工作,如代码审查、恶意软件分析和漏洞发现,但Sol仍会拒绝高度双重用途的请求。

GPT-5.6 Cyber在测试中的表现如何?

在内部测试中,GPT-5.6 Cyber回答了95%的请求,而GPT-5.6 Sol在标准防护下仅回答1.5%,在Daybreak Blue下回答2%。Cyber在ExploitGym上得分更高,但在发现漏洞和撰写报告方面不如Sol,报告较短且不够详细。

GPT-5.6 Cyber发现了哪些漏洞?

OpenAI使用该模型检查了Chrome的JavaScript引擎V8,发现两个可链式利用的漏洞,可导致内存破坏和逃逸V8堆沙箱,被Google修复为CVE-2026-15903。此外,还发现了一个流行数据库中的三个严重漏洞(包括远程代码执行)、一个流行移动操作系统中的至少五个漏洞,以及一个流行操作系统内核中的400多个权限提升漏洞。

OpenAI如何防止GPT-5.6 Cyber被滥用?

OpenAI要求Daybreak用户验证身份、接受监控并签署法律声明,个人账户从2026年9月1日起必须使用硬件安全密钥。此外,建议将安全代理与生产系统和开放互联网隔离,并限制其访问范围,同时敦促Codex用户使用自动审查模式来检查需要提升权限的命令。

哪些公司获得了GPT-5.6 Cyber的早期访问权?

SpecterOps、SentinelOne和Palo Alto Networks获得了早期访问权。Palo Alto Networks通过其Frontier AI Defense提供模型,SentinelOne通过Wayfinder Frontier AI Services提供。此外,Accenture、IBM、CrowdStrike和Cisco也可以将模型整合到他们的安全产品中。

GPT-5.6 Cyber的成本和效率如何?

GPT-5.6 Cyber倾向于使用更大的推理预算,因此更长的研究会话成本更高。在ExploitBench上,Sol在300步限制下表现更好,但在600步时差距缩小。Cyber在发现漏洞和报告方面不如Sol高效,报告较短且不够详细。

🏷️

标签

➡️

继续阅读