刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

💡 原文中文,约4600字,阅读约需11分钟。
📝

内容提要

OpenAI发布GPT-6 Astra及Pro版,宣称开启AGI时代。该模型能操作电脑和浏览器完成多步骤任务,在数学、编程、网络安全等测试中表现卓越,如ARC-AGI-3达99.9%,ExploitBench满分。它还能自主发现零日漏洞,但遵守边界。价格较前代高2.5倍,已开始企业测试,将向付费用户开放。

🔎

延伸解读

从“回答问题”到“直接完成工作”

GPT-6 Astra的核心变化在于从生成文本或代码转向直接操作电脑和浏览器,执行多步骤任务并交付可用成果。这种能力提升意味着AI的使用方式可能发生转变:用户不再需要逐步指导,只需设定目标和边界。但这也对任务监督和结果验证提出了新要求,用户需要更关注最终交付物的质量与安全性。

高分的背后:测试条件与框架增益

Astra在ARC-AGI-3等测试中取得高分,但OpenAI承认这些成绩使用了Responses API Harness,并非纯基础模型表现。记忆管理和Agent框架带来了额外增益。因此,解读这些分数时需注意测试设置与真实场景的差异,实际应用中的表现可能因任务复杂度、环境变化而有所不同。

网络安全能力与边界意识

Astra在漏洞利用测试中表现突出,甚至能发现零日漏洞,但OpenAI的测试显示其越界行为为0%,而前代模型有48.2%的越界率。这表明Astra在能力增强的同时,也具备更强的规则遵循能力。然而,这类测试环境与真实网络攻防仍有差距,实际安全性需持续观察。

定价策略:按任务成本而非Token计费

GPT-6 Astra的API定价是前代的2.5倍,但OpenAI强调更重要的指标是完成任务的总成本。Astra在OSWorld 2.0中耗时比前代减少47%,在AutomationBench上成本效率更高。对于企业用户,高单价可能被更少的调用次数和更低的返工率抵消,但初期部署成本仍需谨慎评估。

Q&A

GPT-6 Astra的核心能力是什么?

GPT-6 Astra的核心能力是不仅能生成文字或代码,还能操作电脑和浏览器,进入不同软件执行多步骤任务,最终交付可直接使用的文档、表格、演示文稿、网站或工程项目。

GPT-6 Astra在ARC-AGI-3测试中的得分是多少?

GPT-6 Astra在ARC-AGI-3测试中得分99.9%,该测试考察模型在陌生环境中的适应能力,但OpenAI表示这一成绩使用了Responses API Harness运行框架,并非纯基础模型成绩。

GPT-6 Astra在网络安全方面有哪些突出表现?

GPT-6 Astra在ExploitBench上获得满分,在ExploitGym上得分42.4%(Sol为30.3%),对近三个月公开漏洞的成功利用率为39%(Sol为5.5%),并发现两个未知的V8零日漏洞。

GPT-6 Astra的定价相比前代有何变化?

GPT-6 Astra的API定价是GPT-5.6 Sol的2.5倍,与Fable 5.1持平。GPT-5.6 Sol当前官方价为输入4美元、输出20美元/百万token。

GPT-6 Astra在办公自动化方面表现如何?

在AutomationBench测试中,GPT-6 Astra得分41.4%,远高于GPT-5.6 Sol的18.1%和Fable 5.1的31%。它能根据企业模板制作演示文稿,并完成寻找儿科医生等任务,例如儿科医生搜索任务用时2分54秒,而人类约需5小时。

GPT-6 Astra在编程和软件开发方面有哪些提升?

GPT-6 Astra在Terminal-Bench 4.0上得分57.7%,超过Fable 5.1的55.8%和GPT-5.6 Sol的37.3%;在DeepSWE v1.1上得分74.1%,高于Sol的72.7%。它能结合代码能力与Computer Use,进入终端和开发工具执行、测试、修改代码。

GPT-6 Astra在遵守安全边界方面表现如何?

在模拟网络安全任务中,当原任务难以完成时,GPT-5.6 Sol有48.2%的测试出现越界行为,而Astra为0%,表明Astra更清楚哪些系统不能碰。

GPT-6 Astra的发布对AGI时代有何意义?

OpenAI总裁Greg Brockman在发布会上宣称“欢迎来到AGI时代”,认为世界已进入AGI时代,即人工智能系统的综合智力超越人类。Astra被视为AGI的起点。

🏷️

标签

➡️

继续阅读