OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

💡 原文英文,约1700词,阅读约需7分钟。
📝

内容提要

OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。

🔎

延伸解读

“AGI时代”宣言的模糊性

OpenAI总裁Greg Brockman称“我们正处于AGI时代”,但承认AGI是“灰色、模糊的概念”,且不再作为合同触发条件,而是“使命或精神概念”。他明确表示由读者自行判断是否算AGI。这表明该宣言更多是象征性表述,而非技术定义,读者应理性看待,不宜将其视为对AGI的正式认定。

基准测试成绩需谨慎解读

Astra在多个基准上表现优异,但部分成绩受测试条件影响。例如ARC-AGI-3的98.6%得分包含了系统组件(如Responses API harness)的贡献,并非纯模型能力。FrontierMath测试中,OpenAI资助了开发并拥有部分独家访问权。此外,DeepSWE结果与Meta的Muse Spark 1.3差距极小,且图表未包含Muse,可能夸大优势。

价格与效率的权衡

Astra的API定价为每百万输入/输出token 10/50美元,是Sol促销价的2.5倍,但低于Muse标准价。OpenAI称Astra在多项评估中token使用更少,但数据尚不足以证明总成本更低。总裁强调“每任务价格才是关键”,暗示高单价未必导致高账单,但实际成本需待用户测试验证。

安全限制与用户体验

Astra因网络攻击能力增强已触发“关键”网络安全阈值,OpenAI限制高风险访问,并警告用户可能遭遇减速或拦截,甚至影响无关任务。API开发者可能遇到任务被直接阻止而非暂停。这反映了前沿模型安全与可用性之间的张力,用户需预期潜在的使用障碍。

Q&A

OpenAI发布的GPT-6 Astra是什么?

GPT-6 Astra是OpenAI于周四发布的最新旗舰模型,被描述为“世界上最智能且对齐的模型”。

OpenAI总裁Greg Brockman对AGI时代有何看法?

Brockman认为AGI是一个“灰色、模糊的东西”,但他个人认为现在已经进入AGI时代,并说“欢迎来到AGI时代”。不过他也表示这只是一个旅程的开始,并非终点。

GPT-6 Astra的训练规模有何特点?

Astra是OpenAI迄今为止最大规模的训练运行,首次在德克萨斯州Stargate站点使用超过10万块GPU进行预训练,并且是首个由早期模型在监督训练过程中发挥重要作用的模型。

GPT-6 Astra的定价是多少?与竞争对手相比如何?

GPT-6 Astra的API定价为每百万输入tokens 10美元,每百万输出tokens 50美元。这比Sol的促销价高2.5倍,但与Anthropic的Fable 5.1定价一致,远高于Muse和Google Gemini 3.8 Flash的价格。

GPT-6 Astra在编码基准测试DeepSWE上的表现如何?

Astra在DeepSWE v1.1上得分74.1%,优于OpenAI的Sol(70.8%),但低于Meta的Muse Spark 1.3(75.4%)。不过由于误差范围重叠,这些结果并未明确分出胜负。

GPT-6 Astra在ARC-AGI-3上的得分是多少?为什么这个分数需要谨慎看待?

Astra在ARC-AGI-3上得分98.6%。但OpenAI使用了Responses API harness,该工具可以保留推理过程并压缩长上下文,这可能会提高分数,因此该分数衡量的是Astra和OpenAI代理系统的整体表现,而非模型单独的能力。

GPT-6 Astra在科学任务上的表现如何?

在Terminal-Bench Science任务上,Astra得分64.6%,高于Anthropic的Fable 5.1(52.6%)和公共排行榜上Opus 5的30%。这表明OpenAI和Anthropic都在推动模型进入研究流程。

GPT-6 Astra如何处理超出上下文窗口的任务?

Astra可以跨上下文窗口保留笔记,并搜索早期消息和工具输出,而不是像Codex那样依赖压缩(可能丢失细节)。该功能目前是实验性的,但将在未来几周内成为默认设置。

GPT-6 Astra在网络安全方面有哪些风险?

Astra在公司的测试中能够开发针对加固浏览器和操作系统的漏洞利用,并发现了两个未知漏洞,已触发关键网络安全阈值。因此,OpenAI限制了高风险访问,并警告用户可能遇到减速或拦截。

GPT-6 Astra在桌面应用操作上的表现如何?

在OSWorld V2-Offline基准测试中,Astra得分72.6%,高于GPT-5.6 Sol的65.7%,平均任务时间从75分钟降至40分钟。但Anthropic报告的Fable 5.1得分更高(77.9%),不过测试版本不同,不可直接比较。

🏷️

标签

➡️

继续阅读