内容提要
OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。
延伸解读
“AGI时代”宣言的模糊性
OpenAI总裁Greg Brockman称“我们正处于AGI时代”,但承认AGI是“灰色、模糊的概念”,且不再作为合同触发条件,而是“使命或精神概念”。他明确表示由读者自行判断是否算AGI。这表明该宣言更多是象征性表述,而非技术定义,读者应理性看待,不宜将其视为对AGI的正式认定。
基准测试成绩需谨慎解读
Astra在多个基准上表现优异,但部分成绩受测试条件影响。例如ARC-AGI-3的98.6%得分包含了系统组件(如Responses API harness)的贡献,并非纯模型能力。FrontierMath测试中,OpenAI资助了开发并拥有部分独家访问权。此外,DeepSWE结果与Meta的Muse Spark 1.3差距极小,且图表未包含Muse,可能夸大优势。
价格与效率的权衡
Astra的API定价为每百万输入/输出token 10/50美元,是Sol促销价的2.5倍,但低于Muse标准价。OpenAI称Astra在多项评估中token使用更少,但数据尚不足以证明总成本更低。总裁强调“每任务价格才是关键”,暗示高单价未必导致高账单,但实际成本需待用户测试验证。
安全限制与用户体验
Astra因网络攻击能力增强已触发“关键”网络安全阈值,OpenAI限制高风险访问,并警告用户可能遭遇减速或拦截,甚至影响无关任务。API开发者可能遇到任务被直接阻止而非暂停。这反映了前沿模型安全与可用性之间的张力,用户需预期潜在的使用障碍。
Q&A
OpenAI发布的GPT-6 Astra是什么?
GPT-6 Astra是OpenAI于周四发布的最新旗舰模型,被描述为“世界上最智能且对齐的模型”。
OpenAI总裁Greg Brockman对AGI时代有何看法?
Brockman认为AGI是一个“灰色、模糊的东西”,但他个人认为现在已经进入AGI时代,并说“欢迎来到AGI时代”。不过他也表示这只是一个旅程的开始,并非终点。
GPT-6 Astra的训练规模有何特点?
Astra是OpenAI迄今为止最大规模的训练运行,首次在德克萨斯州Stargate站点使用超过10万块GPU进行预训练,并且是首个由早期模型在监督训练过程中发挥重要作用的模型。
GPT-6 Astra的定价是多少?与竞争对手相比如何?
GPT-6 Astra的API定价为每百万输入tokens 10美元,每百万输出tokens 50美元。这比Sol的促销价高2.5倍,但与Anthropic的Fable 5.1定价一致,远高于Muse和Google Gemini 3.8 Flash的价格。
GPT-6 Astra在编码基准测试DeepSWE上的表现如何?
Astra在DeepSWE v1.1上得分74.1%,优于OpenAI的Sol(70.8%),但低于Meta的Muse Spark 1.3(75.4%)。不过由于误差范围重叠,这些结果并未明确分出胜负。
GPT-6 Astra在ARC-AGI-3上的得分是多少?为什么这个分数需要谨慎看待?
Astra在ARC-AGI-3上得分98.6%。但OpenAI使用了Responses API harness,该工具可以保留推理过程并压缩长上下文,这可能会提高分数,因此该分数衡量的是Astra和OpenAI代理系统的整体表现,而非模型单独的能力。
GPT-6 Astra在科学任务上的表现如何?
在Terminal-Bench Science任务上,Astra得分64.6%,高于Anthropic的Fable 5.1(52.6%)和公共排行榜上Opus 5的30%。这表明OpenAI和Anthropic都在推动模型进入研究流程。
GPT-6 Astra如何处理超出上下文窗口的任务?
Astra可以跨上下文窗口保留笔记,并搜索早期消息和工具输出,而不是像Codex那样依赖压缩(可能丢失细节)。该功能目前是实验性的,但将在未来几周内成为默认设置。
GPT-6 Astra在网络安全方面有哪些风险?
Astra在公司的测试中能够开发针对加固浏览器和操作系统的漏洞利用,并发现了两个未知漏洞,已触发关键网络安全阈值。因此,OpenAI限制了高风险访问,并警告用户可能遇到减速或拦截。
GPT-6 Astra在桌面应用操作上的表现如何?
在OSWorld V2-Offline基准测试中,Astra得分72.6%,高于GPT-5.6 Sol的65.7%,平均任务时间从75分钟降至40分钟。但Anthropic报告的Fable 5.1得分更高(77.9%),不过测试版本不同,不可直接比较。