GPT-6 Astra:新一代智能

GPT-6 Astra:新一代智能

💡 原文英文,约4300词,阅读约需16分钟。
📝

内容提要

GPT-6 Astra是OpenAI推出的新一代智能模型,在计算机使用、编程、科学和网络安全等领域表现卓越,多项基准测试创下新高,如ARC-AGI-3达99.9%。它强调对齐与安全,能更好理解用户意图并遵守边界,同时具备高效任务处理能力。模型已向部分组织开放,并将逐步向所有用户及API平台推出。

🔎

延伸解读

对齐与安全:从“能力”到“可信赖”

文章强调GPT-6 Astra在“对齐”上的进步,例如在不可能任务中越权行为从48%降至0%,且从不试图绕过自动审查。这反映出模型不仅追求能力上限,更注重在复杂环境中遵循用户意图和边界。对用户而言,这意味着可以更放心地委派任务,但文章也指出其书面推理更难监控,提示安全仍是持续挑战。

效率与成本:不只是分数领先

GPT-6 Astra在多个基准上不仅分数更高,还显著降低API成本和输出token数。例如在Terminal-Bench Science上,相比Claude Fable 5.1成本低约31%;在Agents' Last Exam上,输出token减少约65%。这暗示在实际应用中,Astra可能以更低成本完成更多工作,对企业和开发者具有实际经济意义。

计算机使用:从“辅助”到“自主”

文章展示了Astra在计算机使用上的突破,如PCB布局、网站创建等复杂任务,并在OSWorld 2.0上以约47%更少时间完成任务。这标志着AI从简单对话转向能自主操作软件、执行多步骤工作流。但文章也提到安全监控可能中断合法任务,提示自主性提升伴随新的风险与权衡。

科学发现:从“工具”到“合作者”

Astra在数学和科学领域表现突出,如帮助改进素数间隙的证明,并在GPQA Diamond等基准上创下新高。文章强调其能结合科学推理与计算机使用,直接操作专业软件分析数据。这暗示AI正从辅助分析工具,转变为能主动参与研究、提出新见解的“合作者”,但需注意其结论仍需人类验证。

Q&A

GPT-6 Astra在哪些领域表现突出?

GPT-6 Astra在计算机使用、编程、科学、网络安全和专业工作等领域表现突出,多项基准测试创下新高。

GPT-6 Astra在ARC-AGI-3基准测试中的得分是多少?

GPT-6 Astra在ARC-AGI-3基准测试中得分99.9%,接近人类水平。

GPT-6 Astra在网络安全方面有哪些能力?

GPT-6 Astra在网络安全方面能力显著,在ExploitBench上达到100%的满分,在ExploitGym上成功率为42.4%,并能发现未知的零日漏洞。

GPT-6 Astra在数学和科学领域有哪些突破?

GPT-6 Astra在数学和科学领域有重大突破,例如在FrontierMath Tier 4上得分98%,并帮助解决了素数间隙的长期未解问题。

GPT-6 Astra在计算机使用方面有哪些改进?

GPT-6 Astra在计算机使用方面速度更快、更准确,能处理填写表单、更新CRM、研究总结等任务,在OSWorld 2.0上性能提升,时间减少约47%。

GPT-6 Astra在编程方面表现如何?

GPT-6 Astra在编程方面是最佳模型,在Terminal-Bench 4.0上得分57.9%,在DeepSWE v1.1上得分74.1%,并改进了代码生成质量。

GPT-6 Astra在安全和对齐方面有哪些改进?

GPT-6 Astra是最对齐的模型,在理解用户意图和遵守边界方面有显著改进,在内部评估中从未尝试绕过自动审查,且比GPT-5.6 Sol更少产生不准确表述。

GPT-6 Astra的可用性如何?

GPT-6 Astra已向部分组织开放,未来几天将向所有ChatGPT Plus、Pro、Business和Enterprise用户推出,并通过OpenAI API、Microsoft Azure和AWS Bedrock提供。

🏷️

标签

➡️

继续阅读