刚刚,GPT-6 震撼发布!人类进入 AGI 大分工时代

刚刚,GPT-6 震撼发布!人类进入 AGI 大分工时代

💡 原文中文,约4100字,阅读约需10分钟。
📝

内容提要

OpenAI发布GPT-6 Astra,称其为最智能、最符合人类意图的模型,具备强大计算机操作能力,可独立完成复杂任务。它在软件工程、科学研究和网络安全等领域表现卓越,但引发安全争议。OpenAI采用分级开放策略,并认为这标志着AGI时代起点,人类与AI将重新分工。

🔎

延伸解读

安全分级:能力越强,门槛越高

Astra 在网络安全测试中表现突出,甚至能发现并利用两个此前未知的零日漏洞。OpenAI 因此采取分级开放策略:普通用户版本会拒绝部分高级网络安全请求,而经过审核的安全团队可通过 Daybreak 项目获得更开放的访问权限。这种分级机制表明,模型能力越强,其潜在风险也越大,OpenAI 试图在能力释放与安全管控之间寻求平衡。

从 token 定价到任务成本

Astra 的 API 定价明显高于前代,但 OpenAI 认为,未来企业不应只关注 token 单价,而应关注完成一项任务所需的总成本。Astra 在多个基准测试中表现出更高的效率,例如在 Terminal-Bench 4.0 中得分远超前代,且预计 API 成本更低。这暗示着 AI 服务的定价模式可能从按量计费转向按任务效果计费,对企业用户而言,更应关注整体投入产出比。

对齐与可解释性的新挑战

OpenAI 强调 Astra 是最符合人类意图的模型,在突破任务边界测试中违规率为 0%,远低于前代。但与此同时,Astra 的文字推理过程更难监控,因为它能用更少的步骤完成复杂任务。这带来一个矛盾:模型越高效,其决策过程越不透明,可能增加安全审计的难度。未来,如何在提升能力的同时保持可解释性,将是 AI 发展的重要课题。

Q&A

GPT-6 Astra 是什么?它和之前的模型有什么不同?

GPT-6 Astra 是 OpenAI 发布的最新模型,被称为“全球最智能、最符合人类意图的模型”。与以聊天、写作和问答为主的前代模型不同,Astra 更像一个能直接干活的 AI Agent,可以调用工具、操作软件、浏览网页,独立完成复杂任务。

GPT-6 Astra 在 Computer Use 能力上有哪些提升?

Astra 是目前最强的计算机操作模型,可以完成填写在线表单、更新 CRM 数据、整理日程、进行网络研究,并在邮件和文档编辑器中生成内容。它还能分析科学数据、生成图表、创建网站,并自动运行前端质量测试。在 OSWorld 2.0 测试中得分 72.6%,高于 GPT-5.6 Sol 的 65.7%。

GPT-6 Astra 在软件工程和科学研究方面表现如何?

在软件工程方面,Astra 在 Terminal-Bench 4.0 测试中得分 57.7%,明显高于 GPT-5.6 Sol 的 37.3%;在 DeepSWE v1.1 测试中得分 74.1%。在科学研究方面,Astra 在 FrontierMath Tier 4 测试中取得 97.6% 成绩,在 GPQA Diamond 科学推理测试中达到 96.0%,并帮助推进了素数间隔问题研究。

GPT-6 Astra 在网络安全方面有什么能力?引发了哪些安全争议?

Astra 在 ExploitBench 测试中获得 100% 成绩,在 ExploitGym 测试中成功率达到 42.4%,并发现并利用了此前未知的 zero-day 漏洞。这引发了安全争议,因为同一个模型既可以帮助企业发现漏洞、修复代码,也可能被用于攻击系统。OpenAI 因此采取了分级开放策略,普通用户版本会拒绝部分高级网络安全请求,而经过审核的安全团队可以通过 Daybreak 项目获得更开放的访问权限。

GPT-6 Astra 的定价是多少?与 GPT-5.6 Sol 相比如何?

GPT-6 Astra 的 API 定价为输入每百万 token 10 美元,输出每百万 token 50 美元,缓存读取和写入另有计费规则。相比 GPT-5.6 Sol,Astra 的价格有了明显提升。OpenAI 还提供 Fast Mode,可将处理速度提升至标准模式的 2.5 倍,但价格也会上升至标准模式的两倍。

OpenAI 对 GPT-6 Astra 的发布有何评价?它是否标志着 AGI 时代的到来?

OpenAI 总裁 Greg Brockman 表示,几年后回头看,今天就是 AGI 时代的起点。他认为 AGI 更像一个“使命概念”,而不是一个可以被简单定义的技术指标。OpenAI 并未正式宣布已经实现 AGI,但认为 Astra 可能被视为 AGI 时代的重要起点。

🏷️

标签

➡️

继续阅读