GPT-6 Astra 正式发布:性能 AGI,贵到要负债

GPT-6 Astra 正式发布:性能 AGI,贵到要负债

💡 原文中文,约4800字,阅读约需12分钟。
📝

内容提要

OpenAI发布GPT-6 Astra,宣称达到AGI水平。该模型在数学、科学及软件工程测试中表现优异,尤其在环境理解和电脑操作上超越前代,能直接使用GUI完成复杂任务,如开发游戏、处理财务文件。尽管通用智能评分非最高,但凭借高效token利用和低幻觉率,在编码领域具成本优势。OpenAI强调其对齐能力,同时警示监控难度增加。

🔎

延伸解读

价格与效率的权衡

Astra 的单价虽高,但凭借 token 效率优势,在编码任务中总成本与 Sol 相当。例如,完成 DeepSWE 任务的 API 成本比 Sol 低约 57%。这表明,评估模型时不能只看单价,还需考虑 token 消耗和任务成功率,综合成本可能更具竞争力。

GUI 操作:改变 AI 与软件交互方式

Astra 能直接操作 GUI,意味着无需为每个软件单独开发 API 或 MCP 连接器,可兼容现有大量软件。这降低了企业采用 AI 的门槛,尤其对缺乏 API 的旧系统。OSWorld 2.0 测试显示其成功率提升 7 个百分点,耗时减少 47%,展示了实际应用潜力。

监控与对齐的挑战

OpenAI 强调 Astra 强化了对齐能力,但首席科学家也提醒,模型越强,监控难度越大,甚至可能学会欺骗监控系统。这提示我们,随着 AI 能力提升,安全措施需同步进化,否则可能带来风险。

Q&A

GPT-6 Astra 在哪些基准测试中表现突出?

GPT-6 Astra 在多个基准测试中表现优异,例如 FrontierMath Tier 4 得分 97.6%,GPQA Diamond 得分 96%,DeepSWE 得分 74.1%,BenchCAD 得分 95.9%,ExploitBench 得分 100%,ARC-AGI-3 得分 99.9%,OSWorld 2.0 得分 72.6%。

GPT-6 Astra 的定价是多少?

标准模式下,每百万输入 token 收费 10 美元,输出 50 美元;输入超过 27.2 万 token 后,输入和缓存价格翻倍,输出价格升至 75 美元。快速模式价格翻倍。

GPT-6 Astra 在通用智能测试中的表现如何?

在 Artificial Analysis 的 Intelligence Index v4.1.1 中,Astra max 得分为 61 分,与 GPT-5.6 Sol max 持平,但低于 Fable 5.1 的 66 分、Opus 5 的 63 分和 Muse Spark 1.3 的 62 分。

GPT-6 Astra 在编码任务中的成本效率如何?

Astra 在 Coding Agent Index 中得分 67 分,接近 Fable 5.1 的 70 分。其 token 效率极高,使用的 token 仅为 Sol max 的三分之一、Opus 5 high 的五分之一,因此完成单项 Coding 任务的成本与 Sol 相当,在相同价格区间内具有明显优势。

GPT-6 Astra 的电脑操作能力有何突破?

Astra 能够直接操作 GUI,理解屏幕内容并执行复杂任务,如开发游戏、处理财务文件等。在 OSWorld 2.0 基准测试中得分 72.6%,高于 Sol 的 65.7%,且完成任务时间减少约 47%。

GPT-6 Astra 的发布带来了哪些安全方面的担忧?

OpenAI 强调 Astra 强化了对齐和指令遵循能力,并加强了监控和隔离测试。但首席科学家 Jakub Pachocki 提醒,模型越强,越难准确理解其行为,甚至可能主动欺骗监控系统,这增加了监控难度。

GPT-6 Astra 在哪些实际应用案例中展示了能力?

Astra 展示了多种实际应用,如寻找猫咪寄养服务(5分27秒完成)、寻找工作(2分51秒)、预约车管所服务、寻找公寓、填写表格、整理日历、更新 CRM、处理 Excel 和 Power BI 数据、在 Blender 中建模并转换到 UE5,以及生成完整游戏和审查财务文件等。

GPT-6 Astra 的上下文窗口和知识截止时间是什么?

GPT-6 Astra 拥有 105 万 token 的上下文窗口,最高输出 12.8 万 token,知识截止时间为 2026 年 4 月 30 日。

🏷️

标签

➡️

继续阅读