AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

💡 原文中文,约2100字,阅读约需5分钟。
📝

内容提要

GPT-6 Astra攻破FrontierMath Tier 4最后一道题,Epoch AI宣布该测试饱和。Tier 4于2025年7月推出时最高分约5%,经v2修订后剩43题,Astra达97.6%。但项目已转向真正的开放问题及Lean形式化,Astra在68道Erdős问题中仅解出2道。

🔎

延伸解读

从5%到97.6%:Tier 4的快速饱和

Tier 4于2025年7月推出时,最高分仅约5%,但到GPT-6 Astra已达到97.6%。Epoch AI的饱和定义是累积所有模型和尝试后每道题都至少被解出一次,Astra补上了最后一道。这种速度表明,针对固定题库的评测容易被快速攻破,但饱和不等于模型能独立解决所有数学问题。

题库修订与成绩提升的关联

OpenAI测试发现FrontierMath错误比预期多,Epoch AI审计后于2026年6月推出v2,Tier 4修正12题、移除7题,剩43题。修订后GPT-5.6 Sol达83.0%,Claude Fable 5达90.2%,Astra达97.6%。成绩跃升部分源于题目调整,读者需注意评测基准的动态变化。

新方向:开放问题与形式化验证

FrontierMath已转向真正的Open Problems和Lean形式化的Erdős问题。前者使用尚未解决的研究问题,后者要求写出可通过形式化验证的证明。Astra在68道Erdős问题中仅解出2道,显示面对开放问题和严格证明,AI仍有明显局限。

Q&A

FrontierMath Tier 4 是什么?它为什么被设计出来?

FrontierMath Tier 4 是 Epoch AI 于 2025 年 7 月推出的研究级数学测试层级,题目由数学教授和博士后围绕自己的研究方向设计,难度接近早期博士研究问题。它诞生的目的是避免数学 Benchmark 过快被 AI 刷穿,因为传统数学测试已难以拉开头部模型差距。

GPT-6 Astra 在 FrontierMath Tier 4 上取得了什么成绩?

GPT-6 Astra 在 FrontierMath Tier 4 上达到 97.6% 的正确率,并攻破了此前唯一一道从未被 AI 解出的题目。至此,Tier 4 中每道题都至少被 AI 成功解出过一次,Epoch AI 宣布该测试饱和。

FrontierMath Tier 4 从推出到饱和经历了怎样的过程?

2025 年 7 月 Tier 4 推出时最高分约 5%,最初 50 道题中只有 3 道被解出且依赖未充分论证的假设。2026 年 6 月推出 v2 版本,修正 12 道、移除 7 道,留下 43 题。随后 GPT-5.6 Sol 达 83.0%,Claude Fable 5 达 90.2%,GPT-6 Astra 达 97.6% 并补上最后一道未解题,实现饱和。

FrontierMath 题库为什么需要推出 v2 版本?

OpenAI 在测试中发现 FrontierMath 里的错误比预期更多。Epoch 启动独立审计,先用 GPT-5.5 和 Claude Opus 4.7 筛查疑点,再交给数学家逐题复核。最终在 2026 年 6 月推出 v2 版本,其中 Tier 4 修正了 12 道题、移除了 7 道题,留下 43 题。

FrontierMath 项目现在转向了哪些新方向?

FrontierMath 项目在 Tiers 1-4 之外,增加了真正的 Open Problems 和 FrontierMath Erdős。前者直接拿尚未被数学界解决的研究问题考模型;后者要求 AI 写出能通过 Lean 形式化验证的完整证明。

GPT-6 Astra 在 FrontierMath Erdős 上的表现如何?

GPT-6 Astra 在 FrontierMath Erdős 的 68 道问题中只解决了 2 道。这表明尽管 Tier 4 已饱和,但面对需要形式化验证的开放问题,AI 仍有很大局限。

🏷️

标签

➡️

继续阅读