内容提要
GPT-6 Astra在FrontierMath-Erdos测试中仅解决68道埃尔德什开放问题中的2道,成功率3%,成本超22万美元。对比其FrontierMath Tier 4的98分,凸显AI在“解已知题”与“发现新问题”间的巨大差距。测试采用Lean形式化验证,确保结果可靠,但63道题仍无解,显示AI数学发现能力有限且成本高昂。
延伸解读
“已知”与“未知”的鸿沟
GPT-6 Astra在FrontierMath Tier 4上拿下98分,却在FrontierMath-Erdos的68道开放问题中仅解出2道,成功率3%。这并非矛盾,而是两类测试的本质差异:前者考“有答案的难题”,后者考“没答案的难题”。98分与3%之间的巨大落差,恰恰揭示了AI在“解已知题”与“发现新问题”之间的真实距离。
成本与成功率的真相
报告显示,GPT-6 Astra在标准测试中解决2道题,但额外尝试172次、花费超22万美元后,总共也只解出5道题,成功率不足3%。最贵的一道题耗资617美元、耗时41小时。这印证了陶哲轩的批评:许多“AI解决数学难题”的新闻只报喜不报忧,系统性测试的成功率可能低至1%-2%。
形式化:AI的隐形拐杖
FrontierMath-Erdos要求问题必须能用Lean形式化表述,这背后有大量人工翻译工作。形式化既可能低估AI能力——模型可能因无法翻译或缺少库而失败;也可能高估——框架已给定,AI无需自己发现表述方式。因此,AI目前能解决的数学问题,仍受限于“能被形式化”这一前提。
被遗忘的63道题
尽管GPT-6 Astra解决了5道开放问题,但68道中仍有63道纹丝不动,包括向日葵猜想、埃尔德什-哈伊纳尔猜想等著名难题。56道题被尝试2到5次,总计172次尝试,零成功。这提醒我们,AI的数学发现能力依然有限,距离真正自主探索未知边界还有很长的路。
Q&A
GPT-6 Astra在FrontierMath-Erdos测试中解决了多少道埃尔德什开放问题?
GPT-6 Astra在FrontierMath-Erdos测试中解决了68道埃尔德什开放问题中的2道,成功率约为3%。
FrontierMath-Erdos测试与FrontierMath Tier 4有何不同?
FrontierMath Tier 4测试的是有答案的难题,而FrontierMath-Erdos测试的是没有答案的开放问题。前者考察解题能力,后者考察发现能力。GPT-6 Astra在FrontierMath Tier 4上得分98分,但在FrontierMath-Erdos上成功率仅为3%,凸显了AI在解决已知问题和发现新问题之间的巨大差距。
FrontierMath-Erdos测试如何确保结果可靠?
FrontierMath-Erdos测试采用Lean形式化验证,确保证明的正确性。所有模型在相同条件下运行,每个问题最多花费300美元和72小时,不允许人工干预,所有结果公开。这种设计排除了作弊和选择性报告的可能性。
GPT-6 Astra在FrontierMath-Erdos测试中解决的两道题是什么?
GPT-6 Astra解决的两道题是#74和#126。#74是关于无限图染色的问题,GPT-6 Astra证明了如果删边函数发散得足够慢,色数最多为3。#126是数论问题,GPT-6 Astra证明了给定n个自然数,两两之和的质因子集合大小至少有n的1/2次方量级,远强于原来的下界。
GPT-6 Astra在额外尝试中解决了哪些问题?
在额外尝试中,GPT-6 Astra还解决了#1、#548和#571。#1是埃尔德什1931年提出的关于无和集的问题,GPT-6 Astra构造了一个反例,但证明是非构造性的。#548是埃尔德什-索斯猜想,GPT-6 Astra给出了完整证明,且证明简短优雅。#571是关于图兰数的极值图论问题,GPT-6 Astra证明了对于任意有理数α在1到2之间,都存在一个二分图,其图兰数以n的α次方量级增长。
为什么说AI在数学发现上的成本很高?
在FrontierMath-Erdos标准测试中,GPT-6 Astra解决2道题花费了超过22万美元的算力,成功率仅3%。在额外尝试中,总共试了172次,花费超过22万美元,解决了5道题,成功率不到3%。最贵的一道题花费了617美元和41小时。相比之下,OpenAI内部版本解决10个重大开放问题仅花费约2000美元,成本差异巨大,说明测试条件和预算对成本影响显著。
陶哲轩对AI解决数学难题的看法是什么?
陶哲轩在2026年的演讲中指出,AI公司宣布的成功案例不是在受控科学条件下收集的,公司只报告成功,不报告尝试次数、成本和人工干预。他给出AI在埃尔德什问题上的系统性测试成功率仅为1%到2%,意味着每个成功背后可能隐藏着98次失败。
FrontierMath-Erdos测试中,其他四个模型的表现如何?
在FrontierMath-Erdos测试中,其他四个模型(GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5)一道题都没有解决,全部为0。这表明并非所有前沿模型都能解决开放问题,只有最新的GPT-6 Astra做到了。
为什么说AI能解决的数学问题受限于形式化?
FrontierMath-Erdos测试要求问题能被表述成Lean形式,这需要人类数学家进行大量翻译工作。如果模型找到了论证思路但无法翻译成Lean,或者依赖的定理在Mathlib中不存在,就无法成功。因此,AI能解决的数学问题目前受限于“能被形式化”的前提,而大部分前沿数学研究恰恰不能被轻易形式化。
GPT-6 Astra在网络安全测试中的表现如何?
GPT-6 Astra在网络安全测试ExploitBench中拿了100分,甚至能自己发现并利用零日漏洞。正因如此,OpenAI不得不推迟发布数周以增加安全护栏。