内容提要
神经外科医生金山木利用ChatGPT的GPT-5.6-Sol模型,在16小时内证明了困扰数学界22年的Crouzeix猜想。该证明获多位顶尖数学家确认,但尚未正式同行评审。此事凸显AI在数学领域的突破能力,并挑战了传统专业训练体系的有效性假设。
延伸解读
AI辅助证明的局限与验证
尽管金山木的证明获得了Crouzeix本人及两位顶尖数学家的确认,但论文尚未经过正式同行评审。这意味着证明的严谨性和可复现性仍需接受更广泛的学术检验。金山木已开源全部资料,包括提示词、迭代手稿和Lean 4形式化代码,这为独立验证提供了条件。读者在关注这一突破时,应意识到正式评审是数学界接受新证明的关键步骤,目前的确认属于初步认可。
AI在数学研究中的角色转变
金山木使用GPT-5.6-Sol进行16小时推理,而职业数学家Alex Townsend用GPT尝试一年多未果,这显示AI工具的效果可能依赖于使用者的策略和问题设定。金山木的提示词策略,如要求物理断网、多智能体发散探索和对抗性审计,可能比单纯依赖模型更关键。这提示AI在数学研究中正从辅助工具转变为协作伙伴,但成功仍需要人类的创造性引导和问题分解能力。
对专业训练体系的挑战
金山木的数学背景仅限于本科通识课,却解决了专业数学家22年未解的问题,这引发了对传统专业训练体系有效性的质疑。然而,文章也指出金山木因经颅超声研究而接触矩阵分析,说明实际问题驱动的跨学科学习可能比纯粹的理论训练更具优势。这一案例或许表明,AI能降低专业门槛,但跨领域问题的洞察力仍来自实践需求,而非单纯依赖工具。
Q&A
金山木是如何在16小时内证明Crouzeix猜想的?
金山木使用OpenAI的GPT-5.6-Sol模型,在ChatGPT Work平台上运行,设定提示词策略,要求模型在物理断网环境下进行纯粹原创思考,启动大量智能体沿不同路径发散探索,对候选策略进行对抗性审计,并指令模型在获得完整证明前不得放弃。模型运行16小时后,成功证明了Crouzeix猜想。
Crouzeix猜想是什么?为什么它难以证明?
Crouzeix猜想由法国数学家Michel Crouzeix在2004年提出,核心内容是对于任意矩阵和任意多项式函数,矩阵经函数作用后的范数不超过该函数在矩阵数值域上最大值的两倍。这个猜想表述简单,但证明难度极高,全球顶尖数学家花了22年未能解决,直到金山木用AI证明。
金山木的学术背景是什么?他如何接触到这个数学问题?
金山木本科就读于北京大学地质学专业,后转行学医,通过协和医学院“4+4试点班”进入临床医学,2024年成为神经外科博士后。他在做经颅超声研究时,为了用超声波穿透复杂的人体颅骨结构,接触到了矩阵分析,进而了解到Crouzeix猜想。
数学家们对金山木的证明有何评价?
提出猜想的Michel Crouzeix本人以及康奈尔大学数学家Alex Townsend和华盛顿大学教授Anne Greenbaum审阅了手稿,确认证明正确。Townsend和Greenbaum表示震惊,并指出这突显了GPT-5.6在过去几周变得多么惊人地有能力,尤其考虑到金山木缺乏数学专业训练。
金山木的证明是否经过正式同行评审?
尚未经过正式同行评审。虽然Crouzeix本人和两位顶尖数学家已经确认证明正确,但正式流程还未完成。金山木已将全部资料开源,包括论文、提示词、迭代手稿、Lean 4形式化证明代码和公理审计报告,供任何人验证。
金山木用AI证明数学猜想的事件对专业训练体系有何挑战?
金山木缺乏数学专业训练,却借助AI解决了专业数学家22年未解决的问题,这挑战了专业训练体系的有效性假设。它表明,在AI辅助下,外行也可能在专业领域取得突破,引发对传统专业训练必要性的思考。
除了Crouzeix猜想,AI还在数学领域取得了哪些突破?
2026年5月,OpenAI内部推理模型自主攻克了匈牙利数学家Paul Erdos在1946年提出的80年平面单位距离问题。2026年8月初,OpenAI又列出了10个被内部版Astra模型解决或取得重大进展的数学问题。同月,Anthropic的未发布Claude研究版在尝试黎曼猜想时也有意外进展。