数学家Hales撰文讨论Lean形式化数学的可靠性。2026年AI自动形式化取得突破,Fermat大定理等被快速形式化,但同年夏季发现多个Lean内核可靠性漏洞,可证明假命题。应对方案包括多内核交叉验证、形式化验证内核(如Con-Leche)及加强类型论元理论研究。作者警告AI时代不可盲信系统,需人类审计。
DeepMind开源了形式化数学猜想库,收录经典数学猜想,鼓励用户贡献新猜想、改进引用或修复错误。陶哲轩支持该库,认为形式化表述是利用自动化工具解决开放性问题的重要步骤。
FormalMATH发布了5560道数学题的基准测试,以评估AI模型的数学推理能力。最佳模型的成功率仅为16.46%,显示出在严格逻辑推导方面的困难。研究团队提出了自动化流程以提高效率,并呼吁学术界共同推动形式化数学推理技术的发展。
完成下面两步后,将自动完成登录并继续当前操作。