PutnamBench是一个多语言基准测试,用于评估神经定理证明器解决竞赛数学问题的能力。它包含了640个定理的1697个手工构造形式化的表述,并用Lean 4和Isabelle进行了全部定理的形式化。该基准测试用于评估几种已有的神经和符号定理证明器,这些方法只能解决很少一部分的PutnamBench问题。
我们开发了一个神经定理证明器,能够解决多种高中奥林匹克问题,包括AMC12和AIME竞赛中的问题,以及两个改编自IMO的问题。
完成下面两步后,将自动完成登录并继续当前操作。