ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?

ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%?

💡 原文中文,约5400字,阅读约需13分钟。
📝

内容提要

UniPat AI发布PaperBenchX基准,通过93篇真实论文复现任务评测AI科研能力。该基准覆盖12个学科、10种科学软件,要求Agent在隔离环境中重跑工作流,仅认可重新生成的证据。最强模型GPT-6 Astra的完整复现率仅13.98%,AI建模和执行得分约六成,验证仅42.8%,前期决策错误会导致后续计算失效。

🔎

延伸解读

从“猜答案”到“重建证据链”

PaperBenchX的评测逻辑与常见基准有本质区别:论文公开,Agent能看到结果数字,但评分不认这些数字,只认在隔离环境中重新生成的证据。系统会删掉Agent的全部输出、断开网络,从头重跑工作流,只有重放产物才进入评分。这意味着,靠记忆或猜测论文结论无法得分,Agent必须真正重建一条科学上成立的流程。这一设计把“复现”从结果比对升级为过程验证,也解释了为何最强模型完整复现率仅13.98%。

验证环节为何成为最大短板

在受测配置中,建模和执行的平均得分分别为62.70%和61.84%,而验证只有42.80%。这说明Agent能完成部分建模、调用求解器并生成结果文件,但很难判断这些结果是否真正支持论文结论。科学复现没有简单的pass/fail标准,一个与论文对得上的数字,可能来自错误的物理模型、未收敛的仿真或不合理的后处理。验证能力薄弱,直接拉低了端到端复现的成功率。

前期决策错误会让后续计算归零

轨迹分析显示,交互轮数越多,分数不一定越高,长时间运行往往意味着反复尝试或故障恢复。以Fable 5为例,它将37.1%的时间用于论文重建和代码实现,前期投入比例最高,反而用较少交互取得接近最优的部分得分。原因在于,如果几何结构、边界条件或关键参数在前期设置错误,求解器即使正常运行,也只是在计算错误的科学系统,后续数小时计算可能全部失去价值。

与已有基准的关键差异

PaperBenchX并非首个论文复现基准,但过往工作多集中在机器学习论文领域,基本局限在ML/Python栈。PaperBenchX覆盖12个研究方向和10种领域原生科学软件,如Ansys HFSS、Lumerical、Meep、PySCF等,要求Agent在真实科学软件中工作。单任务预算4至24小时,中位数7小时,Agent需自行分配算力、决定何时检查中间结果和调整参数,更接近真实科研的取舍,而非可无限尝试的代码执行任务。

❓

Q&A

PaperBenchX是什么?它主要用来评测什么?

PaperBenchX是UniPat AI发布的基准,用于评测AI在真实论文复现任务中的科研能力。它从93篇研究论文构建了93个复现任务,覆盖12个研究方向和10种科学软件,要求Agent在隔离环境中重跑工作流,仅认可重新生成的证据。

GPT-6 Astra在PaperBenchX上的完整复现率是多少?

表现最强的GPT-6 Astra完整复现率只有13.98%。

为什么AI能破解千禧年数学难题,却难以可靠复现论文?

数学有Lean等机器可逐步检查的证明防线,而其他科学领域没有。一个和论文对得上的数字,背后可能是错误的物理模型、没收敛的仿真或无效后处理。可靠复现要求Agent完成理解科学问题、执行科学计算、验证科学结论的完整链路,目前模型还很难串联各个环节。

PaperBenchX的评分规则是怎样的?如何防止Agent蒙混过关?

Agent提交可执行工作流后,系统删除全部输出、断开网络,在隔离环境从头重跑,只相信重放产物。验证分三层:能否重跑出来、证据能否溯源、科学上是否站得住。Agent自述的“复现成功”不被当作证据。

PaperBenchX与OpenAI的PaperBench等已有基准有什么区别?

已有基准基本局限在ML/Python栈,而PaperBenchX是第一个在不同学科领域让Agent直接面对Ansys HFSS、Ansys Lumerical、Meep、PySCF/GPU4PySCF、ABACUS等领域原生求解器的复现基准,覆盖12个研究方向、10种仿真平台。

AI在论文复现中主要卡在哪些环节?

建模和执行平均得分约六成,但验证仅42.8%。更多交互轮数不一定带来更高分,长时间运行常意味着反复尝试或错误计算。前期决策如论文理解、科学建模、参数选择若错误,后续计算可能全部失效。

🏷️

标签

➡️

继续阅读