AI倒查论文100年!99.2%的顶刊都有问题…

AI倒查论文100年!99.2%的顶刊都有问题…

💡 原文中文,约2600字,阅读约需6分钟。
📝

内容提要

该文报道AI Agent对ICML 2026论文进行复现审计,发现58篇无法复现,且GPT-5检测显示99.2%的顶会论文存在平均4.7个客观错误,错误率逐年上升。作者认为这为科研人员提供了新机遇,建议通过AI核查旧论文、发现异常点来寻找选题,并指出AI工具仍需人工审核。

🔎

延伸解读

复现失败不等于造假

文章明确指出,AI Agent复现失败与学术造假之间存在巨大区别。失败原因包括代码缺失、依赖库版本断裂、运行结果不符,甚至模型下线导致永久无法复现。这些情况更多反映的是科研可复现性危机,而非学术不端。读者在看待此类审计结果时,应避免过度解读,需区分技术性缺陷与主观造假。

错误率上升的警示

GPT-5检测显示,NeurIPS论文的篇均错误数从2021年的3.8个上升至2025年的5.9个,涨幅达55.3%。这一趋势提示,随着AI领域论文数量爆炸式增长,模型复杂度提升,论文中的客观错误可能随之增加。这为科研人员敲响警钟,也凸显了系统性验证旧论文的必要性。

AI核查的局限

文章强调,AI核查工具并非万能。以GPT-5驱动的Paper Correctness Checker为例,其检测精确率为83.2%,且每次检测中仍有约四成真实错误未被检出。这意味着AI工具的输出结果仍需人工审核,不能完全依赖AI作为科学文献的判官。读者在利用AI辅助科研时,应保持批判性思维。

Q&A

AI Agent对ICML 2026论文的复现审计结果如何?

AI Agent对ICML 2026全部168篇口头报告论文进行审计,其中92篇有至少5条可验证的结论性声明。结果发现,仅34篇能复现超过四成结论,只有8篇能复现八成以上结论,58篇无法复现。

论文无法复现的原因有哪些?

复现失败的原因包括代码缺少关键文件、依赖库版本断裂、运行结果与论文不符,以及4篇论文依赖的模型已下线,导致实验结果永久无法复现。

GPT-5论文检查系统检测出顶会论文存在哪些问题?

GPT-5论文检查系统检测发现,99.2%的顶会论文平均存在4.7个客观错误,其中数学与公式错误占比最高,达到54.0%。此外,30.8%的NeurIPS论文和23.8%的ICLR论文包含至少一个可能影响结果解读的实质性错误。

论文错误率随时间有什么变化趋势?

NeurIPS论文的篇均错误数从2021年的3.8个上升至2025年的5.9个,涨幅达55.3%,错误率呈逐年上升趋势。

作者认为AI核查旧论文对科研人员有什么机遇?

作者认为这为科研人员提供了新机遇,建议通过AI核查旧论文、发现异常点来寻找选题,例如关注被大量引用但争议较少的经典论文,并利用AI制作知识地图和研究谱系来发现连接和异常。

AI工具在论文核查中的局限性是什么?

AI工具如GPT-5驱动的Paper Correctness Checker检测精确率为83.2%,且每次检测中仍有约四成真实错误未被检出,因此AI核查工具的输出结果需要人工审核,不能完全依赖。

🏷️

标签

➡️

继续阅读