Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子

Nature:AI重生到1900,这一世抢先爱因斯坦提出光量子

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

诺奖得主哈萨比斯提出“爱因斯坦测试”:若AI仅掌握1911年前知识,能否自行提出相对论,以检验AGI。研究者训练GPT-1900尝试重现光量子等发现,虽偶有相似表述,但多数任务失败,且依赖人类提示与现代模型辅助。专家指出,AI擅长归纳演绎,却难有“溯因飞跃”,更缺判断理论价值的能力,距离真正科学家尚远。

🔎

延伸解读

“爱因斯坦测试”的核心逻辑

哈萨比斯提出的“爱因斯坦测试”旨在检验AI能否仅凭1911年前的知识,自主提出相对论。其巧妙之处在于,科学史已知答案,研究者可控制知识节点,观察模型是否具备超越训练数据的推理能力。若成功,这将成为AGI的有力测试。

GPT-1900实验的启示与局限

独立研究者训练GPT-1900尝试重现光量子等发现,虽偶有相似表述,但多数任务失败,且依赖人类提示和现代模型辅助。实验表明,AI在封闭历史知识下仍难独立创新,且“零污染”难以保证,凸显了检验AI创造力的前提难题。

AI与科学家的关键差距

专家指出,AI擅长归纳和演绎,却缺乏“溯因飞跃”,即从异常现象中发明全新解释框架的能力。更关键的是,AI难以判断理论价值,无法决定哪些想法值得深挖。真正的科研需要在混沌中自主判断,这正是AI与人类专家的分水岭。

Q&A

什么是爱因斯坦测试?

爱因斯坦测试是诺奖得主哈萨比斯提出的一个设想:如果AI只掌握1911年之前的知识,它能否在4年后自行提出相对论。目的是检验AI能否仅凭当时的知识水平,完成超出训练材料的推理,而不是复读答案。如果能做到,这将成为检验AGI的一项有力测试。

GPT-1900是什么?它是如何训练的?

GPT-1900是独立研究者Michael Hla从零训练的一个33亿参数的历史语言模型,旨在模拟1900年的知识水平。它使用约220亿token的1900年前书籍和报纸进行预训练,并额外用约2.9亿token的历史物理语料增强研究能力。训练数据经过清洗,删除了包含“爱因斯坦”“量子力学”“相对论”等现代概念的文献。

GPT-1900在实验中成功重新发现了光量子吗?

没有。虽然GPT-1900在一次回答中冒出了与爱因斯坦光量子解释高度相似的表述,但它在大多数物理任务上都失败了。那些看似突破的回答可能只是模型在拼接合理词句,并非真正理解物理。而且实验依赖人类整理的问题和提示,以及现代AI辅助,因此不能算成功重新发现光量子。

为什么说GPT-1900的实验可能已经“漏题”?

因为实验过程中借助了现代AI(如Claude Sonnet 4、Claude 3 Haiku)生成指令问答和强化学习评分,尽管过滤了现代知识内容,但无法完全隔绝现代知识的影响。研究者自己也承认,现代模型的介入让实验的“零污染”人设站不住脚,很难证明GPT-1900没有偷看过光量子理论。

AI在科学推理上主要缺少哪种能力?

AI主要缺少“溯因”能力。科学推理分为归纳、演绎和溯因三个层次,当前大模型擅长归纳,演绎能力也在提高,但难以像爱因斯坦那样从异常现象中发明全新的解释框架,即缺少“溯因飞跃”。此外,AI还难以判断哪些理论真正正确或值得检验。

AI距离成为真正的科学家还差什么?

AI还差自主提出值得追问的问题、判断问题的价值,并主动验证和修正的能力。真正的科研不是在整理好的习题上作答,而是在混沌中自主做出判断。AI需要证明在没人替它划重点时,它能自己找到关键问题并评估其重要性,否则只能复述已有知识。

🏷️

标签

➡️

继续阅读