覆盖11个学科/60项科研任务,清华/MIT/哈佛等提出ASI-Bench测试AI自主科研能力

覆盖11个学科/60项科研任务,清华/MIT/哈佛等提出ASI-Bench测试AI自主科研能力

💡 原文中文,约4100字,阅读约需10分钟。
📝

内容提要

ASI-Bench是由清华、MIT等机构构建的自主科研能力基准,包含60项覆盖11学科的项目级任务,通过B1至B4四级逐步减少人类方法指导来测试AI科研自主性。评测18套系统显示,B1平均分50.91,B3降至26.62,表明AI在方法落地和流程执行上仍有明显短板,距离独立完成开放式科研尚存差距。

🔎

延伸解读

评测设计:逐级撤指导,定位能力短板

ASI-Bench 的核心创新在于对同一任务设置 B1 至 B4 四级信息梯度,逐步撤去方法指导。通过对比相邻等级得分差,可定位 AI 的短板:B1 到 B2 平均下降 21.82 分,而 B2 到 B3 仅下降 2.48 分,说明当前系统的主要困难并非方法选择,而是将方法转化为具体流程(如参数设置、代码实现)的能力。这种设计为科研能力评估提供了更细致的诊断维度。

智能体框架影响显著,模型非唯一决定因素

实验显示,同一底座模型搭配不同智能体框架,结果差异明显。例如,MiMo V2.5 Pro 搭配 Claude Code 比搭配 MiMo Code 综合得分提升超 40%。这表明任务规划、工具调用、错误修复等智能体机制对科研任务完成质量有直接影响。未来提升自主科研能力,除了强化模型本身,还需优化智能体框架的流程调度与反馈利用能力。

成本与性能非线性,实际应用需权衡

评测发现,成本与性能并非简单线性关系。Codex + GPT-5.6 Sol(xhigh)单轮成本约为 Claude Opus 5 的四分之一,但 B3 得分接近;而最优配置 GPT-5.6 Sol(ultra)单轮成本约 1550 美元。这表明在科研应用中,需根据预算和任务需求平衡推理投入与性能,高成本不一定带来等比例收益,效率考量对实际部署至关重要。

Q&A

ASI-Bench是什么?它由哪些机构提出?

ASI-Bench是一个用于测试AI自主科研能力的基准,由清华大学、麻省理工学院、哈佛大学、卡内基梅隆大学、微软研究院等十余家机构的40余位专家共同构建。

ASI-Bench包含多少项任务?覆盖哪些学科?

ASI-Bench包含60项科研任务,覆盖数学、物理学、化学、生物学、天文学、材料科学、地球科学、医学生物统计学、计算机科学、机器人学和电气工程共11个学科。

ASI-Bench的B1到B4四个等级分别代表什么?

B1提供完整方法指导,B2仅提供方法类别,B3只提供研究目标与数据,B4在B3基础上加入无关和干扰信息。等级越高,人类提供的方法指导越少,测试的自主性越强。

ASI-Bench评测了哪些系统?主要结果如何?

评测了18套由智能体框架和底座大模型组成的系统,包括Codex、Claude Code、Kimi Code等框架和GPT-5.5、Claude Opus、GLM等模型。结果显示,B1平均分50.91,B2降至29.10,B3进一步降至26.62,表明AI在方法落地和流程执行上仍有明显短板。

根据ASI-Bench,当前AI在自主科研中的主要困难是什么?

主要困难在于将方法思路转化为具体流程,包括参数选择、代码实现、实验运行和结果验证,而非判断使用什么方法。因为从B1到B2得分下降21.82分,而从B2到B3仅下降2.48分。

ASI-Bench的实验结果对智能体框架和模型的选择有何启示?

实验发现,自主科研能力不完全由底座模型决定,智能体框架也会显著影响结果。例如,MiMo V2.5 Pro搭配Claude Code比搭配MiMo Code综合得分提升超过40%。因此,选择模型时需考虑框架的适配性。

ASI-Bench中成本与性能的关系如何?

成本与性能之间不存在简单线性关系。例如,Codex + GPT-5.6 Sol(xhigh)的单轮运行成本约为Claude Opus 5的四分之一,但两者B3得分接近;表现最优的GPT-5.6 Sol(ultra)单轮成本约1550美元。因此,实际应用中需权衡计算效率。

🏷️

标签

➡️

继续阅读