内容提要
全球大厂押注AI科研,但缺乏统一评价标准。8月19日,深度原理联合微软、斯坦福等发布论文,提出“发现回合”评估体系,全程记录AI科研决策,综合评分,并重视失败数据价值。深度原理的MIRA平台已实现科研闭环,在基准测试中领先。该标准标志AI科研从“应试”转向“真实发现”,行业下半场比拼“谁能真做出东西”。
延伸解读
从“应试”到“实战”:评价逻辑的转变
传统评测如HLE只关注最终答案,忽略推理过程,导致高分AI在实际实验中可能无法处理异常数据或提出不可执行的方案。新提出的“发现回合”体系全程记录决策轨迹,综合评分,强调真实科研能力。这一转变意味着AI科研的评价标准从“知识记忆”转向“科学发现过程”,更贴近实际科研需求。
失败数据的价值被重新定义
新评估体系将失败实验数据视为训练和评估AI的核心资产,而非无用信息。这符合人类科研中从失败中学习的逻辑,鼓励AI在探索中积累经验,避免重复错误。对AI科研而言,失败数据的利用有助于提升模型的鲁棒性和实际科研能力,也为数据共享和积累提供了新方向。
产业实践与标准制定的双向互动
深度原理作为唯一中国产业代表,其MIRA平台已实现干湿闭环,并在多个基准测试中取得第一。该平台不仅验证了评测框架的可行性,也为标准迭代提供了真实数据。这种产业与学术的协作模式,有助于确保评价体系既具学术权威性,又能落地应用,推动AI科研从理论走向实际生产力。
Q&A
AI科研领域为什么需要新的评价标准?
因为传统的HLE等闭卷知识考试只看最终答案,不评估科研过程,导致高分AI在实际实验中可能无法处理异常数据或给出不可执行的实验方案。新的评价标准旨在全面评估AI在真实科研中的表现。
《Measuring AI Scientists: From Exams to Discovery》这篇论文提出了什么核心评估体系?
论文提出了“发现回合”(discovery episode)评估体系,全程记录AI在科研周期中的每一步决策,并对整条轨迹的科学性、严谨性和有效性进行综合评分。
发现回合评估体系具体如何考核AI的科研能力?
它围绕科研闭环的三个阶段(科研假说、方案执行、实验结果解读)分别建立评判维度,并进行全流程闭环测试,衡量AI产出真实科研发现的综合能力。同时,它重视失败数据的价值,并要求实验结果真实独立。
深度原理的MIRA平台在AI科研方面有什么特点?
MIRA平台搭建了覆盖“假设生成→模拟计算→实验验证→知识沉淀”的完整闭环系统,采用三层架构模拟真实科研团队协作,与普通科研AI的“答题工具”定位不同。
MIRA平台在基准测试中表现如何?
在化学、能源、材料综合评测Research Claw Benchmark和药物发现评测Science Agent Arena中,MIRA均位列第一,且完成单项任务的平均成本处于行业最优水平,在性能和成本两个维度形成优势。
深度原理如何将MIRA平台与评测体系结合?
深度原理依托MIRA与自建高通量实验平台的干湿闭环,在锂电、工业冷却液、新能源材料等赛道布局多条自研管线,由AI主导全周期科研,真实沉淀闭环数据,使平台与评测框架形成持续的互相验证与迭代。
这篇论文的发布对AI科研行业有什么意义?
它标志着AI科研评价从“应试”转向“真实发现”,为行业划出了清晰的评判标尺,推动行业下半场比拼“谁能真的做出东西”,加速AI成为可信科研生产力。