全球大厂押注AI科研,但缺乏统一评价标准。8月19日,深度原理联合微软、斯坦福等发布论文,提出“发现回合”评估体系,全程记录AI科研决策,综合评分,并重视失败数据价值。深度原理的MIRA平台已实现科研闭环,在基准测试中领先。该标准标志AI科研从“应试”转向“真实发现”,行业下半场比拼“谁能真做出东西”。
ASI-Bench是由清华、MIT等机构构建的自主科研能力基准,包含60项覆盖11学科的项目级任务,通过B1至B4四级逐步减少人类方法指导来测试AI科研自主性。评测18套系统显示,B1平均分50.91,B3降至26.62,表明AI在方法落地和流程执行上仍有明显短板,距离独立完成开放式科研尚存差距。
深势科技发布玻尔·科学空间,为科研人员与AI科学家协同工作提供桌面环境。它整合文献、计算工具和实验资源,内置BioMaster、PharmMaster等专家,自动完成调研、假设验证、数据分析和论文写作。研究者只需提问和确认,AI接管繁琐工作,提升科研效率,并推出“玻尔107计划”征集重要科学问题。
Prime Intellect的研究表明,开源模型结合Multi-Agent Harness在nanoGPT优化任务中表现接近顶级闭源模型,挑战了RSI的假设。实验发现模型间的差距不在于创意,而在于试错吞吐量。更便宜的开源模型负责监控实现,高效的试错机器能提升AI科研速度,加速AI研发迭代。
谷歌前工程师创办Discovery Loop,旨在用AI自动化科研实验循环,将周期从年压缩至秒,覆盖材料、生物等领域。此举可能颠覆科研权力结构,使AI设计能力成为核心,但也面临高成本和现实数据鸿沟。文章认为这暴露了传统科研效率低下,科学正被资本和代码重塑。
北京大学与元空AI联合实验室开源科研智能体OpenAI4S,采用MIT协议,核心零依赖。它复刻Claude Science,通过“代码即行动”执行科研任务,支持数据检索、代码运行、GPU算力接入及版本化产物,内置30多个科研Skills,并设不伪造策略确保真实性。项目旨在推动科研Agent成为可执行、可检查、可扩展的基础设施,欢迎社区贡献。
科研有两层含义:一是探索未知的科学规律,但当前AI热潮多流于形式,充满泡沫;二是作为职业,需靠发表论文和申请项目维持,文章是硬通货。作者认为科研应结合兴趣与工作,但若成果不发表,则可能因懒惰或逃避而沦为“穷光蛋”,并自嘲自己也是科研“穷光蛋”。
第四届世界科学智能大赛在上海举办,吸引32国近1.8万名选手,设AI4S智能体、电力市场、核聚变等五赛道。大赛首创科研智能体挑战赛,并联合发起OPC创业孵化营,提供最高200万元资金支持,推动科研成果产业化,助力青年创新创业。
智爱赛思社区升级,推出科研专属Token Plan,提供三档服务适配不同科研场景,优势在于专业模型、一体化流程和充沛算力,旨在构建自主安全的科研AI基础设施,助力上海科创中心建设。
BrainPilot是11家机构联合提出的多Agent脑科学研究系统,由PI-Agent协调七个专家智能体,并引入Auditor Agent和Graph of Trace机制,实现全程可追溯与事实准确性审计。实验显示其性能与先进框架相当且成本更低,代码、知识库和技能库均已开源,为科研自动化提供了安全可靠的范式。
北电数智在WAIC 2026展区展示了AI在民生服务中的应用,包括通过“家医助手”提升社区医疗效率、教育数字大脑优化教学、AI创作者社区降低创作门槛,以及AI科研实验室加速科研进程。北电数智致力于将技术与人需求结合,推动民生发展。
GeneBench-Pro是一个新基准,用于评估智能体在多阶段统计推理中的能力,涵盖基因组学和药物基因组学等领域。该基准包含129个经过专家审查的问题,旨在模拟真实的科学分析过程。尽管现有模型在某些任务上有所提升,但整体通过率仍较低,尚未实现完整的推理闭环,未来需要增强模型的规划和自我修正能力。
到2026年,人工智能与科学研究的结合将从辅助工具转变为主动发现者,AI4S市场规模预计将达到千亿美元。尽管面临算力架构、数据孤岛和科研流程不成熟等挑战,AI4S正在推动科学发现的新模式。WAIC 2026将讨论AI如何重塑科学研究和产业发展,重点关注人才培养和平台建设,推动AI在能源、材料和生命科学等领域的应用。
Claude Science是一款AI科研工具,能够直接连接数据库,自动生成分析结果并提供可追溯功能,解决科研中的健忘症问题。它内置实时纠错功能,确保数据准确性,兼容现有软件并支持本地数据处理,保障数据安全。针对生命科学领域,提供专用工具和预设配置,简化分析流程。尽管需要付费,但能显著提高科研效率,降低错误率。
Codex近期受到好评,用户可通过邀请朋友重置速率限制。OpenAI考虑降低Codex费用以吸引客户。Codex即将并入ChatGPT,提供多种使用案例,帮助用户了解其功能。新功能Computer Use允许Codex操作电脑,用户可设定长期目标。Codex还可用于制作PPT、网页和游戏,甚至在科研中作为助手,进行实验和数据分析。
Codex Skills 是一种工具,旨在提高用户的工作效率。它将常用的工作习惯转化为技能,方便用户进行科研、写作和代码开发等任务。文章介绍了科研、知识管理、调研和写作等不同类别的技能,强调了AI的辅助作用,但最终的思考和判断仍需用户自己完成。
西湖大学的张岳团队推出了智能科研插图生成系统AutoFigure,旨在解决高质量科研插图的生成难题。该系统基于长篇科学文本,确保插图的逻辑结构准确且视觉美观。此外,团队发布了FigureBench数据集,包含3300组科学文本与插图配对样本,支持科研插图的自动生成。
近期,中国学术界因B站博主耿同学举报多名顶尖学者论文造假而引发风暴,揭示了科研评价体系的问题。事件强调了“Worse is Better”现象,即不严谨但易产出的研究更受欢迎。系统奖励论文数量和影响因子,导致低质量研究泛滥。耿同学的举报促使高校开始倒查论文,反映出科研诚信体系的缺失。真正的挑战在于如何让诚实、严谨的研究重新获得价值。
科研AI写作的核心在于将形式交给AI处理,而问题则需研究者自己把控。AI擅长规范性工作,如格式和引用,但核心思想和判断仍需人类负责。AI可以高效生成初稿,但最终的修改和深度思考是研究者的责任。同时,学术诚信不可忽视,使用AI时需确保内容准确,避免依赖错误信息。
随着生物检测和计算建模技术的发展,科研数据生产能力迅速提升,但知识整合能力滞后。为此,研究团队开发了Robin多智能体系统,实现了科学假设生成与实验数据分析的闭环工作流。该系统在药物筛选中表现出色,验证了其在干性年龄相关性黄斑变性治疗中的应用潜力,展示了AI在生命科学研究中的新方向。
完成下面两步后,将自动完成登录并继续当前操作。