代理人工智能系统在生命科学研究中的能力日益增强,但其有效性依赖于处理复杂研究的能力。现有评估标准未能全面反映这些能力,因此LifeSciBench应运而生。该平台包含750个专家任务,涵盖七个工作流程和生物领域,旨在评估AI系统在实际生命科学研究中的支持能力,任务设计基于生命科学专家的判断,评估AI在处理证据、分析和实验设计等方面的表现。
完成下面两步后,将自动完成登录并继续当前操作。