ASI-Bench是由清华、MIT等机构构建的自主科研能力基准,包含60项覆盖11学科的项目级任务,通过B1至B4四级逐步减少人类方法指导来测试AI科研自主性。评测18套系统显示,B1平均分50.91,B3降至26.62,表明AI在方法落地和流程执行上仍有明显短板,距离独立完成开放式科研尚存差距。
刘壮教授在访谈中指出,AI领域的最大瓶颈是记忆,而非能力。他认为架构选择不如数据规模和计算能力重要,现有数据集的多样性低于预期。大语言模型在语言空间有世界模型,但在视觉空间尚未实现。尽管AI在低层次任务上表现良好,但在自主科研和复杂问题上仍需人类参与。
Sam Altman与弟弟Jack Altman讨论了未来5到10年AI的发展,包括AI自主科研、人形机器人和超级智能。他认为AI将能发现新科学,人形机器人将实现自由行动,AI伴侣将融入日常生活。Altman尊重Meta的竞争,但认为OpenAI更具创新潜力。
完成下面两步后,将自动完成登录并继续当前操作。