DeepSeek-R1、o1都低于10%,人类给AI的「最后考试」来了,贡献者名单长达两页

DeepSeek-R1、o1都低于10%,人类给AI的「最后考试」来了,贡献者名单长达两页

💡 原文中文,约3000字,阅读约需8分钟。
📝

内容提要

AI大模型已超越人类水平,Center for AI Safety与Scale AI联合推出新基准HLE(人类的最后考试),包含3000个高难度问题,旨在评估模型能力。目前模型在HLE上的表现不佳,准确率低于10%。该基准强调多模态问题,需高水平专业知识,未来可能推动模型性能提升。

🎯

关键要点

  • AI大模型在多个任务上超越人类水平,进入与AI共生的时代。

  • 现有基准无法跟上AI发展的速度,MMLU基准的准确度已超过90%。

  • Center for AI Safety与Scale AI联合推出新基准HLE,旨在评估模型能力。

  • HLE包含3000个高难度问题,涉及数学、人文科学和自然科学等多个学科。

  • HLE问题主要为多项选择题和简单问答题,答案明确且易于验证。

  • HLE基准问题由全球近1000名专家贡献,确保问题质量和专业性。

  • HLE包含精确匹配问题和多项选择题,10%的问题需要理解文本和图像。

  • 为吸引高质量投稿,HLE设立50万美元奖金池,鼓励专家参与。

  • 当前SOTA模型在HLE上的表现不佳,准确率低于10%。

  • 模型的低准确度部分由于数据集设计,旨在过滤掉现有模型能回答的问题。

  • 模型的校准误差较大,常以高置信度提供错误答案,无法识别能力范围。

  • 未来模型需提升准确度和计算优化,以提高推理能力。

  • 预计到2025年底,模型在HLE上的准确度可能超过50%。

  • HLE测试结构化学术问题,不代表模型具备自主研究能力或通用人工智能。

🔎

延伸解读

HLE基准的设计意义

HLE基准的推出旨在填补现有评估工具的空白,特别是在AI快速发展的背景下。通过设定高难度的多模态问题,HLE不仅考察模型的知识广度,还强调其推理能力。这种设计有助于推动AI模型在复杂问题上的性能提升,促进更高水平的研究和应用。

模型表现的局限性

当前SOTA模型在HLE上的表现不佳,准确率低于10%。这反映出模型在处理高难度问题时的局限性,尤其是在推理和校准方面。模型常常以高置信度提供错误答案,显示出其无法有效识别能力范围。这一现象提醒研究者在使用AI时需谨慎,避免过度依赖模型的输出。

未来发展的展望

尽管目前模型在HLE上的表现不理想,但预计到2025年底,准确度有望超过50%。这一预期表明,随着技术的进步和数据集的优化,AI模型的推理能力将逐步提升。然而,HLE并不代表模型具备自主研究能力,未来的研究仍需关注模型在开放式问题和创造性解决方案上的表现。

延伸问答

HLE基准的主要目标是什么?

HLE基准旨在评估AI模型的能力,特别是在多模态问题上的表现。

HLE基准包含多少个问题,涉及哪些学科?

HLE基准包含3000个高难度问题,涉及数学、人文科学和自然科学等多个学科。

当前AI模型在HLE基准上的表现如何?

当前的SOTA模型在HLE上的准确率低于10%,表现不佳。

HLE基准如何确保问题的质量和专业性?

HLE基准的问题由近1000名专家贡献,确保了问题的质量和专业性。

HLE基准设立奖金池的目的是什么?

设立奖金池是为了吸引高质量的投稿,鼓励专家参与问题的贡献。

未来AI模型在HLE基准上的表现预期如何?

预计到2025年底,模型在HLE上的准确度可能超过50%。

🏷️

标签

➡️

继续阅读