MMDU:多轮多图像对话理解基准及用于 LVLM 的指令调优数据集

💡 原文中文,约1900字,阅读约需5分钟。
📝

内容提要

本文介绍了MMMU,一个新基准,用于评估多模态模型在大学级学科知识和跨学科任务上的表现。MMMU包含11500个多模态问题,涵盖六个核心学科,旨在挑战模型进行高级推理。评估结果显示,先进模型如GPT-4V的准确率仅为56%,表明仍有改进空间,MMMU旨在推动专家级人工智能的发展。

🔎

延伸解读

MMMU 的独特定位

与现有基准不同,MMMU 强调使用领域特定知识进行高级感知和推理,挑战模型执行类似专家面临的任务。它涵盖 30 种高度异质的图像类型,如图表、图示、地图、表格、乐谱和化学结构,要求模型不仅理解图像,还要结合大学级学科知识进行推理。这种设计旨在推动模型向专家级通用人工智能发展。

评估结果揭示的差距

对 14 个开源 LMM 和专有 GPT-4V 的评估显示,即使是先进的 GPT-4V 在 MMMU 上的准确率也仅为 56%,表明当前多模态模型在大学级学科知识和跨学科推理方面仍有很大改进空间。这一结果突显了 MMMU 所带来的巨大挑战,并为未来模型开发指明了方向。

对多模态 AI 发展的意义

MMMU 旨在推动社区构建面向专家人工通用智能的下一代多模态基础模型。通过提供涵盖六个核心学科、30 个学科和 183 个子领域的 11500 个多模态问题,MMMU 为评估和提升模型在复杂跨学科任务上的表现设立了新标准,有望促进多模态模型在专业领域的应用。

❓

Q&A

MMMU基准的主要目的是什么?

MMMU基准旨在评估多模态模型在大学级学科知识和跨学科任务上的表现。

MMMU包含多少个多模态问题?

MMMU包含11500个多模态问题。

MMMU涵盖哪些核心学科?

MMMU涵盖艺术与设计、商业、科学、健康与医药、人文社会科学和技术与工程学六个核心学科。

评估结果显示,先进模型的准确率是多少?

评估结果显示,先进模型如GPT-4V的准确率仅为56%。

MMMU如何推动人工智能的发展?

MMMU旨在推动专家级人工智能的发展,促进下一代多模态基础模型的构建。

MMMU与现有基准有何不同?

MMMU侧重于使用领域特定知识进行高级感知和推理,挑战模型执行类似于专家面临的任务。

🏷️

标签

➡️

继续阅读