我们准备好进行多图像推理了吗?推出VHs:视觉干草堆基准!

💡 原文英文,约1700词,阅读约需6分钟。
📝

内容提要

介绍了Visual Haystacks(VHs)Benchmark,用于评估大型多模态模型(LMMs)在处理大量图像数据时的能力。发现现有的LMMs在处理大量图像时存在困难,尤其是在存在视觉干扰的情况下。介绍了名为MIRAGE的新训练范式,通过压缩编码、使用检索器和增加多图像训练数据来改善MIQA任务的性能。提出了使用Visual Haystacks框架来评估模型性能的建议。

🔎

延伸解读

多图像推理的挑战与基准意义

Visual Haystacks基准的推出,填补了多图像问答评估的空白。传统VQA仅针对单图,而现实场景如医疗影像分析、卫星监测等需处理成百上千张图像。该基准通过单针和多针挑战,测试模型在大量无关图像中定位并推理相关图像的能力。实验表明,现有LMMs在视觉干扰下性能显著下降,凸显了多图像推理的难度。这一基准为未来模型开发提供了重要的评估工具。

现有LMMs的三大缺陷

VHs实验揭示了当前LMMs的三个主要问题:一是难以过滤视觉干扰,随着图像数量增加,单针任务准确率大幅下降;二是多图像推理能力不足,在多针任务中甚至不如简单的“描述+语言模型”组合;三是对图像位置敏感,存在“中间丢失”现象,针图像位置不理想时性能可下降高达41%。这些缺陷限制了LMMs在真实多图像场景中的应用。

MIRAGE:针对性的改进方案

MIRAGE通过三项创新应对上述挑战:查询感知压缩模型将视觉编码令牌减少10倍,以容纳更多图像;与LLM联合训练的检索器动态过滤无关图像;引入多图像训练数据增强推理能力。在VHs基准上,MIRAGE在单针任务中达到最先进水平,并能处理1K至10K图像,在多图像任务中显著优于GPT-4、Gemini-v1.5等模型,展示了视觉RAG框架的有效性。

对模型开发者的建议

文章建议未来的LMM项目采用Visual Haystacks框架进行基准测试,以识别并纠正模型在多图像推理中的潜在缺陷。同时,社区应积极探索多图像问答任务,推动人工智能向通用智能(AGI)迈进。这一基准不仅提供了评估标准,也为改进模型指明了方向,如增强视觉检索和跨图像信息整合能力。

❓

Q&A

什么是Visual Haystacks基准?

Visual Haystacks(VHs)基准用于评估大型多模态模型在处理大量图像数据时的能力,特别是在视觉检索和推理方面。

现有的多模态模型在处理多图像时面临哪些挑战?

现有的多模态模型在处理多图像时,尤其在视觉干扰存在的情况下,表现不佳,难以准确定位和分析相关图像。

MIRAGE训练范式是如何改善多图像推理性能的?

MIRAGE通过压缩编码、使用检索器和增加多图像训练数据来改善MIQA任务的性能,解决了相关图像检索和信息整合的核心挑战。

Visual Haystacks基准分为哪两种挑战?

Visual Haystacks基准分为单针挑战和多针挑战,分别测试模型在仅有一张目标图像和多张目标图像情况下的表现。

MIRAGE在单针任务上的表现如何?

MIRAGE在单针任务上表现出色,尽管其单图像问答基础较弱,但在处理多图像任务时显著优于其他竞争模型。

未来的多模态模型项目应如何使用Visual Haystacks框架?

未来的多模态模型项目应使用Visual Haystacks框架进行基准测试,以识别和纠正潜在缺陷,推动人工通用智能的发展。

🏷️

标签

➡️

继续阅读