Cambrian-1:全面开放、以视觉为中心的多模态 LLMs 研究

💡 原文中文,约1500字,阅读约需4分钟。
📝

内容提要

本文讨论了大型多模态模型(LMM)的最新研究进展,提出了新架构Lumen,显著提升了感知能力。同时,研究推出了MMStar基准,以评估多模态能力并解决数据泄漏问题。通过结合视觉和语言任务,开发了VisionLLM v2,增强了模型的可解释性和性能,展示了多模态学习的潜力。

🔎

延伸解读

Lumen 架构:感知能力的阶段化分解

Lumen 将多模态感知学习分解为任务无关和任务特定两个阶段,这种设计让模型能先掌握通用视觉表示,再适配具体任务。在 COCO 检测基准上,它显著超越了现有基于 LMM 的方法,并展现出对其他视觉任务的无缝可扩展性。这提示我们,分阶段训练可能是提升 LMM 感知能力的有效路径,同时兼顾通用性与专用性。

MMStar 基准:解决数据泄漏与视觉必要性

MMStar 是一个人工精选的多模态基准,包含 6 个核心能力和 18 个详细方向,专门评估视觉不可或缺的样本。它针对两个问题:许多样本视觉内容不必要,以及 LLM 和 LVLM 训练中存在数据泄漏。通过评估 16 个主流 LVLM,MMStar 能更真实地衡量多模态能力,避免模型仅靠语言先验或记忆答题。

预训练数据组合:图像-标题、交错与纯文本

研究通过全面分析表明,大规模多模态预训练需要结合图像-标题、交错图像-文本和纯文本数据,才能在多基准上达到最新成果。基于此构建的 MM1 系列(稠密模型和专家混合模型)在预训练指标上取得最优,并在多个多模态基准上表现有竞争力。这强调了数据多样性和规模对多模态模型性能的关键作用。

可解释性与幻觉识别:图像嵌入组件的作用

一项研究通过聚焦图像嵌入组件来增强多模态大语言模型的可解释性。它将开放世界定位模型与多模态大语言模型结合,形成能同时输出文本和物体定位的新架构。该架构便于设计新的显著性图来解释任意输出标记,识别模型幻觉,并通过语义对抗扰动评估模型偏见。这为理解和调试多模态模型提供了实用工具。

Q&A

Lumen架构的主要特点是什么?

Lumen架构将多模态模型的感知能力学习分解为任务无关和任务特定阶段,显著提升了感知能力。

MMStar基准的目的是什么?

MMStar基准旨在评估多模态能力并解决数据泄漏问题,包含6个核心能力和18个详细方向。

VisionLLM v2如何增强模型的可解释性?

VisionLLM v2通过结合图像嵌入组件和任务解码器,提升了模型的可解释性和性能。

多模态预训练中使用哪些数据类型至关重要?

使用图像-标题、交错图像-文本和仅文本数据进行大规模多模态预训练至关重要。

如何提高多模态大型语言模型的准确性?

通过两阶段的浏览和集中方法,集成多模态上下文信息,可以显著提高对多图像输入的理解和准确性。

本文提出的新的显著性图有什么作用?

新的显著性图用于解释输出标记,识别模型幻觉,并评估模型的偏见。

🏷️

标签

➡️

继续阅读