基于综合切分对大型语言模型进行落地:地鼠模型

💡 原文中文,约2300字,阅读约需6分钟。
📝

内容提要

该文综述视觉定位与多模态大模型进展,提出融合语义名词与无类别分割的实体级方法,在叙事定位、指称分割和全景分割上优于现有方案;并介绍GLaMM、LLM-Grounder、BuboGPT、TGDoc、LLM4VG、LEGO、SDG、GroundVLP等模型,覆盖图像、视频、3D与文档场景,显示零样本与多模态定位能力持续提升。

🔎

延伸解读

实体级视觉定位的技术路线

文章提出融合语义名词与无类别分割的实体级方法,利用大型多模态模型提取语义名词,再通过无类别分割模型生成实体级分割,并采用多模态特征融合模块关联两者。该方法使用颜色映射编码分割蒙版以保留高分辨率特征,同时利用LMM中的CLIP视觉编码器从低分辨率图像提取特征,相比额外编码器处理高分辨率图像更高效。

多模态定位模型的演进与覆盖

文章综述了GLaMM、LLM-Grounder、BuboGPT、TGDoc、LLM4VG、LEGO、SDG、GroundVLP等模型,覆盖图像、视频、3D与文档场景。这些模型展示了零样本与多模态定位能力的持续提升,例如LLM-Grounder实现零样本3D视觉定位,GLaMM支持自然语言回复与分割遮罩混合,TGDoc增强文档文本定位。

视频定位的现状与挑战

文章通过LLM4VG基准测试系统评估了视频LLM在视频对齐任务上的表现,发现现有VidLLM离满意性能还有差距,需进一步微调以包含更多时间相关任务。而LLM与视觉模型的组合显示出初步的视频对齐能力,通过更可靠模型和提示指导有改进潜力。

零样本定位的进展与数据挑战

文章提到GroundVLP结合GradCAM热力图和开放词汇检测器,在RefCOCO/+/g数据集上超过现有零样本方法28%,并在Flickr30k实体数据集上媲美有监督模型。这反映了零样本方法在缓解数据标注不足方面的潜力,同时SDG框架通过自主驱动技能学习将LLM接地,在BabyAI任务中达到与模仿学习相媲美的性能。

❓

Q&A

地鼠模型提出的实体级视觉定位方法是如何工作的?

该方法利用大型多模态模型提取语义名词,利用无类别分割模型生成实体级分割,再通过多模态特征融合模块将每个语义名词与其对应的分割蒙版关联。它使用颜色映射编码实体分割蒙版以保留高分辨率特征,并利用LMM中的CLIP视觉编码器从低分辨率图像提取视觉特征,从而在计算上更高效。

地鼠模型在哪些视觉定位任务上表现优于现有方案?

地鼠模型在全景叙事连接、指称表达分割和全景分割三个任务上均优于现有方法。

GLaMM模型有什么独特能力?

GLaMM是首个能够无缝生成自然语言回复并与相应对象分割遮罩混合的模型,支持图像和文本领域不同粒度的交互,还能有效实现指代表达分割、图像和区域级别的字幕以及视觉语言对话。

LLM-Grounder如何实现零样本3D视觉定位?

LLM-Grounder将复杂自然语言查询拆解为语义元素,利用可视化定位工具识别3D场景中的对象,并评估所提议对象之间的空间和常识关系以做出最终定位决策。它不需要有标签的训练数据,可应用于新型3D场景和任意文本查询,在复杂语言查询上表现出最先进的零样本定位准确性。

LLM4VG基准测试的主要发现是什么?

LLM4VG基准测试系统评估了不同LLM在视频对齐任务上的性能,发现:现有的视频LLM离实现令人满意的视频对齐性能还有很长的路要走,需要进一步微调以包含更多时间相关的视频任务;而LLM与视觉模型的组合显示出初步的视频对齐能力,通过采用更可靠的模型和进一步的提示指导,这种能力具有可观的改进潜力。

GroundVLP方法如何解决视觉定位中的数据标注不足问题?

GroundVLP是一种简单有效的零样本方法,它结合了GradCAM热力图和开放词汇检测器的对象提案,利用现有的图像-文本配对模型和纯物体检测数据来捕捉视觉环境。实验结果显示,该方法在RefCOCO/+/g数据集上超过了现有零样本方法的28%,并且在Flickr30k实体数据集上与一些非VLP的有监督模型表现相当甚至更好。

🏷️

标签

➡️

继续阅读