该文综述视觉定位与多模态大模型进展,提出融合语义名词与无类别分割的实体级方法,在叙事定位、指称分割和全景分割上优于现有方案;并介绍GLaMM、LLM-Grounder、BuboGPT、TGDoc、LLM4VG、LEGO、SDG、GroundVLP等模型,覆盖图像、视频、3D与文档场景,显示零样本与多模态定位能力持续提升。
完成下面两步后,将自动完成登录并继续当前操作。