ViLaM: 具有增强的视觉定位和泛化能力的视觉语言模型

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

研究人员将大型语言模型的推理能力应用于多模态数据,通过统一的表示,LaVIT可以同时处理图像和文本,并在下游任务上表现出优异性能。

🏷️

标签

➡️

继续阅读