本文介绍了CoVLM框架,通过通信令牌提升视觉语言模型(LVLMs)在组合推理任务中的性能,并在传统视觉-语言任务中取得先进表现。同时,研究提出了艺术品解释生成任务,评估LVLMs在艺术品知识理解方面的能力,发现其在整合语言与视觉信息上存在困难。此外,VaLM框架通过视觉增强语言建模,展示了在常识推理任务中的优越性能。
完成下面两步后,将自动完成登录并继续当前操作。