[论文阅读] BLIP2

[论文阅读] BLIP2

💡 原文中文,约6300字,阅读约需15分钟。
📝

内容提要

BLIP-2是一种通用且高效的视觉与语言预训练策略,通过两阶段预训练的轻量Querying Transformer来弥合模态差距。BLIP-2在多个视觉语言任务上取得了SOTA结果,包括图像命名、视觉问答和图像文本检索。模型结构包括图像转换器和文本Transformer。

🏷️

标签

➡️

继续阅读