从 CLIP 到 DINO:多模式大型语言模型中的视觉编码器喊出来

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

研究发现,CLIP和DINO在MLLMs中具有优异的性能,提出了一种特征融合策略COMM以增强视觉能力,实验证明其具有卓越性能。

🏷️

标签

➡️

继续阅读