大规模视觉语言模型的 Matryoshka 查询转换器

📝

内容提要

运用 Matryoshka Query Transformer (MQT) 模型及变长的嵌入方式,实现图像编码成可调根数的视觉令牌,并通过组合 MQT 与 LLaVA 模型,在保持类似性能的同时,大幅减少了推理时所需的视觉令牌数量。

🏷️

标签

➡️

继续阅读