大规模视觉语言模型的 Matryoshka 查询转换器
📝
内容提要
运用 Matryoshka Query Transformer (MQT) 模型及变长的嵌入方式,实现图像编码成可调根数的视觉令牌,并通过组合 MQT 与 LLaVA 模型,在保持类似性能的同时,大幅减少了推理时所需的视觉令牌数量。
🏷️
运用 Matryoshka Query Transformer (MQT) 模型及变长的嵌入方式,实现图像编码成可调根数的视觉令牌,并通过组合 MQT 与 LLaVA 模型,在保持类似性能的同时,大幅减少了推理时所需的视觉令牌数量。