Video-LaVIT:统一的视频 - 语言预训练与解耦的视觉 - 运动词汇编

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

研究人员通过LaVIT模型在多模态数据上取得了显著进展,该模型能够同时处理图像和文本,通过视觉分词器将非语言图像转换为离散标记,实现了统一的生成学习。实验结果显示,LaVIT在多个任务上的性能超过了现有模型。

🏷️

标签

➡️

继续阅读