没有等来OpenAI开源GPT-4o,等来了开源版VITA

没有等来OpenAI开源GPT-4o,等来了开源版VITA

💡 原文中文,约5700字,阅读约需14分钟。
📝

内容提要

研究者们推出了VITA,这是首个开源多模态大语言模型,能够处理视频、图像、文本和音频。VITA展现了强大的多语言和多模态理解能力,提升了人机交互体验。该模型支持双模态部署,能够实时响应用户查询并跟踪环境输入,展现出显著的交互功能。尽管与闭源模型相比仍有差距,VITA为开源社区在多模态理解和交互方面的探索奠定了基础。

🔎

延伸解读

VITA的复式部署如何实现自然交互

VITA采用复式部署框架,同时运行生成模型和监控模型。生成模型负责回答用户查询,监控模型持续跟踪环境声音,能识别非查询声音并忽略,当检测到用户查询时中断生成模型,切换身份响应新查询。这种设计支持非唤醒交互和音频中断,使对话更自然,无需特定唤醒词,且用户可随时打断。

VITA的多模态能力与性能表现

VITA在图像理解上优于开源模型LLaVA-Next,接近闭源模型Gemini 1.5 Pro;在视频理解上超过Video-CCAM,但与LLaVA-Next-Video仍有差距。音频识别在Wenetspeech和Librispeech上表现不错。语言评估中,中文能力显著提升,英文保持原水平,数学推理也有进步。不过,开源模型与专有模型在视频理解上差距仍较大。

VITA的训练策略与数据构建

VITA以Mixtral 8x7B为语言基础,扩展中文词汇量至51,747,并用500万双语语料进行指令微调。多模态对齐阶段训练视觉和音频连接器,视觉编码器采用InternViT-300M-448px,音频编码器为4×CNN加24层Transformer。指令微调时,约一半问题被替换为音频版本,并设置不同系统prompt避免数据冲突。

❓

Q&A

VITA是什么类型的模型?

VITA是首个开源的多模态大语言模型,能够处理视频、图像、文本和音频。

VITA如何提升人机交互体验?

VITA展现了强大的多语言、视觉和音频理解能力,能够实时响应用户查询并跟踪环境输入。

VITA的训练过程包括哪些阶段?

VITA的训练过程包括LLM指令微调、多模态对齐和多模态指令微调三个阶段。

VITA在多模态基准测试中的表现如何?

VITA在图像理解和视频理解方面表现出色,尤其优于图像专用开源模型LLaVA-Next。

VITA与闭源模型相比有哪些差距?

尽管VITA在多模态理解方面表现良好,但与闭源模型相比仍存在一定差距。

VITA的双模态部署是如何实现的?

VITA采用复式方案,一个模型生成响应,另一个模型持续跟踪环境输入,实现双模态部署。

🏷️

标签

➡️

继续阅读