Infinity-MM: Enhancing Multimodal Performance with Large-Scale and High-Quality Instruction Data
原文英文,约100词,阅读约需1分钟。
📝
内容提要
本研究提出了Infinity-MM数据集,包含4000万个高质量多模态指令样本,解决了开放源代码数据规模和质量不足的问题。训练的Aquila-VL-2B模型在同类模型中表现优异,证明扩展指令数据能显著提升开放源模型性能。
🎯
关键要点
-
本研究提出了Infinity-MM数据集,包含4000万个高质量多模态指令样本。
-
Infinity-MM数据集通过严格的质量滤波和去重进行了增强。
-
训练的Aquila-VL-2B模型在同类模型中表现优异,达到了最新的性能。
-
扩展指令数据和生成合成数据显著提升了开放源模型的表现。
🏷️