Infinity-MM: Enhancing Multimodal Performance with Large-Scale and High-Quality Instruction Data

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了Infinity-MM数据集,包含4000万个高质量多模态指令样本,解决了开放源代码数据规模和质量不足的问题。训练的Aquila-VL-2B模型在同类模型中表现优异,证明扩展指令数据能显著提升开放源模型性能。

🎯

关键要点

  • 本研究提出了Infinity-MM数据集,包含4000万个高质量多模态指令样本。

  • Infinity-MM数据集通过严格的质量滤波和去重进行了增强。

  • 训练的Aquila-VL-2B模型在同类模型中表现优异,达到了最新的性能。

  • 扩展指令数据和生成合成数据显著提升了开放源模型的表现。

🏷️

标签

➡️

继续阅读