AIR-Bench: 大规模音频语言模型的生成理解基准评估
原文中文,约500字,阅读约需2分钟。
📝
内容提要
最近的研究关注生成式多模态大型语言模型(MLLMs),通过引入SEED-Bench基准测试解决了MLLMs生成理解评估问题。SEED-Bench包含19K个准确的多项选择问题,涵盖了12个评估维度,包括图像和视频模态的理解。评估结果揭示了现有MLLMs的局限性,为未来的研究提供见解。
🏷️