内容提要
南洋理工大学的研究人员开源了LMMs-Eval,一个专为多模态大型模型设计的评估框架。该框架提供了统一接口、一键式启动和透明可复现等特性。LMMs-Eval的目标是为多模态模型提供简化的评测任务,以节省时间和成本。此外,他们还推出了LMMs-Eval-Lite和LiveBench来兼顾广覆盖、低成本和零数据泄露。未来,他们计划进一步完善评估方法。
延伸解读
评测的“不可能三角”与应对策略
文章指出,多模态模型评测面临覆盖广、成本低、零数据泄露的“不可能三角”。LMMs-Eval团队发现同时满足三者极为困难,因此推出LMMs-Eval-Lite和LiveBench分别应对。Lite通过数据子集降低评测成本,LiveBench则利用动态数据避免污染。这种拆分策略反映了当前评测体系在理想与现实间的权衡,读者可关注其实际效果。
LMMs-Eval-Lite:如何用子集代表全集
LMMs-Eval-Lite旨在构建简化基准,以快速提供模型性能信号。其方法是将多模态评测数据集转换为向量嵌入,并使用k-greedy聚类找到数据显著点,从而筛选出与全集分数和排名相似的子集。这有助于在开发中节省评测成本,但子集能否始终代表全集仍需验证。读者可留意其在不同任务上的泛化能力。
LiveBench:动态数据与零污染
LiveBench通过动态更新数据集实现零污染和低成本。它从60多个新闻媒体和论坛自动收集最新信息,经模型生成和人工审查后,每月产出约500个问题,保留100-300个作为测试集。评分采用1-10分标准,默认使用GPT-4o。这种方法避免了静态基准的数据泄露,但依赖人工审查和模型生成,可能引入偏差。
开源协作与生态影响
LMMs-Eval自2024年3月发布以来,已获1.1K Stars和30+贡献者,包含80多个数据集和10多个模型。其统一接口、一键启动和透明可复现特性,降低了多模态评测门槛。这有助于推动模型训练者聚焦优化而非评测对齐,但框架的长期维护和社区治理仍是挑战。读者可关注其后续更新和榜单动态。
Q&A
LMMs-Eval框架的主要功能是什么?
LMMs-Eval框架提供统一接口、一键式启动和透明可复现等特性,旨在简化多模态模型的评测任务。
LMMs-Eval-Lite和LiveBench有什么区别?
LMMs-Eval-Lite旨在构建简化的基准测试集以降低评测成本,而LiveBench通过动态更新的数据集评估模型性能,确保零污染和低成本。
LMMs-Eval框架是由哪个机构开发的?
LMMs-Eval框架是由南洋理工大学的研究人员开发的。
LMMs-Eval框架如何确保评测的透明性和可复现性?
LMMs-Eval内置统一的logging工具,记录模型回答的每一题及其正确与否,确保评测的透明性和可复现性。
LMMs-Eval框架的目标是什么?
LMMs-Eval的目标是找到一种覆盖广、成本低、零数据泄露的方法来评估多模态模型。
LiveBench是如何收集评测数据的?
LiveBench通过从新闻媒体和论坛收集数据,构建自动化管道,确保信息的及时性和真实性。