HuggingFace搭建新系统测试模型能力 通义千问排名第一 部分模型被发现作弊
内容提要
人工智能模型托管平台HuggingFace发现部分模型在基准测试中存在作弊行为,推出新版本的Open LLM Leaderboard以获得真实有效的评估结果。阿里云通义千问Qwen-72B模型在测试中排名第一。模型参数规模并非越大越好,AI公司开始关注主要测试而忽略其他方面的表现。未来可能需要构建更独特的测试集来评估模型。
延伸解读
基准测试作弊:手法与影响
HuggingFace发现部分模型在基准测试中存在作弊行为,即针对测试集进行优化以获取更高分数。常见手法包括使用经过优化的提示词或评估设置,为模型提供最佳机会。这类似于Android厂商在跑分时冻结应用、释放内存甚至外部降温。作弊行为难以发现,但会误导模型能力的真实评估,影响行业公平竞争。
新评测系统:更真实的能力检验
HuggingFace使用300张NVIDIA H100加速卡构建新系统,并推出Open LLM Leaderboard v2,采用MMLU-Pro等难度更高的测试集。此前测试集过于简单,无法有效评估新模型。新系统通过统一问题、排序和可复现的设置,旨在获得真实有效的评估结果,解决评测难度过低的问题,更好地反映模型实际能力。
模型规模并非越大越好
新测试显示,模型参数规模并非越大越好,部分超大规模参数模型的能力并不突出。这表明单纯增加参数不一定带来性能提升,AI公司应更注重模型架构、训练数据质量及优化方法。同时,有迹象表明AI公司开始只关注主要测试而忽略其他方面表现,这种“唯跑分论”可能阻碍模型全面发展。
未来评估:构建独特测试集
针对基准测试的优化行为难以发现,未来行业可能需要花费更多时间构建更独特的测试集来评估模型。这要求测试集不断更新,增加多样性和不可预测性,以减少作弊空间。同时,评估应兼顾多方面能力,避免模型仅针对特定测试优化而忽视实际应用表现。
Q&A
HuggingFace的新系统有什么特点?
HuggingFace的新系统使用300张NVIDIA H100加速卡,采用更高难度的测试集来评估模型,旨在获得真实有效的评估结果。
阿里云通义千问Qwen-72B模型的表现如何?
阿里云通义千问Qwen-72B模型在测试中排名第一,显示出其综合能力强于Meta Llama系列模型。
为什么部分模型在基准测试中被发现作弊?
部分模型通过优化提示词或评估设置来提高分数,这种作弊行为在新的评估系统中被揭露。
新的评测系统如何解决之前的问题?
新的评测系统通过提高测试集的难度,解决了之前评测难度太低的问题,更好地反映模型的真实能力。
AI公司在模型评估中面临什么挑战?
AI公司开始关注主要测试而忽略其他方面的表现,可能导致模型能力的全面评估不足。
未来模型评估可能需要哪些变化?
未来行业可能需要构建更独特的测试集,以有效评估模型并减少作弊行为的发生。