HuggingFace搭建新系统测试模型能力 通义千问排名第一 部分模型被发现作弊

💡 原文中文,约1200字,阅读约需3分钟。
📝

内容提要

人工智能模型托管平台HuggingFace发现部分模型在基准测试中存在作弊行为,推出新版本的Open LLM Leaderboard以获得真实有效的评估结果。阿里云通义千问Qwen-72B模型在测试中排名第一。模型参数规模并非越大越好,AI公司开始关注主要测试而忽略其他方面的表现。未来可能需要构建更独特的测试集来评估模型。

🔎

延伸解读

基准测试作弊:手法与影响

HuggingFace发现部分模型在基准测试中存在作弊行为,即针对测试集进行优化以获取更高分数。常见手法包括使用经过优化的提示词或评估设置,为模型提供最佳机会。这类似于Android厂商在跑分时冻结应用、释放内存甚至外部降温。作弊行为难以发现,但会误导模型能力的真实评估,影响行业公平竞争。

新评测系统:更真实的能力检验

HuggingFace使用300张NVIDIA H100加速卡构建新系统,并推出Open LLM Leaderboard v2,采用MMLU-Pro等难度更高的测试集。此前测试集过于简单,无法有效评估新模型。新系统通过统一问题、排序和可复现的设置,旨在获得真实有效的评估结果,解决评测难度过低的问题,更好地反映模型实际能力。

模型规模并非越大越好

新测试显示,模型参数规模并非越大越好,部分超大规模参数模型的能力并不突出。这表明单纯增加参数不一定带来性能提升,AI公司应更注重模型架构、训练数据质量及优化方法。同时,有迹象表明AI公司开始只关注主要测试而忽略其他方面表现,这种“唯跑分论”可能阻碍模型全面发展。

未来评估:构建独特测试集

针对基准测试的优化行为难以发现,未来行业可能需要花费更多时间构建更独特的测试集来评估模型。这要求测试集不断更新,增加多样性和不可预测性,以减少作弊空间。同时,评估应兼顾多方面能力,避免模型仅针对特定测试优化而忽视实际应用表现。

❓

Q&A

HuggingFace的新系统有什么特点?

HuggingFace的新系统使用300张NVIDIA H100加速卡,采用更高难度的测试集来评估模型,旨在获得真实有效的评估结果。

阿里云通义千问Qwen-72B模型的表现如何?

阿里云通义千问Qwen-72B模型在测试中排名第一,显示出其综合能力强于Meta Llama系列模型。

为什么部分模型在基准测试中被发现作弊?

部分模型通过优化提示词或评估设置来提高分数,这种作弊行为在新的评估系统中被揭露。

新的评测系统如何解决之前的问题?

新的评测系统通过提高测试集的难度,解决了之前评测难度太低的问题,更好地反映模型的真实能力。

AI公司在模型评估中面临什么挑战?

AI公司开始关注主要测试而忽略其他方面的表现,可能导致模型能力的全面评估不足。

未来模型评估可能需要哪些变化?

未来行业可能需要构建更独特的测试集,以有效评估模型并减少作弊行为的发生。

🏷️

标签

➡️

继续阅读