100+大模型综测结果出炉!智源发布FlagEval“百模”评测结果,覆盖文本语音图片视频多种模态
原文中文,约3700字,阅读约需9分钟。
📝
内容提要
智源研究院发布了100余个大模型的综合评测结果,涵盖文本、语音、图像和视频等多模态。评测显示,国内模型在中文能力和复杂场景任务上与国际水平仍有差距。新评测增加了金融量化交易等应用能力的评估,发现大模型在生成策略代码方面已有进展。整体来看,模型能力显著提升,但仍需改进。
🔎
延伸解读
国内模型与国际水平的差距
评测结果显示,尽管国内大模型在中文能力上有所提升,但在复杂场景任务的表现上仍与国际一流水平存在显著差距。这提示我们在推动国内模型发展的同时,需关注国际前沿技术,以缩小差距。
金融量化交易的应用潜力
此次评测首次增加了金融量化交易场景的能力评估,发现大模型已具备生成有回撤收益的策略代码的能力。这表明大模型在金融领域的应用潜力正在被逐步挖掘,未来可能会对金融行业带来变革。
多模态模型的表现差异
多模态模型在图文理解任务上的表现不一,部分开源模型已缩小与头部闭源模型的差距,但仍需提升在复杂图文数据分析能力上的表现。这提醒开发者在选择模型时需考虑具体应用场景的需求。
K12学科测验的能力差异
在K12学科测验中,尽管模型的综合得分有所提升,但仍与海淀学生的平均水平存在差距,尤其在文科方面表现较好,而理科则相对较弱。这反映出大模型在教育领域应用时需针对不同学科进行优化。
❓
Q&A
智源研究院发布的评测结果涵盖哪些模态?
评测结果涵盖文本、语音、图像和视频等多种模态。
国内大模型在中文能力上与国际水平的差距如何?
评测显示,国内模型在中文能力和复杂场景任务上与国际水平仍有显著差距。
此次评测中,哪个模型在语言能力评测中表现最好?
字节跳动的Doubao-pro-32k-preview和百度的ERNIE 4.0 Turbo位居前两名。
评测中新增了哪些应用能力的评估?
新评测增加了金融量化交易等应用能力的评估,测量大模型的收益优化和性能优化能力。
文生视频模型在评测中存在哪些问题?
文生视频模型普遍存在物体消失、闪现和无法理解物理规律等问题。
FlagEval大模型角斗场的主要功能是什么?
FlagEval大模型角斗场是面向用户开放的模型对战评测服务,支持多种任务的评测。
🏷️