实锤了,Llama 4重测排名掉至32名!远不及DeepSeek和Qwen

实锤了,Llama 4重测排名掉至32名!远不及DeepSeek和Qwen

💡 原文中文,约900字,阅读约需3分钟。
📝

内容提要

Meta最新发布的开源大模型Llama-4-Maverick在LMArena的排名从第2名跌至第32名,因开发者质疑其为“特供版”而刷榜。Chatbot Arena确认Meta提供的版本与开源版不同,导致口碑急剧下降。

🎯

关键要点

  • Meta发布的开源大模型Llama-4-Maverick在LMArena的排名从第2名跌至第32名。

  • 开发者质疑Meta提供的版本为'特供版',导致口碑急剧下降。

  • 4月6日,Meta发布了Llama 4大模型的三个版本:Scout、Maverick和Behemoth。

  • Llama-4-Maverick最初在Chatbot Arena的排名为第二,仅次于Gemini 2.5 Pro。

  • 开发者发现Meta提供的Llama 4版本与开源版本不同,质疑Meta刷榜作弊。

  • 4月8日,Chatbot Arena确认Meta提供的是'特供版',并考虑更新排行榜。

  • Meta首次提交的Llama-4-Maverick-03-26-Experimental是实验性聊天优化版本。

  • 修正后的模型为HuggingFace开源版同款Llama-4-Maverick-17B-128E-Instruct,目前排名为32名。

  • Llama-4-Maverick-17B-128E-Instruct的排名低于多个其他模型,包括Gemini 2.5 Pro和GPT4o。

🔎

延伸解读

Meta的信誉危机

Llama-4-Maverick的排名大幅下滑,反映出Meta在开发者社区中的信誉受到严重挑战。开发者质疑其提供的版本为特供版,可能导致用户对Meta未来产品的信任度降低。企业在发布新产品时,透明度和公正性至关重要。

开源与特供版的对比

Llama-4的开源版本与Meta提供的特供版存在显著差异,这一问题引发了广泛关注。开发者在选择模型时应关注版本的来源和实际表现,以避免因信息不对称而影响项目进展。

市场竞争加剧

Llama-4-Maverick的排名下滑使其在市场竞争中处于劣势,尤其是与Gemini 2.5 Pro和GPT4o等模型相比。开发者在选择AI模型时,需考虑其市场表现和社区反馈,以确保选择的工具能够满足需求。

延伸问答

Llama-4-Maverick的排名变化是什么?

Llama-4-Maverick的排名从第2名跌至第32名。

为什么开发者质疑Meta的Llama 4版本?

开发者质疑Meta提供的版本为'特供版',认为Meta刷榜作弊。

Meta发布了哪些版本的Llama 4大模型?

Meta发布了Scout、Maverick和Behemoth三个版本的Llama 4大模型。

Llama-4-Maverick的初始排名是多少?

Llama-4-Maverick的初始排名为第二,仅次于Gemini 2.5 Pro。

Chatbot Arena对Meta的质疑做了什么回应?

Chatbot Arena确认Meta提供的是'特供版',并考虑更新排行榜。

Llama-4-Maverick-17B-128E-Instruct的排名如何?

Llama-4-Maverick-17B-128E-Instruct的排名为32名,低于多个其他模型。

🏷️

标签

➡️

继续阅读