内容提要
AI评测机构Artificial Analysis在GPT-6 Astra发布后四天内三次修改评测标准,使其排名从第三升至第一,引发争议。文章批评其使用过时测试、让Gemini当裁判、权重分配不透明等问题,并指出评测体系存在数据污染和猫鼠游戏。尽管Astra编程能力突出,但评测公信力受质疑,创新不应被旧标准束缚。
延伸解读
评测标准频繁变动背后的信号
AA在四天内三次调整评测标准,从移除饱和基准到提高私有测试权重,导致GPT-6 Astra排名从第三升至第一。这种快速变动可能反映评测机构在应对模型能力快速迭代时的被动,但也削弱了榜单的稳定性。读者在参考此类排名时,应关注评测方法论是否透明,以及变动是否合理,而非仅看最终名次。
私有测试数据的双刃剑效应
AA为防数据污染,将私有测试权重从20%提至45%。私有测试虽能减少刷分,但缺乏外部审计,可能引发公信力质疑。文章指出,私有评估减少污染却降低监督,公共评估反之。这种权衡是评测行业的普遍难题,读者需理解,任何榜单都难以完全避免操纵风险,应结合多方信息判断模型真实能力。
编程能力与综合排名的差异
尽管GPT-6 Astra在编程智能体指数中表现突出,与Claude Opus 5等持平,且token效率更高,但在写作等知识工作领域被评价为“平庸”。这提醒读者,综合排名可能掩盖模型在不同任务上的能力差异。选择模型时,应根据具体使用场景(如编程或写作)参考专项评测,而非仅依赖综合分数。
评测机构权威性的来源与局限
AA作为私人公司,其权威性来自行业认可,而非官方授权。它通过免费榜单建立影响力,再向AI公司出售数据服务盈利。文章指出,其“独立”性无人审计,投资人关系未披露,私有测试数据不公开。这提示读者,评测机构的公信力建立在透明度和利益隔离上,若缺乏这些,其排名可能受商业利益影响。
Q&A
GPT-6 Astra在AA评测中排名为何在四天内从第三升至第一?
因为Artificial Analysis在四天内三次修改评测标准,包括新增基准、移除饱和测试、调整权重等,导致Astra的排名从第三升至并列第一再到独享第一。
AA评测使用旧版测试题有什么问题?
AA在v4.3更新前使用Terminal-Bench v2.1,而当时最新版本已是v4.0,v4.0增加了难度并修复了19个问题任务。用旧版测试新模型就像用2020年高考题评价2026年考生,结论不可靠。
为什么说让Gemini 3.1当裁判不公平?
因为GDPval-AA v2测试让Gemini 3.1来评判模型输出,这就像让对手教练打分,不能反映真实能力。宾大教授Ethan Mollick也批评这不是有意义的基准。
AA评测的权重分配存在哪些争议?
AA评测中50%的评分与智能体/工具执行强相关,且权重分配不断变化,如v4.2移除GPQA Diamond,v4.3替换基准,但没有清晰说明每个模型因重新加权变化多少,缺乏透明度。
AA评测如何应对数据污染?这种做法有什么弊端?
AA通过增加私有测试数据权重来应对数据污染,从v4.1的20%提高到v4.3的45%。但私有测试减少外部监督,无法审计,可能被操纵。
GPT-6 Astra在编程方面表现如何?
Astra在编程上进步显著,在Codex环境得67分,与Claude Opus 5和Fable 5持平,且token效率高,完成单个任务消耗的token仅为GPT-5.6 Sol的三分之一。开发者评价它像与另一个开发者一起编程。
Artificial Analysis是一家什么机构?它为何有资格评测AI模型?
AA是2023年由Micah Hill-Smith和George Cameron创立的私人公司,总部在旧金山,员工42人,无官方授权。它通过免费排行榜建立影响力,并向AI公司出售数据服务盈利。其权威性来自行业认可,如OpenAI、Anthropic等引用其数据。
文章认为评测体系对创新有什么负面影响?
文章认为用旧标准评审创新会拖慢创新节奏,模型厂商为在榜单上好看而将资源从探索未知转向刷高已知题目,评测成为应试能力测试,抑制了真正的范式突破。