OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统

OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6%),且成本更低,表明框架选择对性能与费用影响巨大,甚至比模型选择更重要。目前,OpenAI、Anthropic等公司已将框架产品化,Nvidia也自建框架。未来,构建框架将比挑选模型更为关键。

🔎

延伸解读

框架工程为何如此重要

同一模型GPT-6 Astra在ARC Prize标准框架下得分62.7%,而在OpenAI的Provider Adapter下得分98.6%,差距达36个百分点,且成本更低($17,332对比$26,098)。这表明,模型周围的软件框架能显著影响性能与成本,甚至比模型选择本身更关键。

框架已产品化,成为商业竞争焦点

OpenAI、Anthropic、Google和Microsoft等公司已将框架作为产品出售,收费模式各异:Anthropic按会话小时收费,OpenAI免费提供SDK,Google和Microsoft则按功能分项计费。Stripe以80亿美元收购OpenRouter,Nvidia自建AVO框架,均显示框架层已成为AI生态中的核心商业战场。

警惕基准测试的误导性

OpenAI总裁Greg Brockman声称“我们已进入AGI时代”,但该结论基于特定框架下的测试结果,而非模型本身的能力。ARC Prize强调,不同框架设置(如推理状态保留)可大幅改变得分,因此基准分数需谨慎解读,不能直接等同于模型或系统的真实智能水平。

Q&A

为什么同一个GPT-6 Astra模型在ARC-AGI-3上的得分差异如此之大?

因为评测框架(harness)不同。ARC Prize的标准框架下得分62.7%,而OpenAI的Provider Adapter框架下得分98.6%,模型本身没有变化,但框架的差异导致了36个百分点的差距。

OpenAI的Provider Adapter相比ARC Prize的标准框架有哪些优势?

OpenAI的Provider Adapter在ARC-AGI-3上不仅得分更高(98.6% vs 62.7%),而且成本更低($17,332 vs $26,098),同时使用更少的token(减少49%)和更快的速度(约3.66倍)。

为什么说框架工程比模型选择更重要?

因为框架可以显著改变模型的性能和成本,甚至比模型本身的选择影响更大。例如,GPT-6 Astra在OpenAI的框架下得分98.6%,而在ARC Prize的框架下只有62.7%,且成本更低。此外,前沿模型在编码等任务上的性能差异很小,而框架的差异可以导致巨大的性能差距。

OpenAI、Anthropic等公司是如何将框架产品化的?

这些公司都将框架作为独立产品出售。Anthropic的Managed Agents按会话小时收费($0.08/小时),OpenAI的Agents SDK免费提供但无运行时费用,Google和Microsoft则将会话、内存、代码执行和可观测性作为单独计费项目。

Nvidia的AVO框架是如何提升模型在ARC-AGI-3上的表现的?

Nvidia的AVO框架为模型提供持久记忆和程序化监督,当进度停滞时介入,使得Claude Opus 5在ARC-AGI-3上从30.2%的得分提升到能够清除所有183个关卡。

为什么说Greg Brockman关于AGI时代的说法不够严谨?

因为Brockman引用的98.6%得分是在特定框架(OpenAI的Provider Adapter)下取得的,而不是模型本身的能力。框架的贡献很大,因此不能仅凭这个基准结果就断言模型已达到AGI水平。

未来构建AI系统时,重点应该放在哪里?

未来构建AI系统时,重点应该放在构建框架(harness)上,而不是仅仅选择模型。因为模型选择变得越来越容易,而框架决定了模型能力能否有效转化为持续自主的进展。

🏷️

标签

➡️

继续阅读