内容提要
文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6%),且成本更低,表明框架选择对性能与费用影响巨大,甚至比模型选择更重要。目前,OpenAI、Anthropic等公司已将框架产品化,Nvidia也自建框架。未来,构建框架将比挑选模型更为关键。
延伸解读
框架工程为何如此重要
同一模型GPT-6 Astra在ARC Prize标准框架下得分62.7%,而在OpenAI的Provider Adapter下得分98.6%,差距达36个百分点,且成本更低($17,332对比$26,098)。这表明,模型周围的软件框架能显著影响性能与成本,甚至比模型选择本身更关键。
框架已产品化,成为商业竞争焦点
OpenAI、Anthropic、Google和Microsoft等公司已将框架作为产品出售,收费模式各异:Anthropic按会话小时收费,OpenAI免费提供SDK,Google和Microsoft则按功能分项计费。Stripe以80亿美元收购OpenRouter,Nvidia自建AVO框架,均显示框架层已成为AI生态中的核心商业战场。
警惕基准测试的误导性
OpenAI总裁Greg Brockman声称“我们已进入AGI时代”,但该结论基于特定框架下的测试结果,而非模型本身的能力。ARC Prize强调,不同框架设置(如推理状态保留)可大幅改变得分,因此基准分数需谨慎解读,不能直接等同于模型或系统的真实智能水平。
Q&A
为什么同一个GPT-6 Astra模型在ARC-AGI-3上的得分差异如此之大?
因为评测框架(harness)不同。ARC Prize的标准框架下得分62.7%,而OpenAI的Provider Adapter框架下得分98.6%,模型本身没有变化,但框架的差异导致了36个百分点的差距。
OpenAI的Provider Adapter相比ARC Prize的标准框架有哪些优势?
OpenAI的Provider Adapter在ARC-AGI-3上不仅得分更高(98.6% vs 62.7%),而且成本更低($17,332 vs $26,098),同时使用更少的token(减少49%)和更快的速度(约3.66倍)。
为什么说框架工程比模型选择更重要?
因为框架可以显著改变模型的性能和成本,甚至比模型本身的选择影响更大。例如,GPT-6 Astra在OpenAI的框架下得分98.6%,而在ARC Prize的框架下只有62.7%,且成本更低。此外,前沿模型在编码等任务上的性能差异很小,而框架的差异可以导致巨大的性能差距。
OpenAI、Anthropic等公司是如何将框架产品化的?
这些公司都将框架作为独立产品出售。Anthropic的Managed Agents按会话小时收费($0.08/小时),OpenAI的Agents SDK免费提供但无运行时费用,Google和Microsoft则将会话、内存、代码执行和可观测性作为单独计费项目。
Nvidia的AVO框架是如何提升模型在ARC-AGI-3上的表现的?
Nvidia的AVO框架为模型提供持久记忆和程序化监督,当进度停滞时介入,使得Claude Opus 5在ARC-AGI-3上从30.2%的得分提升到能够清除所有183个关卡。
为什么说Greg Brockman关于AGI时代的说法不够严谨?
因为Brockman引用的98.6%得分是在特定框架(OpenAI的Provider Adapter)下取得的,而不是模型本身的能力。框架的贡献很大,因此不能仅凭这个基准结果就断言模型已达到AGI水平。
未来构建AI系统时,重点应该放在哪里?
未来构建AI系统时,重点应该放在构建框架(harness)上,而不是仅仅选择模型。因为模型选择变得越来越容易,而框架决定了模型能力能否有效转化为持续自主的进展。