文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6%),且成本更低,表明框架选择对性能与费用影响巨大,甚至比模型选择更重要。目前,OpenAI、Anthropic等公司已将框架产品化,Nvidia也自建框架。未来,构建框架将比挑选模型更为关键。
百度文心助手任务Agent以94.6%最高分登顶全球工程向AI智能体评测榜单PinchBench v2,领先Claude、GPT等模型。该评测考核真实工作场景任务完成能力,文心助手在数据分析、安全漏洞修复、合同分析等复杂任务中表现卓越,并开源评测流程。其成功源于百度二十余年搜索意图理解技术积累,证明框架工程能力比模型参数更重要。
完成下面两步后,将自动完成登录并继续当前操作。