Claude Opus 5在ARC-AGI-3基准上得分30%。借助英伟达AVO系统,其得分达到100%。

Claude Opus 5在ARC-AGI-3基准上得分30%。借助英伟达AVO系统,其得分达到100%。

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

英伟达发布AVO智能体系统,将Claude Opus 5在ARC-AGI-3基准上的得分从30.2%提升至100%。该系统通过持久记忆和程序化监督,支持长时间自主操作,并成功从GPU优化迁移至推理任务,证明系统设计而非仅模型能力可解锁前沿性能。

🔎

延伸解读

系统设计比模型能力更关键

英伟达团队将Claude Opus 5在ARC-AGI-3上的得分从30.2%提升至100%,关键在于AVO系统的设计,而非模型本身。这印证了“评估模型不等于评估智能体”的观点:模型能力固然重要,但外围系统决定了其能力能否转化为持续的自主进展。对于AI研发者而言,这意味着在追求更强模型的同时,也应重视智能体架构的优化。

持久记忆与程序化监督的作用

AVO系统通过持久记忆保存先前的实现、评估结果和推理过程,使智能体能够从当前状态继续工作,避免重复搜索。同时,程序化监督模块监控整体搜索轨迹,在进展停滞时介入。这两个机制支撑了长时程任务,超越了单次模型调用的上下文窗口限制,是实现“持续自主进展”的关键。

跨任务迁移的启示

AVO最初用于GPU内核优化,现成功迁移至ARC-AGI-3推理任务,表明通用性不仅来自领域知识,也来自让推理和反馈随时间累积的机制。尽管两个任务表面差异大,但底层模式相似:形成假设、行动、观察证据、更新状态、继续。这提示智能体架构的通用性可能比预想的更强。

结果局限与未来方向

英伟达团队强调,100%得分仅针对ARC-AGI-3公共集,并非半私有或完全私有集的结果。此外,与GPT-5.6 Sol的对比实验显示不同模型具有互补的操作特征,但更系统的比较留待未来。因此,该结果虽亮眼,但需谨慎看待其泛化性,尤其是在更严格的基准上。

Q&A

英伟达的AVO系统在ARC-AGI-3基准上取得了什么成绩?

英伟达的AVO系统将Claude Opus 5在ARC-AGI-3基准上的得分从30.2%提升至100%,在25个环境中完成了全部183个关卡,RHAE得分达到100.00。

AVO系统是什么?它最初是为什么设计的?

AVO(Agentic Variation Operators)是英伟达在2026年3月底推出的一种通用编程智能体系统,最初用于困难的软件工程和GPU内核优化任务。它用自主智能体取代了传统进化搜索系统中的预定义变异步骤,由智能体决定检查什么、修改什么、测试什么以及提交什么。

AVO系统如何将Claude Opus 5的得分从30.2%提升到100%?

AVO系统通过两个关键机制实现提升:持久记忆和程序化监督。持久记忆让智能体能够保留之前的实现、评估结果、编译器输出和累积推理,从而从当前状态继续工作;监督模块(程序化软件模块)监控整个搜索轨迹,并在进展停滞时进行干预。

ARC-AGI-3基准使用什么指标?它如何衡量性能?

ARC-AGI-3基准使用相对人类行动效率(RHAE)指标,该指标结合了任务完成情况和相对于首次人类基线的每级行动效率,并在不同级别和环境之间聚合性能。

AVO系统在GPU内核优化和ARC-AGI-3任务中有什么共同点?

尽管表面不同,但底层计算模式相似:智能体必须形成假设、行动、观察证据、更新状态并继续。在GPU优化中,反馈来自编译器、测试、分析器和性能基准;在ARC-AGI-3中,反馈来自环境转换和行动结果。

AVO系统是否只适用于Claude模型?它与其他模型配合如何?

AVO系统设计为跨前沿模型工作。除了Claude Opus 5,团队还将AVO与GPT-5.6 Sol配对进行实验,发现Sol在墙钟时间上更快达到匹配级别,而Opus在匹配级别比较中使用更少的环境动作,表明不同模型具有互补的操作特征。

英伟达团队认为这项研究最重要的结果是什么?

最重要的结果不是100.00的得分,而是相同的智能体架构从高度专业化的GPU内核优化成功迁移到非常不同的交互式推理任务,表明通用性不仅来自领域知识,还来自允许推理和反馈随时间累积的机制。

🏷️

标签

➡️

继续阅读