OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中得分98.6%,远超GPT-5.6 Sol的7.8%,并在数学、编程等基准上大幅提升。尽管成绩显著,但测试设置差异及模型自主性不明,尚不能证明AGI。Astra在安全性和长任务处理上表现更优,标志AI能力进入新阶段。
英伟达发布AVO智能体系统,将Claude Opus 5在ARC-AGI-3基准上的得分从30.2%提升至100%。该系统通过持久记忆和程序化监督,支持长时间自主操作,并成功从GPU优化迁移至推理任务,证明系统设计而非仅模型能力可解锁前沿性能。
Prime Agent是开源AI编程智能体,采用单一持久IPython内核作为唯一工具,减少工具选择成本,在ARC-AGI-3测试中获95.5%高分,但令牌消耗翻倍。其核心是递归语言模型和持续harness,让AI自主管理上下文和子智能体。虽效率提升,但成本转移至推理层,且存在过拟合风险,引发对AI效率衡量标准的重新思考。
Prime Agent开源框架通过递归语言模型和持续化运行机制,使AI实现自我改进,在ARC-AGI-3测试中获95.5%高分,超越人类基线。该框架支持AI不失忆、自改提示词及创建子智能体,并能从零编写游戏机模拟器。其完全开源,引发AI基础设施层变革,凸显学习方法比模型规模更重要。
OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试中得分低,源于官方框架丢弃推理和滚动截断,而非模型能力不足。启用推理保留和上下文压缩后,得分从7.8%升至38.3%,输出token减少六倍。这揭示基准测试测的是框架记忆管理,而非模型智商,建议评估应使用更贴近实际场景的设置。
Claude Opus 5在ARC-AGI-3测试中得分30.2%,远超GPT-5.6 Sol的7.8%,并攻克五个难题,展现代数推理能力。尽管有质疑称其可能依赖循环框架取巧,但测试反映AI在抽象推理上的质变,虽离现实应用尚远,却标志智能突破的重要信号。
加州大学圣地亚哥分校与OpenAI的研究提出了OPINE-World,通过程序化世界模型使LLM Agent在未知环境中主动学习。在ARC-AGI-3基准测试中,该模型解决了20个游戏,达到了78.4的动作效率。OPINE-World结合两个Agent进行假设与测试,利用本体论误差度量优化探索过程,提高学习效率。
GPT-5.6在ARC-AGI-3基准测试中展现出“情境锚定”能力,尽管整体得分仅为7.78%,但在特定任务FT09中取得87%的正确率。这标志着AI从“解题机器”向“环境阅读者”的转变,显示出其在新环境中理解规则的认知灵活性。虽然在高难度任务上表现有限,但这一突破为通用智能的发展指明了方向。
完成下面两步后,将自动完成登录并继续当前操作。