内容提要
OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试中得分低,源于官方框架丢弃推理和滚动截断,而非模型能力不足。启用推理保留和上下文压缩后,得分从7.8%升至38.3%,输出token减少六倍。这揭示基准测试测的是框架记忆管理,而非模型智商,建议评估应使用更贴近实际场景的设置。
延伸解读
基准测试的公平性陷阱
文章揭示了一个关键问题:ARC-AGI-3的官方框架默认丢弃推理和滚动截断,这对依赖推理链的模型尤其不利。因此,排行榜上的分数不仅反映模型能力,还受框架设计、API设置等隐形变量影响。研究者对比模型时,必须确认框架设置是否公平,否则结论可能失真。
记忆管理是智能体的核心能力
长期任务中,智能体需要短期推理连续性和长期经验积累。推理保留和上下文压缩分别解决这两个问题。文章指出,模型在宝可梦火红中能通关,是因为游戏环境天然保留状态,而ARC-AGI-3的文本表示完全依赖上下文窗口,因此窗口设置成为决定胜负的关键。
压缩优于截断的实践启示
滚动截断简单粗暴,但会丢失早期信息并导致满负荷运行损伤性能。压缩则通过智能总结保留关键信息,减少冗余。实验显示,压缩后输出token减少六倍,得分反而提高三倍,说明有效的记忆管理能减少重复错误和无效动作,形成正向循环。
Q&A
为什么GPT-5.6 Sol在ARC-AGI-3基准测试中得分很低?
得分低并非模型能力不足,而是官方测试框架丢弃了模型的推理过程,并使用滚动截断窗口,导致模型无法保持推理连续性和长期记忆。
GPT-5.6 Sol在ARC-AGI-3上的得分从7.8%提升到38.3%是如何做到的?
通过启用Responses API中的推理保留和上下文压缩两个设置,得分从7.8%提升到38.3%,同时输出token减少了六倍。
推理保留和上下文压缩分别有什么作用?
推理保留让模型保留每次行动后的思考过程,保持推理连续性和策略连贯性;上下文压缩在上下文达到上限时智能总结历史,保留关键信息,避免直接丢弃旧消息。
为什么压缩比滚动截断更有效?
滚动截断直接删除旧消息,导致模型丢失早期信息,且长期在满负荷上下文下运行影响性能;压缩则智能总结,保留关键信息,让模型记得更清楚,减少重复错误,从而输出更少token但得分更高。
ARC-AGI-3基准测试真正衡量的是什么?
ARC-AGI-3基准测试表面测模型智商,实际测的是框架对记忆的管理能力,因为官方框架的丢弃推理和滚动截断对依赖推理链的模型不友好,导致得分差异巨大。
OpenAI建议如何公平评估模型?
OpenAI建议所有对比评估都应使用推理保留和上下文压缩设置,因为这两项最接近ChatGPT和Codex的真实使用场景,能公平释放模型能力。
为什么模型在宝可梦火红中能通关但在ARC-AGI-3中表现差?
宝可梦火红有存档机制,模型能持续看到当前状态,信息不会丢失;而ARC-AGI-3的文本表示只返回当前帧和关卡号,完全依赖上下文窗口,框架设置不当导致记忆缺失。