内容提要
GPT-5.6模型系列大幅降低前沿智能体成本,提升性价比。通过模型选择、持久化推理、原生压缩、多智能体编排及程序化工具调用等新API功能,在保持性能的同时显著减少token消耗。例如Luna以1/18成本保持98%精度,Sol在ARC-AGI-3上性能提升近3倍且输出减少6倍。提示缓存延长至30分钟,进一步优化效率。
延伸解读
成本与性能的权衡
文章指出,GPT-5.6系列中较小的模型(如Luna和Terra)在特定任务上能以极低的成本接近旗舰模型的性能。例如,Luna在保持98%精度的同时,成本仅为GPT-5.5的十八分之一。这提示开发者,在构建智能体时,不必一律使用最强模型,而应根据任务复杂度选择合适的模型和推理强度,以显著降低运营成本。
架构优化的关键作用
除了模型本身,GPT-5.6通过API新功能(如持久化推理、原生压缩、多智能体编排和程序化工具调用)实现了效率的大幅提升。例如,在ARC-AGI-3基准上,启用这些功能后,性能提升近3倍,同时输出token减少6倍。这表明,智能体的性能不仅取决于模型,还取决于如何设计其工作流程,合理利用这些新特性可以带来显著收益。
提示缓存的实际收益
提示缓存TTL延长至30分钟,并支持确定性缓存断点,这为高频重复使用相同上下文的场景带来了实际好处。例如,Ploy通过设置缓存断点和工作区特定键,将未缓存输入减少了28%。开发者应重视缓存策略,通过合理设置缓存键和断点,可以降低延迟和成本,提升用户体验。
Q&A
GPT-5.6模型系列在性价比方面有哪些改进?
GPT-5.6模型系列大幅降低了前沿智能体成本,同时提升了性能。例如,Luna以1/18的成本保持了GPT-5.5 98%的提取精度,Sol在ARC-AGI-3上性能提升近3倍且输出减少6倍。
如何选择GPT-5.6系列中的模型以优化成本?
对于高吞吐量、延迟敏感或重复性任务,可以选择较小的模型如Terra或Luna,它们能以更低成本提供接近旗舰模型的性能。例如,Luna在保持98%提取精度的同时,成本仅为GPT-5.5的1/18。
GPT-5.6的持久化推理和原生压缩功能有什么作用?
持久化推理允许跨模型轮次保留推理结果,原生压缩可压缩长对话,两者结合使模型在长任务中保持连贯性,避免混淆或重建上下文,从而提升效率。
程序化工具调用如何减少token消耗?
程序化工具调用允许模型编写JavaScript来编排工具,并行运行独立调用,并在上下文窗口外处理输出,从而减少模型需要推理的中间结果,节省token。例如,Rogo在财务研究中使用该功能,输入token减少了21%。
多智能体编排如何提升任务完成速度和智能水平?
多智能体编排将复杂任务分解为并行工作流,由主智能体协调子智能体并行执行,最后汇总结果,从而加快任务完成并提升整体智能。例如,Qualia在开放式研究问题中使用GPT-5.6 Sol,完成速度优于大多数模型。
提示缓存的新特性是什么?如何利用它降低成本?
提示缓存的TTL延长至至少30分钟,并支持在上下文窗口内设置确定性缓存断点。通过设置缓存断点和合适的prompt_cache_key,可以提高缓存命中率,减少未缓存输入。例如,Ploy通过添加缓存断点,未缓存输入减少了28%。