内容提要
OpenAI发布GPT-6 Sol和Luna,输入输出token费用较GPT-5.6减半。新模型改进提示缓存,默认缓存命中率更高,可保留上下文,并新增缓存监控面板。GitHub称需重新处理的提示token减少超50%。OpenAI从降价和减少重复处理两方面降低智能体成本。
延伸解读
降价之外,缓存才是成本关键
文章指出,GPT-6 Sol和Luna的API价格较GPT-5.6减半,但OpenAI强调缓存改进能进一步降低成本。缓存命中率提高后,智能体可复用已处理的上下文,避免每次调用都重新处理相同内容,从而减少token消耗和延迟。对开发者而言,关注缓存优化可能比单纯比较单价更有实际意义。
缓存改进的具体能力
新模型默认缓存命中率更高,且允许在调整推理强度和工具可用性时不破坏缓存。这意味着智能体可根据任务难度动态调整推理投入,或切换工具,而不会导致先前缓存的上下文失效。此外,新增的Prompt Caching Dashboard可查看缓存输入量及其变化,并标记未命中的缓存机会,帮助开发者主动优化。
实际效果与数据支撑
OpenAI称,GitHub报告在过去几个月数十亿次请求中,需要全新处理的提示token比例减少了超过50%。这一数据表明缓存改进已产生实际效果,能显著减少重复处理。结合输入输出token价格减半,OpenAI从降低单价和减少重复处理两方面入手,为智能体成本控制提供了双重杠杆。
对开发者的启示
文章提醒,随着模型提供商在价格上竞争加剧,仅靠低价模型未必能节省AI预算。对于运行长任务、复杂任务的智能体,缓存复用能力将越来越重要。开发者应关注缓存命中率、上下文保留机制以及监控工具,以便在价格之外找到更多成本优化空间。
Q&A
GPT-6 Sol和Luna的API价格具体是多少?
GPT-6 Sol和Luna的输入token价格分别为每百万token 2美元和0.10美元,输出token价格分别为每百万token 10美元和0.50美元。相比GPT-5.6 Sol和Luna,输入价格降低50%,Luna的输出价格降低58%。
OpenAI在GPT-6的缓存方面做了哪些改进?
OpenAI为GPT-6改进了提示缓存,包括:默认更高的缓存命中率;在调整推理努力和工具可用性时仍能保留先前上下文;新增提示缓存仪表板,用于监控和诊断缓存性能,显示缓存输入量及其变化,并标记错失的缓存机会。
缓存改进如何帮助降低智能体成本?
缓存改进通过提高缓存命中率,让智能体重用更多已处理的上下文,避免每次调用都从头处理相同上下文,从而减少延迟和token成本。缓存输入token读取可享受90%折扣,且GitHub报告称需重新处理的提示token减少了超过50%。
GPT-6 Sol和Luna与GPT-6 Astra有什么关系?
GPT-6 Sol和Luna是GPT-6 Astra的更实惠版本,在对齐方面比GPT-5.6 Sol更接近Astra,但仍未达到旗舰模型Astra的水平。
提示缓存仪表板有什么功能?
提示缓存仪表板允许开发者查看缓存性能,了解多少上下文被重用,具体可以看到多少输入被缓存以及该数量随时间的变化。诊断工具还会标记错失的缓存机会,帮助开发者理解哪些地方可以更高效地使用缓存。
GitHub对OpenAI缓存改进的反馈是什么?
GitHub报告称,这些改进在数十亿次对OpenAI模型的请求中,将需要重新处理的提示token比例降低了超过50%,这些结果涵盖了过去的几个月。