OpenAI将GPT-6的token价格减半,但更大的杠杆或许是缓存。

OpenAI将GPT-6的token价格减半,但更大的杠杆或许是缓存。

💡 原文英文,约800词,阅读约需3分钟。
📝

内容提要

OpenAI发布GPT-6 Sol和Luna,输入输出token费用较GPT-5.6减半。新模型改进提示缓存,默认缓存命中率更高,可保留上下文,并新增缓存监控面板。GitHub称需重新处理的提示token减少超50%。OpenAI从降价和减少重复处理两方面降低智能体成本。

🔎

延伸解读

降价之外,缓存才是成本关键

文章指出,GPT-6 Sol和Luna的API价格较GPT-5.6减半,但OpenAI强调缓存改进能进一步降低成本。缓存命中率提高后,智能体可复用已处理的上下文,避免每次调用都重新处理相同内容,从而减少token消耗和延迟。对开发者而言,关注缓存优化可能比单纯比较单价更有实际意义。

缓存改进的具体能力

新模型默认缓存命中率更高,且允许在调整推理强度和工具可用性时不破坏缓存。这意味着智能体可根据任务难度动态调整推理投入,或切换工具,而不会导致先前缓存的上下文失效。此外,新增的Prompt Caching Dashboard可查看缓存输入量及其变化,并标记未命中的缓存机会,帮助开发者主动优化。

实际效果与数据支撑

OpenAI称,GitHub报告在过去几个月数十亿次请求中,需要全新处理的提示token比例减少了超过50%。这一数据表明缓存改进已产生实际效果,能显著减少重复处理。结合输入输出token价格减半,OpenAI从降低单价和减少重复处理两方面入手,为智能体成本控制提供了双重杠杆。

对开发者的启示

文章提醒,随着模型提供商在价格上竞争加剧,仅靠低价模型未必能节省AI预算。对于运行长任务、复杂任务的智能体,缓存复用能力将越来越重要。开发者应关注缓存命中率、上下文保留机制以及监控工具,以便在价格之外找到更多成本优化空间。

Q&A

GPT-6 Sol和Luna的API价格具体是多少?

GPT-6 Sol和Luna的输入token价格分别为每百万token 2美元和0.10美元,输出token价格分别为每百万token 10美元和0.50美元。相比GPT-5.6 Sol和Luna,输入价格降低50%,Luna的输出价格降低58%。

OpenAI在GPT-6的缓存方面做了哪些改进?

OpenAI为GPT-6改进了提示缓存,包括:默认更高的缓存命中率;在调整推理努力和工具可用性时仍能保留先前上下文;新增提示缓存仪表板,用于监控和诊断缓存性能,显示缓存输入量及其变化,并标记错失的缓存机会。

缓存改进如何帮助降低智能体成本?

缓存改进通过提高缓存命中率,让智能体重用更多已处理的上下文,避免每次调用都从头处理相同上下文,从而减少延迟和token成本。缓存输入token读取可享受90%折扣,且GitHub报告称需重新处理的提示token减少了超过50%。

GPT-6 Sol和Luna与GPT-6 Astra有什么关系?

GPT-6 Sol和Luna是GPT-6 Astra的更实惠版本,在对齐方面比GPT-5.6 Sol更接近Astra,但仍未达到旗舰模型Astra的水平。

提示缓存仪表板有什么功能?

提示缓存仪表板允许开发者查看缓存性能,了解多少上下文被重用,具体可以看到多少输入被缓存以及该数量随时间的变化。诊断工具还会标记错失的缓存机会,帮助开发者理解哪些地方可以更高效地使用缓存。

GitHub对OpenAI缓存改进的反馈是什么?

GitHub报告称,这些改进在数十亿次对OpenAI模型的请求中,将需要重新处理的提示token比例降低了超过50%,这些结果涵盖了过去的几个月。

🏷️

标签

➡️

继续阅读