内容提要
OpenAI推出GPT-6 Astra,其token价格是GPT-5.6 Sol的2.5倍,但在低推理设置下性能更强且响应更快。测试显示,Astra在多数任务中成本更低,如代码开发节省约20%,但高推理并非总有益,ARC测试中最大推理反而最省钱。新配置更新机制允许动态调整推理级别,开发者应关注总成本而非单价。
延伸解读
单价高不等于总成本高
Astra的token单价是Sol的2.5倍,但在多个基准测试中,Astra在低推理设置下性能更强,且因输出token更少,单任务成本反而更低。例如,在Terminal-Bench 4.0中,Astra得分更高,成本却低约9%;在GPQA Diamond上成本低37%。开发者应关注完成任务的总体成本,而非仅看单价。
推理强度并非越高越好
不同任务对推理强度的需求不同。在Shinpr的代码开发测试中,Astra-medium比high更省时省钱,且high还漏掉了bug;而ARC Prize的测试则显示,在解决ARC-AGI-3任务时,max推理反而成本最低,因为减少了错误尝试。因此,开发者需根据任务类型调整推理级别,避免一刀切。
动态调整推理级别
Astra新增的configuration_update机制允许应用在对话中动态切换推理强度,无需改变初始配置。例如,常规任务用低推理,遇到难题或错误时临时调高,解决后再降回。这有助于平衡性能与成本,但当前仅支持标准单代理请求,多代理场景尚不支持。
Q&A
GPT-6 Astra的token价格比GPT-5.6 Sol高多少?
GPT-6 Astra的token价格是GPT-5.6 Sol的2.5倍。具体来说,Astra的输入价格为每百万token 10美元,输出价格为每百万token 50美元;而Sol的输入价格为每百万token 4美元,输出价格为每百万token 20美元。
为什么OpenAI建议开发者升级到GPT-6 Astra并调低推理设置?
OpenAI认为,尽管Astra的token单价更高,但在低推理设置下,Astra的性能优于Sol的高推理设置,且响应更快。例如,Astra-low在Artificial Analysis的智能指数上得分为49,高于Sol-high的48,且首token响应时间仅为2.53秒,远快于Sol-high的11.87秒。此外,Astra在低推理下能减少输出token数量,从而降低总成本。
在代码开发任务中,Astra相比Sol能节省多少成本?
在代码开发任务中,Astra相比Sol可以节省约20%的成本。例如,在Terminal-Bench 4.0基准测试中,Astra得分57.9%,Sol得分37.3%,但Astra每任务成本比Sol低约9%。在GPQA Diamond上,Astra得分94.9%,Sol得分94.6%,但Astra成本低37%。此外,开发者Shinpr的测试显示,使用Astra-medium完成代码开发任务耗时约51分钟,成本约25.67美元,而使用Sol-high耗时约75分钟,成本约31.79美元,节省约19%。
在ARC-AGI-3测试中,Astra的推理级别与成本有何关系?
在ARC-AGI-3测试中,Astra的推理级别与成本并非线性关系。ARC Prize的测试显示,Astra在低推理时得分17.5%,成本为38,166美元;中等推理得分38.6%,成本为48,090美元;高推理得分54.8%,成本为40,705美元;最大推理得分62.7%,成本反而最低,仅为26,098美元。这是因为最大推理虽然每次决策消耗更多计算,但减少了解决问题所需的动作次数,从而降低了总成本。
什么是configuration_update机制?它有什么作用?
configuration_update是Astra引入的一种机制,允许应用程序在响应之间动态调整推理级别,而无需更改原始请求的配置。这样,开发者可以在常规任务中使用低推理级别,而在遇到失败测试、意外工具响应或复杂调试问题时,临时切换到高推理级别,问题解决后再降回低级别。这有助于在成本和性能之间取得平衡。目前,该机制仅适用于Astra的标准单代理请求。
为什么说Astra的2.5倍token价格并不一定意味着总成本更高?
因为总成本不仅取决于token单价,还取决于完成任务所需的token数量和尝试次数。Astra虽然单价高,但在许多任务中能使用更少的输出token和更少的调用次数,从而降低总成本。例如,在代码开发中,Astra-medium仅用80个请求完成实现,而Sol-high需要238个请求;在ARC测试中,最大推理虽然单价高,但总成本最低。因此,开发者应关注总成本而非单价。