内容提要
OpenAI发布GPT-5.6 Sol后,用户反映其消耗ChatGPT Work和Codex使用额度过快。OpenAI重置了额度并优化推理,使会话时长延长18%。工程负责人承认低估了代理执行成本,因Sol的编程工具调用和复杂工作流消耗大量令牌,测试未覆盖重度用户场景。公司改进等待和搜索效率,并暂时取消五小时上限。
延伸解读
代理执行成本被低估
OpenAI工程负责人承认,公司低估了真实世界中代理执行的成本。Sol的编程工具调用和复杂工作流消耗大量令牌,而测试主要关注平均和中位数使用情况,未覆盖重度用户场景。这提醒开发者,AI代理的实际资源消耗可能远超预期,部署前需考虑长尾使用情况。
订阅额度与代理工作负载不匹配
ChatGPT Work和Codex的订阅额度原本围绕聊天场景设计,但编码代理可能持续工作30-40分钟,频繁调用工具和修改代码,导致单个任务消耗大量额度。用户难以预估任务成本,OpenAI的优化虽延长了会话时长,但根本问题在于额度模型需适应代理工作负载。
测试盲区与用户反馈的价值
OpenAI承认测试未捕捉到重度用户的使用模式,而用户通过GitHub仓库反馈了具体案例,如43分钟会话消耗42%额度。这凸显了真实用户反馈在发现边缘情况中的重要性,也提醒开发者应重视社区报告,以改进产品设计和测试覆盖。
Q&A
OpenAI针对GPT-5.6 Sol消耗额度过快的问题采取了哪些措施?
OpenAI重置了ChatGPT Work和Codex用户的额度,并推出了后端推理优化,使典型Sol会话时长延长约18%。同时,公司改进了Sol在等待工具调用时的行为,优化了网络搜索,并暂时取消了五小时的使用上限。
为什么GPT-5.6 Sol会消耗大量使用额度?
GPT-5.6 Sol更愿意长时间工作,进行额外的工具调用,并协调跨工具和子代理的复杂工作流。其新的程序化工具调用(代码模式)允许模型在后台工具运行时继续工作,导致消耗的令牌远超预期。
OpenAI工程负责人对Sol额度问题有何承认?
工程负责人Thibault Sottiaux承认公司低估了真实世界代理执行的成本,并承认测试未覆盖重度用户场景,只关注了平均和中位数使用情况,忽略了长尾用户可能消耗更多额度的情况。
用户反馈中,Sol消耗额度的具体案例有哪些?
有用户描述了一次43分钟的编码会话,生成了近300个模型响应、96次执行调用和192次等待调用,消耗了剩余42%的五小时额度,大部分时间在等待工具结果。另一个用户发现本应独立的任务被串行执行,导致运行时间延长,令牌消耗增加,涉及超过700个执行单元。
OpenAI的修复措施对Sol会话时长有何影响?
OpenAI的后端推理改进使典型Sol会话时长延长约18%,这意味着在相同额度下,用户可以使用更长时间。
订阅限制原本是为哪种使用场景设计的?为什么编码代理不同?
订阅限制原本是为聊天场景设计的。编码代理不同,因为它们可以花费30到40分钟处理任务,进行工具调用和修改代码,这使得开发者难以预测单个任务会消耗多少额度。