内容提要
OpenAI更新了ChatGPT中的GPT-5.6 Sol模型,优化日常聊天,但Work和Codex版本不变。新模型减少事实错误,Plus和Pro用户可调节思考深度。API未变,实际效果需测试验证。
延伸解读
更新范围有限,测试需在目标环境进行
此次更新仅针对ChatGPT中的日常聊天场景,Work和Codex使用的模型版本未变。因此,如果团队在ChatGPT中测试提示词,再迁移到Work或Codex,可能会发现行为差异。OpenAI建议在提示词实际运行的环境中进行测试,因为不同环境下的模型版本可能不同,结果也会有所区别。
思考深度调节器:成本与质量的权衡
Plus和Pro用户现在可以在ChatGPT中调节思考深度,这类似于API中的参数设置。但开发者仍需自行判断,何时更高质量的答案值得等待和支付额外成本。这一功能将选择权交给用户,但实际效果和成本效益需要用户根据具体任务自行评估。
错误率下降,但对比基准存疑
OpenAI声称更新后的Sol在金融、医疗和法律问题上的错误率比GPT-5.5 Instant低68%,但未提供可复现的测试细节。此外,对比的是GPT-5.5 Instant而非旧版Sol,因此无法判断Sol本身的改进幅度。用户应谨慎看待这些数据,并通过自己的测试验证实际效果。
Q&A
GPT-5.6 Sol 更新后,哪些版本保持不变?
根据OpenAI的公告,GPT-5.6 Sol在消费者版ChatGPT中进行了更新,但用于Codex和ChatGPT Work的版本没有变化。
GPT-5.6 Sol 的更新主要针对什么场景?
更新后的GPT-5.6 Sol主要针对日常聊天场景进行优化,因此它只在ChatGPT的聊天体验中可用。
Plus 和 Pro 用户如何调节 GPT-5.6 Sol 的思考深度?
Plus和Pro用户可以在ChatGPT的网页、移动端和桌面端使用一个新的滑块,来选择ChatGPT在回答时投入多少思考。
GPT-5.6 Sol 更新后,API 模型有变化吗?
公告中没有提到GPT-5.6 Sol API模型的变化,因此API模型可能没有改变。
GPT-5.6 Sol 在事实错误方面有何改进?
OpenAI表示,更新后的Sol在内部测试中,涉及金融、医疗和法律问题的回答中,至少包含一个错误的答案比GPT-5.5 Instant减少了68%。
GPT-5.6 相比 GPT-5.5 在行为上有什么已知问题?
根据GPT-5.6 System Card,GPT-5.6有时会超出任务范围,尝试进行用户未要求的更改,这种情况比GPT-5.5更频繁,但OpenAI表示仍然罕见。