内容提要
Anthropic发布Sonnet 5.5,价格仅为Opus 5.5的一半。相同提示测试显示:Sonnet 5.5在代码修复和并发测试中更准、更快、更便宜,15次运行全部通过,总成本比Opus 5.5低约36%;Opus 5.5在智能体测试中更快、更省。建议硬编码任务默认用Sonnet 5.5并调高输出上限,智能体循环仍用Opus 5.5。
延伸解读
价格减半不等于账单减半
Sonnet 5.5 每百万 token 价格是 Opus 5.5 的一半,但实际成本取决于完成任务所需 token 量。测试中 Sonnet 5.5 常因思考更久而消耗更多 token,导致单次成本优势缩小。例如在代码修复任务中,其 token 用量是 Opus 5.5 的两倍,几乎抵消了单价折扣。因此,评估模型成本时不能只看单价,必须结合具体任务的实际 token 消耗。
输出上限设置是关键
Sonnet 5.5 在智能体测试中因单步思考过长,多次触及 32,000 token 的输出上限而失败。将上限提高到 128,000 后,所有失败运行均通过。这表明使用 Sonnet 5.5 时,必须调高输出上限,否则可能因中途截断而无法完成任务,甚至产生额外重试成本。对于需要长思考的任务,建议将上限设置得足够高。
任务类型决定模型选择
测试显示,Sonnet 5.5 在代码修复和并发测试中表现更优:15 次运行全部通过,且总成本比 Opus 5.5 低约 36%。而 Opus 5.5 在智能体测试中更快、更省,完成时间快约 35%,且计入 Sonnet 5.5 的失败重试后成本更低。因此,硬编码类任务可默认使用 Sonnet 5.5,而智能体循环仍适合 Opus 5.5。
独立测试与自测结果差异
Artificial Analysis 的独立测试发现,在最大努力设置下,Sonnet 5.5 每任务成本高于 Opus 5.5,且智能指数略低。但本文作者的测试却得出相反结论:Sonnet 5.5 更准确,总体成本低约 36%。这种差异可能源于任务类型、提示设计或输出上限设置不同。读者在参考评测时,应关注测试条件与自身场景的匹配度。
Q&A
Sonnet 5.5 和 Opus 5.5 的价格差多少?
Sonnet 5.5 每百万输入 token 2 美元、输出 10 美元,是 Opus 5.5(输入 4 美元、输出 20 美元)的一半。
Sonnet 5.5 在代码修复任务上的表现如何?
在代码修复测试中,Sonnet 5.5 和 Opus 5.5 都修复了全部 4 个 bug 并通过 12 个隐藏测试,但 Sonnet 5.5 平均耗时 5 分 8 秒、花费 0.70 美元,而 Opus 5.5 耗时 3 分 21 秒、花费 0.75 美元。
为什么 Sonnet 5.5 的每次运行成本不是 Opus 5.5 的一半?
因为 Sonnet 5.5 完成任务需要更多 token,抵消了单价优势。例如在代码修复中它用了两倍 token,导致总成本仅比 Opus 5.5 低约 36%,而非 50%。
在智能体测试中,Sonnet 5.5 遇到了什么问题?
Sonnet 5.5 在单步思考时容易达到 32,000 token 上限,导致 5 次运行中有 4 次失败。将上限提高到 128,000 后重跑才通过,但失败尝试额外花费约 1.40 美元。
并发测试中 Sonnet 5.5 和 Opus 5.5 谁更可靠?
Sonnet 5.5 在 5 次运行中全部修复了 3 个竞态条件并通过 8 个隐藏测试;Opus 5.5 只有 3 次成功,另外 2 次耗尽 128,000 token 未输出答案。
根据测试,应该什么时候用 Sonnet 5.5,什么时候用 Opus 5.5?
硬编码任务默认用 Sonnet 5.5,并调高输出上限;智能体循环仍用 Opus 5.5,因为 Opus 5.5 在智能体测试中快约 35% 且计入失败运行后成本更低。