Claude Opus 5.5 与 Opus 5 推理任务对比:更便宜、更快,但并未更强

Claude Opus 5.5 与 Opus 5 推理任务对比:更便宜、更快,但并未更强

💡 原文英文,约1700词,阅读约需6分钟。
📝

内容提要

Anthropic发布Claude Opus 5.5,宣称比Opus 5便宜40%、快30%。作者用三道推理题实测:两者正确率相同,Opus 5.5每题更省钱更快,逻辑题省43%,石子游戏省69%,主要靠减少输出token,速度仅快11%。但难题中两模型都可能思考近20分钟无结果,且Opus 5.5曾误触安全过滤拒答。建议升级,但设输出上限,计数题应配代码工具。

🔎

延伸解读

实测表现:正确率持平,省钱省时

作者用三道推理题对比Opus 5.5与Opus 5,两者正确率完全相同:逻辑网格和石子游戏均解出,排序计数题均失败。但Opus 5.5在每道题上都更便宜、更快,逻辑题省43%,石子游戏省69%,整体速度约快11%。节省主要来自输出token减少,而非单纯降价。

成本节省的来源与局限

Anthropic宣称Opus 5.5比Opus 5便宜40%,其中API价格下调贡献约20%,其余来自模型使用更少token。实测中,Opus 5.5在石子游戏上输出token减少62%,成本降低69%。但难题上两模型都可能思考近20分钟并耗尽输出预算,Opus 5.5还曾误触安全过滤拒答,导致无结果。

使用建议:设输出上限,计数题配代码工具

作者建议现有Opus 5用户升级到Opus 5.5,因为硬推理任务结果相同但更省钱省时。不过需设置硬性输出上限,避免难题上花费大量token却无返回。对于排序计数这类问题,应给模型配备代码执行工具,而非依赖纯推理,因为两模型均无法仅靠思考得出正确答案。

❓

Q&A

Claude Opus 5.5 相比 Opus 5 在价格和速度上具体有哪些提升?

Opus 5.5 的 API 价格降至每百万输入 token 4 美元、输出 20 美元,比 Opus 5 的 5 美元和 25 美元便宜 20%。实测中,Opus 5.5 在逻辑题上省 43%,石子游戏上省 69%,整体输出速度约快 11%,但未达到官方宣称的 30%。

Opus 5.5 在推理任务上的正确率是否比 Opus 5 更高?

没有。作者用三道推理题测试,两个模型正确率完全相同:都解出了逻辑网格和石子游戏,都未能解出排序计数问题。Opus 5.5 并未在推理能力上超越 Opus 5。

Opus 5.5 节省成本的主要原因是什么?

主要来自减少输出 token。API 价格下调本身只贡献了 20% 的节省,其余节省源于模型在解题时写出的 token 更少,例如石子游戏中 Opus 5.5 比 Opus 5 少用 62% 的输出 token。

使用 Opus 5.5 处理难题时需要注意哪些风险?

两个模型在难题上都可能思考近 20 分钟甚至更久却无任何输出,而思考 token 会计费,导致浪费。此外,Opus 5.5 曾因安全过滤器误判而拒绝回答一个无害的计数问题。建议设置硬性输出上限,并对计数类问题提供代码执行工具。

对于计数类推理问题,作者建议如何提高成功率?

作者建议给模型配备代码执行工具,而不是期望它纯靠推理得出答案。例如排序计数问题中,正确答案需要程序检查所有排列,两个模型都无法仅靠推理解决。

是否应该从 Opus 5 升级到 Opus 5.5?

如果目前使用 Opus 5,建议升级。因为 Opus 5.5 在困难推理任务上结果相同,但花费更少、等待时间更短。不过需设置输出上限以控制成本,并在计数问题上配合代码工具。

🏷️

标签

➡️

继续阅读