内容提要
Anthropic发布Claude Opus 5.5,性能接近Fable 5.1,成本降低40%、速度提升30%,擅长长时编程与知识工作。API降价20%,缓存费用降60%,成为付费计划默认模型。社区实测显示其创意编程表现亮眼,但音乐创作等仍有短板。竞争转向调用频率与成本,推动Personal Agent全天运行。
延伸解读
性能提升的边界:长任务优势明显,但并非全面领先
Opus 5.5 在 Terminal-Bench 4.0、FrontierCode v1.1 等编程评测中超过 GPT-6 Astra,GDPval-AA v2.1 知识工作得分也高于 Fable 5.1。然而,在 AutomationBench 和 Terminal-Bench-Science 0.1 上仍落后于 Astra。官方也提醒,榜单差距已无法完全反映真实体验。因此,读者应关注模型在自身工作流中的实际表现,而非仅看评测分数。
成本下降的真实含义:默认设置下的节省,max 档可能更贵
API 价格降低 20%,缓存读取费用降 60%,官方称典型任务成本降低 40%。但开发者指出,在 max 档运行 Intelligence Index 时,Opus 5.5 的输出 token 消耗为已测模型最高。实际成本受任务类型、推理档位、上下文长度和缓存命中率影响。用户需根据自身使用模式评估,而非简单认为所有场景都更便宜。
创意编程亮眼,音乐创作仍是短板
社区实测显示,Opus 5.5 在创意编程、3D 建模和交互模拟上表现突出,例如一次提示生成可玩的 Mario Kart 游戏,或编写 7500 行 Python 代码模拟笔刷。但在 Bach Benchmark 音乐创作测试中,生成的众赞歌出现声部间距、重复音和平行八度等问题,表现可能不如 Grok 4.7。这表明其创意能力在不同领域存在明显差异。
安全与权限:能力越强,门槛越高
由于生物与网络安全能力接近 Mythos 5.1,Opus 5.5 启用了与 Fable 5.1 相近的安全措施,大部分网络安全任务会转交给 Opus 4.8,只有通过验证的安全研究人员和生命科学机构才能获得更完整能力。模型还启用了防止蒸馏的 preserved thinking,并保留零数据留存选项。企业安全团队可审计其开源沙箱。这些限制可能影响部分高级用户的使用。
Q&A
Claude Opus 5.5 相比 Opus 5 在成本和速度上具体提升了多少?
官方称,Opus 5.5 在典型任务上的成本比 Opus 5 降低 40%,输出速度提高超过 30%。
Claude Opus 5.5 的 API 价格是多少?缓存费用有变化吗?
API 输入和输出价格分别为每百万 token 4 美元和 20 美元,比 Opus 5 低 20%;缓存读取价格从 0.50 美元降至 0.20 美元,降幅达 60%。
Claude Opus 5.5 在哪些评测中表现突出?
在 Terminal-Bench 4.0 中得分 66.4%,高于 GPT-6 Astra 的 57.9%;FrontierCode v1.1 得分 54.4%;CursorBench 4.0 从 46.6% 提高到 57.8%;GDPval-AA v2.1 得到 1846 Elo,超过 Fable 5.1 的 1735;OSWorld 2.0 从 74.0% 提高到 81.8%。
Claude Opus 5.5 在长任务处理上有哪些实际案例?
早期测试者用 Opus 5.5 在一天内完成涉及 68 万行代码的迁移;另一项 20 万行代码库审计用了不到三小时,而 Opus 5 完成同类任务超过 20 小时,token 消耗约为前者的 2.5 倍。此外,将 HAProxy 从 C 语言重写为 Rust,Opus 5.5 用时 9.5 小时,Fable 5.1 用时 12 小时,前者成本低 51%。
Claude Opus 5.5 在创意编程方面有哪些社区实测案例?
Wes Bos 让模型渲染了 500 种常见健身器材,并做出一套完整的健身房搭建器;BridgeMind 用一次提示生成了可玩的 Mario Kart 游戏;Jake Eaton 让模型编写约 7500 行 Python 代码,通过标准库模拟笔刷逐像素绘制艺术风格;Ben Poole 展示了 sketch-to-simulation,将草图转化为可运行的交互模拟。
Claude Opus 5.5 在安全方面采取了哪些措施?
Opus 5.5 尝试突破限制边界的频率较 Opus 5 和 Claude Mythos 5.1 低约 85%;启用了与 Fable 5.1 相近的安全措施,大部分网络安全任务转交给 Opus 4.8,只有通过验证的安全研究人员和生命科学机构才能获得更完整的能力;还启用了防止模型蒸馏的 preserved thinking,并保留零数据留存选项;每次操作执行前都会通过分类器检查,企业安全团队可以审计其开源沙箱。