Anthropic的Opus 5几乎媲美Fable 5

Anthropic的Opus 5几乎媲美Fable 5

💡 原文英文,约1400词,阅读约需5分钟。
📝

内容提要

Anthropic发布Opus 5模型,性能接近旗舰Fable 5,价格减半,且无需数据保留政策。它在知识工作、编码和自动化基准上表现优异,部分超越Fable 5,但Fable 5仍适合长期自主任务。Opus 5注重安全,限制网络攻击功能,并推出自动回退和工具切换更新,现已上线。

🔎

延伸解读

性价比定位:Opus 5的定价策略

Opus 5的定价与Opus 4.8相同,为每百万输入/输出token 5/25美元,但性能接近旗舰Fable 5,价格却只有后者的一半。这一策略明显针对企业对token成本的敏感度,旨在以更低的成本提供接近旗舰的性能,可能吸引更多企业采用。

安全限制的权衡

Opus 5在安全方面进行了刻意设计,未训练网络攻击任务,并配备更窄范围的安全分类器,干预频率预计比Fable 5低85%。这允许防御性工作如漏洞发现,但阻止恶意利用。企业可通过Cyber Verification Program获得限制更少的版本,体现了安全与功能的平衡。

性能对比中的关键差异

在多数基准测试中,Opus 5超越Fable 5,但在无工具环境下Fable 5仍领先,且Fable 5更适合长期自主任务。这表明Opus 5适合日常知识工作和编码,而Fable 5仍是复杂长期项目的首选。用户应根据任务需求选择模型。

Q&A

Anthropic的Opus 5模型与Fable 5相比,在价格和性能上有什么特点?

Opus 5的价格是Fable 5的一半,输入/输出token成本为$5/$25每百万,与Opus 4.8相同。在多数基准测试中,Opus 5的性能接近甚至超过Fable 5,但Fable 5在需要数天自主性的长期任务上仍更胜一筹。

Opus 5在哪些基准测试中表现优于Fable 5?

Opus 5在GDPval-AA v2知识工作基准上得分1861,高于Fable 5的1747;在Zapier的AutomationBench上,其通过率是同等成本下第二好模型的两倍;在DeepSearchQA和Humanity's Last Exam(带工具)上,Opus 5以64.7%对63.9%超过Fable 5。

Opus 5在安全方面有哪些特殊设计?

Opus 5没有针对网络安全任务进行训练,并配备了安全分类器,用于筛选涉及漏洞利用和渗透测试等网络攻击的请求。这些分类器的范围比Fable 5更窄,预计干预频率降低约85%,以允许防御性工作,同时阻止恶意行为。

Opus 5的自动回退功能是什么?

自动回退功能允许API请求在Opus 5或Fable 5的安全分类器拒绝时,自动路由到另一个模型(如Opus 4.8),而不是返回错误。该功能在Claude.ai、Claude Code和Cowork中默认启用,API用户也可以开启。

Opus 5在编码方面的表现如何?

Opus 5在CursorBench 3.2上,在高、超高和最大设置下,性能成本比优于所有其他模型;在最大努力下,其得分与Fable 5的峰值相差不到0.5%,但成本仅为后者的一半。

Opus 5的“快速模式”有什么特点?

Opus 5提供“快速模式”,可在Claude Platform和Claude Code中使用,输出token速度提高2.5倍,但成本增加2倍。

Opus 5与GPT-5.6 Sol相比,在基准测试中表现如何?

在Anthropic分享的基准测试表中,Opus 5在除DeepSWE v1.1(Sol以72.7%对68.8%领先)之外的所有基准上都超过Sol,包括知识工作、计算机使用和业务工作流。

🏷️

标签

➡️

继续阅读