Opus 5是个优化怪兽:任意X直逼目标Y的爬山优化全搞定!

Opus 5是个优化怪兽:任意X直逼目标Y的爬山优化全搞定!

💡 原文中文,约3900字,阅读约需10分钟。
📝

内容提要

Opus 5是Anthropic推出的半价旗舰模型,性能超越Fable 5,在编程、科学等基准测试中表现优异,但输出风格别扭遭吐槽。它擅长爬山优化,成本更低,NVIDIA通过脚手架使其在ARC-AGI 3上获满分。定价冲击市场,OpenAI被迫降价,开发者视其为日常默认模型,但其安全性和自主性仍存争议。

🔎

延伸解读

爬山优化:Opus 5 的隐藏强项

开发者社区发现,Opus 5 在“爬山优化”任务上表现出色,即通过迭代分析器和数据集,不断调整 X 以达到目标 Y。这类任务包括优化 CPU 和内存使用、缩短 CI 时间、提升帧率、降低延迟等。Opus 5 像一个不知疲倦的优化器,能高效地逼近目标。这一特性可能比其在基准测试中的分数更具实用价值,尤其对于需要持续性能调优的工程团队。

成本悖论:更聪明反而更省钱

尽管 Opus 5 在编码任务中消耗的 token 数略多于 Fable 5,但由于其单价减半,实际成本反而更低。这打破了“更聪明模型用更少 token”的直觉。开发者 Theo 指出,更聪明的模型可能用更多 token,但总成本更低。这意味着,在选择模型时,不能仅看 token 消耗,还要结合单价和任务完成质量,综合评估性价比。

安全与自主性的权衡

Opus 5 的安全分类器触发次数预计比 Fable 5 减少约 85%,这使其在安全敏感任务上显得“不够严格”,但也为开发者提供了更宽松的操作空间。然而,Anthropic 承认 Opus 5 在长时间自主科研任务上仍有局限,尤其在将漏洞转化为攻击工具方面落后于 Mythos 5。NVIDIA 的实验表明,通过外部“脚手架”可以大幅提升其性能,但也引发了对自主性增强可能带来风险的担忧。

Q&A

Opus 5 的定价和性能相比 Fable 5 如何?

Opus 5 的输入价格是每百万 token 5 美元,输出价格是 25 美元,正好是 Fable 5 的一半。在 Frontier-Bench v0.1 上,Opus 5 得分 43.3%,而 Fable 5 为 33.7%,性能反而更强。

为什么开发者称 Opus 5 为“优化怪兽”?

因为 Opus 5 在爬山优化任务中表现出色,例如优化 CPU 和内存使用、缩短 CI 时间、提升帧率、降低延迟等,任何“在 X 上迭代直到达到 Y 目标”的问题它都能高效解决。

Opus 5 的输出风格有什么问题?

Opus 5 的输出风格极其别扭,像被迫加班的顶级工程师,满腹牢骚但干活不含糊。用户经常需要借助另一个模型把它的“鸟语”翻译成人类能懂的语言。

为什么更聪明的模型反而更省 token?

因为 Opus 5 虽然每任务消耗约 37000 token,比 Fable 5 多 4000 token,但单价只有一半,实际成本 2.30 美元,低于 Fable 5 的 2.75 美元。此外,Opus 5 通过师生蒸馏从 Mythos 提炼,是真正更小的模型,效率更高。

NVIDIA 如何让 Opus 5 在 ARC-AGI 3 上获得满分?

NVIDIA 使用定制“脚手架”,包括优化内存管理和类似“老板”的监督组件,让 Opus 5 在 ARC-AGI 3 上拿到 100% 满分,而没有脚手架时只能搞定 30%。

Opus 5 的发布对 AI 市场产生了什么影响?

Opus 5 的定价冲击导致 OpenAI 在 2026 年 8 月 22 日宣布 GPT-5.6 Sol 降价超过 20%。开发者开始质疑更贵的模型是否还是默认选择,Opus 5 成为许多开发者的日常默认模型。

Opus 5 在安全性和自主性方面存在哪些争议?

Opus 5 的安全分类器触发次数比 Fable 5 减少约 85%,允许查漏洞但禁止二进制扫描与漏洞利用生成,被一些用户认为“不够安全”。同时,它在长时间自主执行科研任务方面仍有限制,但 NVIDIA 实验显示脚手架可能提升其自主能力,引发安全担忧。

🏷️

标签

➡️

继续阅读