半价干翻Fable 5?Opus 5实测炸场,网友:差点从椅子上摔下来

半价干翻Fable 5?Opus 5实测炸场,网友:差点从椅子上摔下来

💡 原文中文,约4900字,阅读约需12分钟。
📝

内容提要

Anthropic发布Opus 5模型,性能追平或超越Fable 5,价格仅为其一半。在编程、物理模拟等测试中表现优异,网友用它生成游戏、3D模型等。同时,Anthropic精简了Claude Code系统提示词超80%,性能未降,体现模型判断力提升。

🔎

延伸解读

性价比与性能的平衡

Opus 5在多项基准测试中追平或超越Fable 5,价格仅为后者一半。例如,在Frontier-Bench上得分43.3%,远超Fable 5的33.7%;在ARC-AGI-3上得分30.2%,而GPT-5.6 Sol仅7.8%。此外,在OSWorld 2.0上以70.6%对66.1%领先,且成本不到Fable 5的三分之一。这种性能与价格的组合,使其成为高性价比选择。

自我验证能力突出

Opus 5展现出强大的自我验证能力。在重建波音747-400的测试中,它通过提取渲染图像中的轮廓,计算翼展、轴距等14项指标,并与公开数据核对公差,而Fable 5仅靠肉眼检查。在FreeCAD重建任务中,它自行编写计算机视觉管道,从像素提取几何数据,反复成功,而其他模型五次尝试均失败。这种能力提升了输出的可靠性。

系统提示词精简的启示

Anthropic将Claude Code的系统提示词删减超过80%,编码评测成绩未降。这得益于模型判断力的提升,使得过去依赖规则和例子的做法可以简化。例如,将“默认不写注释”改为“贴合周围代码风格”,并将不常用说明拆分为技能文件,按需调用。这表明,随着模型能力增强,提示词设计可以更简洁,赋予模型更多自主判断空间。

Q&A

Opus 5 与 Fable 5 相比,在性能和价格上有哪些优势?

Opus 5 在多项基准测试中追平或超越 Fable 5,例如 Frontier-Bench 得分 43.3% 对 33.7%,ARC-AGI-3 得分 30.2% 对 7.8%,且价格仅为 Fable 5 的一半(输入每百万 token 5 美元,输出 25 美元)。

Opus 5 在编程和物理模拟方面有哪些具体表现?

在编程方面,Opus 5 在 Frontier-Bench 等测试中得分领先,并能自主编写代码解决复杂问题,如重建 3D 模型、修复开源 bug。在物理模拟方面,它能生成符合物理规律的场景,如风洞气流路径、连环机关动画,且无穿模现象。

Anthropic 如何通过精简系统提示词来提升 Claude Code 的性能?

Anthropic 将 Claude Code 的系统提示词删减超过 80%,性能未降。他们用更简洁的规则(如“贴合周围代码风格”)替代硬性规定,采用渐进式披露和模型自主记忆,让模型自行判断,从而提升效率。

Opus 5 在创意生成方面有哪些令人印象深刻的案例?

网友用 Opus 5 生成了可玩的 Rocket League 克隆版、3D 细胞结构图、滑雪场景、Minecraft 复刻、阿波罗任务点火动画等,甚至仅用一个 HTML 文件生成从 1945 年到 2055 年的动态街区,效果超越其他模型。

Opus 5 在成本效益上相比 Fable 5 如何?

Opus 5 价格仅为 Fable 5 的一半,且在多个任务中成本更低。例如,在三个破坏场景测试中,Opus 5 花费 0.508 美元全部做对,而 Fable 5 花费近两倍且出错。

Opus 5 在自我验证和复杂任务处理上有何独特之处?

Opus 5 能自主构建验证流程,如从渲染图像中提取轮廓并核对 14 项指标,或自建测试环境验证代码。在 FreeCAD 重建任务中,它自写视觉管道成功提取几何数据,而其他模型五次尝试均失败。

Opus 5 在安全性和开放性方面有哪些改进?

Opus 5 的预计触发拦截频率比 Fable 5 降低约 85%,意味着更少的限制,更开放。这缓解了用户对 Fable 5 过度安全护栏的不满。

🏷️

标签

➡️

继续阅读