内容提要
Anthropic发布Opus 5.5,跑分与价格均优于Fable 5.1,但社区用户仍用Fable做规划审查,因其在陌生任务中判断更稳。跑分难测真实项目能力,且存在污染问题。实际工作流正形成分工:Fable规划审查,Opus执行实现,兼顾性能与成本。
延伸解读
跑分与实操的裂缝
文章指出,Opus 5.5在Terminal-Bench 4.0和GDPval-AA v2.1等跑分上全面领先Fable 5.1,但社区用户在实际长任务中仍依赖Fable 5.1做规划审查。例如,在私有代码库实现新功能时,Opus 5.5做出有问题的架构决策,而Fable 5.1一次跑通。这揭示了跑分衡量的是给定条件下的回答质量,而非陌生任务中的判断力,两者之间存在难以弥合的裂缝。
模型规模与判断力
文章分析,Fable 5.1属于比Opus更高一级的Mythos级模型,参数规模更大,压缩了更多训练知识。面对分布外的新任务,大模型能调用更广的内部知识,小模型则易卡在推理链条某一步。社区观察也支持这点:Fable 5.1常“直接就知道”,Opus 5.5需更多推理步骤。这解释了为何Fable在规划审查中更稳,而Opus在执行中更快更省。
成本与商业动机
Anthropic将Opus 5.5定价压至Fable 5.1的六成,输入每百万4美元、输出20美元,而Fable 5.1为10美元和50美元。文章推测,这背后有商业动机:Opus 5.5单位算力效率更高,推广它既能给用户降价,也能降低Anthropic自身服务成本。但便宜不意味着万能,跑分不测创造力和理解用户真实意图,且跑分数据集存在污染问题,如SWE-bench Verified中59.4%的问题有缺陷。
分工而非替代
真实工作流正形成两层结构:Fable 5.1负责规划、架构判断和代码审查,Opus 5.5负责编码、测试、修复和迭代。多模型编排工具如Cognition Fusion已支持这种模式,官方推荐Fable 5.1当lead,便宜模型当sidekick,可降本23%到46%。文章强调,规划需要广博知识和克制,执行需要速度和成本效率,两者要求不同,因此Fable 5.1的价值不在跑分,而在减少方向性错误。
Q&A
Opus 5.5 和 Fable 5.1 在跑分和价格上具体差多少?
Opus 5.5 在 Terminal-Bench 4.0 得分 66.4%,Fable 5.1 为 55.8%;GDPval-AA v2.1 知识工作测试中 Opus 5.5 为 1846 Elo,Fable 5.1 为 1735。价格上,Opus 5.5 每百万输入 4 美元、输出 20 美元,Fable 5.1 为 10 美元和 50 美元,Opus 5.5 便宜约六成。
为什么跑分更高的 Opus 5.5 在真实项目中反而需要 Fable 5.1 来审查?
跑分测的是给定条件下的回答质量,而非模型在陌生任务中的判断力。Fable 5.1 属于更高一级的 Mythos 级模型,参数规模更大,内部知识更广,面对分布外的新任务时更少犯方向性错误。Opus 5.5 在长时间、多轮次任务中可能“越来越自信地犯错”,因此需要 Fable 5.1 兜底审查。
社区里推荐的多模型工作流具体怎么分工?
社区推荐的工作流是:用 Fable 5.1 做规划、架构判断和代码审查,用 Opus 5.5 做具体的编码、测试、修复和迭代。总结为“用 Fable 规划,用 Opus 实现”。多模型编排工具如 Cognition 的 Fusion 系统也支持这种模式,官方推荐 Fable 5.1 当 lead,更便宜的执行模型当 sidekick,可降低成本 23% 到 46%。
Anthropic 为什么把 Opus 5.5 定价压得比 Fable 5.1 低?
社区猜测商业动机是 Anthropic 更希望用户使用 Opus 5.5,因为它在单位算力上效率更高。Fable 5.1 每百万输出 token 收费 50 美元,Opus 5.5 收费 20 美元,同样任务 Fable 5.1 消耗更多算力资源,Anthropic 需要为其保留更大计算预算。推广 Opus 5.5 既能给用户降价,也能降低自身服务成本。
跑分数据的可信度如何?有没有污染问题?
跑分可信度在下降。OpenAI 在 2026 年 2 月发布的分析显示,SWE-bench Verified 数据集存在严重污染,审查的 138 个问题中 59.4% 有实质性缺陷,包括测试用例拒绝功能正确的解法。Anthropic 自己在 Opus 5.5 发布说明中也承认,当前能力水平下跑分差距已越来越不能可靠反映真实世界差异。
Fable 5.1 在 Anthropic 产品线中扮演什么角色?为什么还没被淘汰?
Fable 5.1 是 Mythos 级模型,比 Opus 更高一级,在更广泛的专业任务上拥有更高的安全阈值,面向需要更深工具调用和更长自治周期的场景。它定义了 Anthropic 认为“旗舰级”应达到的水平,是模型迭代中的锚点。社区预判 Fable 5.5 很快会出现,届时跑分榜会再次翻转。