内容提要
本文介绍如何选择Claude模型。建议默认从最智能模型开始,用努力级别调节性能与成本。模型分四类:Mythos/Fable最强,适合复杂任务;Opus适合推理密集型工作;Sonnet平衡性能与成本;Haiku最快最便宜。选择时需考虑任务难度、延迟需求、访问限制和单位经济性。建议用自定义评估而非标准基准测试,并可采用顾问策略让低成本模型调用高智能模型提升效率。
延伸解读
从最强模型起步的逆向思维
文章建议默认从最智能的模型开始,再通过调节努力级别来平衡性能与成本。这看似反直觉,但更智能的模型往往能以更少的交互和思考时间完成任务,从而降低单次任务的总成本。从较小模型起步反而可能混淆模型能力不足与配置问题。对于延迟或成本敏感的场景,再逐步降级测试,直到找到合适的模型。
模型选择的关键考量因素
选择模型时需综合评估任务难度、延迟需求、访问限制和单位经济性。任务越复杂、步骤越多,越需要高能力模型;高频面向客户的工作流更适合Sonnet;Mythos仅限特定组织使用;高产量场景可能更适合低成本模型。此外,努力级别也会影响质量、速度和成本的平衡,高能力模型在低努力级别下有时比小模型更高效。
基准测试的局限与自定义评估的价值
标准基准测试在评估Opus和Fable等强大模型时可能失效,因为模型几乎能答对所有问题,导致分数饱和。文章建议使用自定义评估,即从生产环境中选取难题,由团队定义成功标准,来测试模型在真实工作负载上的表现。这种方法更能区分前沿模型的能力差异,是选择模型的重要依据。
Q&A
选择Claude模型时,默认的推荐策略是什么?
默认推荐从最智能的通用模型开始,通过调节努力级别来平衡性能与成本。更智能的模型虽然单token价格更高,但通常能减少任务所需的轮次和思考时间,从而降低单任务总成本。
Claude模型家族分为哪几类?各自有什么特点?
Claude模型家族分为四类:Mythos/Fable是最强的模型,适合复杂任务;Opus适合推理密集型工作;Sonnet平衡性能与成本,适合日常任务;Haiku最快最便宜,适合高频低延迟场景。
Mythos和Fable有什么区别?
Mythos和Fable是同一底层模型的两个版本。Mythos面向受信任的组织,用于处理双重用途的网络安全和生物学工作;Fable则增加了额外的安全措施,适合普通公众使用。两者都要求有限的数据保留。
在Opus和Fable之间如何选择?
如果评估或内部测试显示Opus在某些任务上表现不佳,则选择Fable;如果Opus已经达到质量要求,那么Opus的速度和价格可能更合适。Fable在智慧、创造力和写作方面通常更胜一筹,尽管基准分数相近。
选择Claude模型时应考虑哪些关键问题?
应考虑任务难度(是否耗时、多步骤或未解决)、延迟需求(高频客户场景适合Sonnet)、访问限制(如Mythos仅限特定组织)、以及单位经济性(高产量可能适合低成本模型)。
什么是顾问策略?它如何提升模型性能?
顾问策略是让更快、更便宜的worker模型在需要时调用更智能的模型来检查计划和评估工作,从而提升整体性能。例如,在SWE-bench Pro上,Sonnet 5配合Fable 5顾问,性能接近Fable 5,但成本仅为后者的63%。
为什么标准基准测试可能不足以评估Claude模型?
因为像Opus和Fable这样的强大模型在标准基准测试上可能接近满分(饱和),无法区分它们的实际能力。因此,建议使用自定义评估,基于真实工作负载和团队定义的成功标准来测试模型。