Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。

🔎

延伸解读

基准测试与真实任务的差距

文章指出,基准测试如Terminal-Bench-Science的得分提升(从24.7%到52.6%)并不总能转化为真实工作场景的改进。作者用四个模拟日常工作的任务测试,发现新旧模型准确率均为满分,仅在速度和成本上有细微差异。这提醒读者,依赖基准分数评估模型时需谨慎,实际效果可能因任务类型而异。

升级的性价比考量

尽管Fable 5.1在部分基准上表现翻倍,但在日常任务中与旧版几乎无差别,甚至在复杂任务中更慢更贵(多花2倍成本)。对于主要进行代码修复、数据清洗等工作的用户,升级可能不会带来明显收益。建议根据自身任务类型评估升级必要性,而非盲目追求新版本。

成本与速度的权衡

测试显示,Fable 5.1在简单任务上略快,但在复杂任务中因多轮交互导致输入token激增,成本反而更高。文章强调,缓存读取价格下降75%的优惠在短任务中未体现,实际成本可能因使用场景而异。用户需关注token消耗和缓存机制,以优化成本。

Q&A

Claude Fable 5.1 相比 Fable 5 在基准测试上有哪些提升?

在 Terminal-Bench-Science 基准测试中,Fable 5.1 的得分是 52.6%,而 Fable 5 只有 24.7%,得分翻倍。

作者用哪些真实任务测试了 Claude Fable 5.1 和 Fable 5?结果如何?

作者测试了四个任务:数据清理、代码调试、数学问题解决和更复杂的传感器数据处理。结果两个模型在所有任务上都表现完美,准确率均为满分,没有明显差异。

在复杂任务中,Claude Fable 5.1 和 Fable 5 哪个更快更便宜?

在作者设计的复杂任务中,Fable 5 反而更快更便宜:Fable 5 用时 23.9 秒,花费 0.134 美元;Fable 5.1 用时 28.4 秒,花费 0.304 美元。

作者认为 Claude Fable 5.1 的改进主要体现在哪些方面?

作者认为改进可能主要体现在长时研究型任务上,例如 Terminal-Bench-Science 所模拟的长时间、多步骤的研究任务,而不是日常的代码修复、数据清理等任务。

作者对 Claude Fable 5.1 的升级持什么态度?

作者认为对于日常任务,升级到 Fable 5.1 意义不大,因为在实际测试中两者表现几乎相同;但对于长时研究型任务,Fable 5.1 可能有明显提升。

作者在测试中发现了哪些关于 Claude Fable 5.1 的意外结果?

意外结果包括:在复杂任务中,Fable 5 比 Fable 5.1 更快更便宜;Fable 5.1 使用了更多 token 和成本,但准确率并未提升。

🏷️

标签

➡️

继续阅读