Fable 5.1 对比 Fable 5:真实预算下的结果,而非规格表上的数据

Fable 5.1 对比 Fable 5:真实预算下的结果,而非规格表上的数据

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

Anthropic称Claude Fable 5.1在科学基准测试中得分52.6%,远超旧版24.7%。但作者以普通用户条件自测五个任务,得分仅0%和20%,远低于官方数据。新版虽更快更省钱,日常使用中两版差异不大,官方高分依赖专用环境和充足预算。

🔎

延伸解读

官方高分背后的条件差异

Anthropic公布的52.6%得分是在特定条件下取得的:每个任务允许最多8小时,且未公开所用测试框架和预算。独立排行榜测试Fable 5时,通过Claude Code以最大努力运行,210次尝试共花费14,180美元,平均每次约67美元。普通用户通常没有这样的时间和资金投入,因此官方分数与日常体验可能存在较大差距。

自测结果与官方数据的对比

作者从公开的70个任务中选取5个,在普通终端环境下运行,设置12美元成本和60轮限制。最终Fable 5.1仅通过1个数学任务,得分20%;Fable 5全部失败,得分0%。而官方数据显示Fable 5.1为52.6%,Fable 5为24.7%。虽然样本小,但方向一致:新版更强,但绝对水平远低于宣传。

成本与效率的实际表现

在自测中,Fable 5.1失败得更快、更便宜,从未触及12美元成本上限;而Fable 5有四次达到成本限制。例如在数学任务中,Fable 5.1花费1.96美元通过,Fable 5两次尝试分别花费4.20和6.38美元均失败。对于预算有限的用户,新版在控制开销方面可能更有优势。

对普通用户的参考意义

作者认为,普通用户在日常使用中可能感受不到两版模型的显著差异。官方高分依赖于专用测试框架、充足时间和高预算。如果工作场景与基准任务相似,那么测试环境和预算对结果的影响不亚于模型本身。因此,看待基准分数时需结合自身实际条件。

Q&A

Anthropic 公布的 Fable 5.1 在 Terminal-Bench-Science 上得分 52.6%,这个分数是怎么来的?

这个分数来自 Anthropic 在特定条件下对全部 70 个任务、每个任务三次试验的测试。基准允许每个模型每个任务最多运行八小时,但 Anthropic 没有说明它使用的测试框架或预算。

普通用户自己跑 Terminal-Bench-Science 任务,结果和官方分数差多少?

作者以普通用户条件(每个任务 12 美元预算、60 轮对话限制)测试了五个任务,Fable 5 得分 0%,Fable 5.1 得分 20%,都远低于官方公布的 24.7% 和 52.6%。

Fable 5.1 和 Fable 5 在日常使用中主要区别是什么?

日常使用中两版差异不大。唯一明显的区别是成本:Fable 5.1 失败得更快、更便宜,从未触及作者的 12 美元成本上限,而 Fable 5 四次触及上限。

为什么官方基准分数可能无法在普通用户手中复现?

官方分数是在专用测试框架、每个任务长达八小时以及充足预算下获得的。普通用户通常没有这些条件,因此实际表现可能远低于官方数据。

作者测试中 Fable 5.1 唯一通过的任务是什么?

唯一通过的任务属于数学领域。Fable 5.1 用了 27 轮、11.8 分钟、27,088 个输出 token,花费 1.96 美元通过;而 Fable 5 两次尝试均失败。

作者的测试结果能否证明或反驳 Anthropic 关于性能翻倍的说法?

不能。作者只测试了五个任务,样本太小,即使官方分数完全正确,得到这样的结果也是可能的。因此这次测试既不能证实也不能反驳翻倍的说法,但方向一致:新版模型表现更好。

🏷️

标签

➡️

继续阅读