Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

💡 原文中文,约5000字,阅读约需12分钟。
📝

内容提要

Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。

🔎

延伸解读

拒绝率高的背后:安全与实用的权衡

Fable 5.1 在生物学推理上表现优异,但 LatchBio 测试显示其拒绝率极高,尤其对人类基因组和病原体相关任务。这反映了 Anthropic 在安全与实用性之间的权衡:宁可误杀合法请求,也不愿冒险被恶意利用。对于研究者而言,这意味着需要准备回退方案,以应对任务中途被拒的情况。

拒绝行为的规律:风险分级与政策判断

Fable 5.1 的拒绝并非随机,而是基于风险分级:病原体相关任务几乎全拒,人类基因组解释大量被拒,而模式生物和方法论任务则较少受限。这体现了 Anthropic 的政策判断,将红线画在“人类”相关任务上,可能影响人类遗传病研究者的工作流程。

中途拒绝机制:模型自我审查的体现

LatchBio 发现,部分拒绝发生在模型已开始分析之后,平均输出约 1900 个 token 才阻断。这表明模型在执行过程中进行自我审查,意识到任务超出允许范围。这种能力虽体现模型对边界的认知,但也增加了结果的不确定性,用户难以预测何时会被中断。

Q&A

Claude Fable 5.1 在生物学推理方面有哪些具体进步?

Fable 5.1 在生物学推理上表现突出,例如能正确应用工具过滤阈值、整合多个数据源时具有怀疑精神、考虑统计约束、正确使用单倍体等生物学常识。在 LatchBio 的测试中,它比 Opus 5 更准确地处理了结构变异计数、孔位效应、差异表达等任务。

Fable 5.1 的拒绝率高吗?主要拒绝哪些类型的任务?

是的,Fable 5.1 的拒绝率很高。LatchBio 测试显示,在 TxBench-PP 基准中 100 个任务只答了 7 个,所有长周期任务 100% 拒绝。主要拒绝病原体生物学相关任务(如病毒逃逸、抗菌素耐药性)、人类基因组解释(如疾病拷贝数、变异对药物反应的影响)等,而方法论构建、模式生物(如斑马鱼)相关任务则较少拒绝。

Fable 5.1 的拒绝机制是怎样的?

Fable 5.1 的拒绝机制有两种:即时拒绝和中断拒绝。即时拒绝由输入安全分类器在模型处理前拦截;中断拒绝发生在模型开始分析后,平均输出约 1900 个 token、约 500 个思考 token、执行 4 条 bash 命令后才阻断输出,其中 40% 的中断拒绝发生在打开 .h5ad 文件后,表明模型在任务执行过程中进行自我审查。

Fable 5.1 和 Mythos 5.1 有什么区别?

Fable 5.1 和 Mythos 5.1 是同一个模型,区别在于安全护栏级别。Fable 5.1 面向大众开放,而 Mythos 5.1 仅对经过审核的网络安全和生命科学机构开放,且完整版目前仅限美国机构使用。

Fable 5.1 在基准测试中的表现如何?

Fable 5.1 在多个基准测试中表现优异:Terminal-Bench-Science 0.1 得分 52.6%,是上一代 Fable 5(24.7%)的两倍多;Terminal-Bench 4.0 得分 55.8%,超过 Opus 5 的 52.3%;GDPval-AA v2 得分 1853 分,高于 Opus 5 的 1824 分。

Fable 5.1 的成本相比前代有何变化?

Fable 5.1 的缓存读取价格从 1 美元降至 0.25 美元,降幅 75%;整体成本比 Fable 5 低 25%,高强度智能体任务最多可节省 45%。

Fable 5.1 的安全护栏误报率有何改进?

Anthropic 表示,Fable 5.1 的生物学安全护栏对良性请求的误报率比 Fable 5 时期降低了 85%,网络安全护栏的误报率降低了 60%。但 LatchBio 的数据显示,拒绝仍然大规模存在。

为什么 Fable 5.1 会拒绝人类基因组相关任务?

Fable 5.1 的拒绝规则基于风险判断,人类基因组解释被视为中等风险,因此被拒绝。这反映了 Anthropic 的政策判断:人类基因组信息更容易被滥用,因此设置更严格的安全限制,而模式生物(如斑马鱼)风险低,则较少拒绝。

🏷️

标签

➡️

继续阅读