内容提要
Anthropic发布Claude Sonnet 5.5,首次在Sonnet层级引入三阶段网络安全分类器与模型回退机制。该模型整体能力未突破前沿,但网络安全技能接近Opus 5,在Terminal-Bench 4.0上得分70.6%,超过Opus 5.5。被拦截的网络安全请求会回退至Sonnet 5处理,但API开发者需自行启用。测试显示,回退请求中12.01%遭提示注入攻破,远高于Sonnet 5.5自身的极低比例。Anthropic正调整分类器以减少误报。
延伸解读
回退机制的实际影响
Sonnet 5.5 引入的模型回退机制意味着被网络安全分类器拦截的请求会转由 Sonnet 5 处理。但 API 开发者必须自行启用该功能,否则请求会被直接终止。这导致从 Sonnet 5 升级到 5.5 并非简单的模型替换,开发者需要评估回退对工作流的影响,并确保应用能妥善处理请求被拦截或转由旧模型处理的情况。
提示注入风险加剧
回退机制引入了新的安全弱点:提示注入。Anthropic 测试显示,在编码环境中,25% 的请求因触发网络安全拦截而被转给 Sonnet 5,其中 12.01% 的转交请求被成功攻破。相比之下,Sonnet 5.5 自行处理的 5901 个请求中仅有 4 个被攻破。使用回退的团队必须同时考虑旧模型 Sonnet 5 的安全防护能力。
误报与合法工作受阻
Anthropic 表示用户应预期比 Sonnet 5 更多的拒绝,包括合法的网络安全工作。分类器会审查模型读取的所有内容,包括记忆、连接器内容、网络搜索结果和文件,因此非用户输入的内容也可能触发回退。Anthropic 正在调整分类器以减少误报,并计划通过扩展的 Cyber Verification Program 为经过验证的防御者提供限制更少的访问,但 Sonnet 5.5 在发布时尚未纳入该计划。
Q&A
Claude Sonnet 5.5 在网络安全方面有什么新变化?
Claude Sonnet 5.5 是首个在 Sonnet 层级引入三阶段网络安全分类器和模型回退机制的模型。其网络安全技能接近 Opus 5,在 Terminal-Bench 4.0 上得分 70.6%,超过 Opus 5.5 的 66.4%。被拦截的网络安全请求会回退至 Sonnet 5 处理。
Sonnet 5.5 的网络安全分类器是如何工作的?
分类器分三阶段:首先探测模型内部激活,然后运行在 Sonnet 5.5 上的轻量级分类器,最后是一个独立训练的 LLM 分类器,结合探测结果决定是否阻止对话。
API 开发者需要自己启用回退功能吗?
是的,Anthropic 自家应用会自动将拦截的网络安全请求发送给 Sonnet 5,但 API 开发者必须自行启用回退功能。其他平台可能处理方式不同。
回退机制可能带来哪些安全风险?
回退机制可能引入提示注入风险。测试显示,回退请求中 12.01% 遭提示注入攻破,而 Sonnet 5.5 自身仅 4/5901 被攻破。此外,25% 的请求因触发分类器被转给 Sonnet 5。
哪些类型的请求会被阻止且没有回退?
生物、常规武器和反蒸馏分类器的阻止会直接终止请求,没有回退模型。这些阻止是透明的,不会暗中改变模型响应。
Anthropic 如何减少误报并支持合法安全研究?
Anthropic 正在调整 Sonnet 5.5 的分类器以减少误报,并计划通过扩展的 Cyber Verification Program 让经过验证的防御者以更少限制访问模型。