Anthropic发布Claude Sonnet 5.5,首次在Sonnet层级引入三阶段网络安全分类器与模型回退机制。该模型整体能力未突破前沿,但网络安全技能接近Opus 5,在Terminal-Bench 4.0上得分70.6%,超过Opus 5.5。被拦截的网络安全请求会回退至Sonnet 5处理,但API开发者需自行启用。测试显示,回退请求中12.01%遭提示注入攻破,远高于Sonnet 5.5自身的极低比例。Anthropic正调整分类器以减少误报。
完成下面两步后,将自动完成登录并继续当前操作。