内容提要
Anthropic宣布Claude Code的自动模式将于8月14日成为Pro、Max和Team用户的默认设置。该模式利用分类器模型识别危险操作,减少人工审批。研究显示,人类仅能发现13.6%的危险命令,而自动模式可捕捉89%。系统设有硬性拒绝规则,防止数据外泄,并增强提示注入防护。测试中,自动模式成功阻止所有攻击,优于OpenAI的GPT-5.6。此外,并行Claude Code会话现可互相通信,共享摘要以提高效率。
延伸解读
人类审批的局限性
Anthropic的研究显示,人类在长时间会话中容易疲劳,导致对危险命令的识别率从13.6%降至5%。这揭示了依赖人工审批的潜在风险,尤其是在多小时的自动化任务中。自动模式通过减少审批次数,让用户更专注于真正需要判断的请求,从而提升整体安全性。
自动模式的防护机制
自动模式不仅依赖分类器,还引入了硬性拒绝规则,防止数据外泄,并检查git操作的目标仓库属性。此外,API侧探针可检测提示注入攻击。这些机制共同构成了多层防御,但Anthropic也强调,自动模式是降低风险而非消除风险,高风险的变更仍需人工监督。
与竞品的对比
在第三方测试中,Claude的自动模式成功阻止了所有720次攻击,而OpenAI的GPT-5.6在完全访问模式下漏掉了19%的攻击。这一对比凸显了自动模式在提示注入防护上的优势,但测试条件可能偏向Anthropic,因此结果需谨慎解读。
Q&A
Claude Code的自动模式什么时候成为默认设置?
从8月14日起,自动模式将成为Claude Code Pro、Max和Team用户的默认设置。
为什么Anthropic要把自动模式设为默认?
因为研究发现人类在频繁权限提示下表现不佳,会习惯性批准,仅能发现13.6%的危险命令,而自动模式能捕捉89%的危险命令,因此自动模式更可靠。
自动模式如何决定是否需要人工干预?
自动模式使用一个独立的分类器模型来评估命令的危险程度,当命令被标记为危险时,自动模式会阻止该命令,而不是请求许可,并尝试寻找更安全的替代方案或返回用户请求明确批准。
自动模式有哪些安全防护措施?
自动模式包含硬性拒绝规则,防止数据外泄,例如发送代码或秘密到外部目的地;检查git push或pull request的目标是公共、私有还是可信;在破坏性命令前检查git状态;并通过API侧探针检测提示注入攻击。
自动模式在测试中表现如何?
在红队测试中,自动模式在加固前漏掉12%的攻击,加固后漏掉率降至7%。在第三方测试中,自动模式成功阻止了所有720次提示注入攻击,而OpenAI的GPT-5.6 Sol在Codex中允许19%的攻击通过。
自动模式有什么局限性?
Anthropic指出自动模式是一个分类器,不是保证,它降低风险但不能消除风险。对于生产基础设施的高风险更改,仍建议保持人工参与。
Claude Code的并行会话之间如何通信?
并行Claude Code会话现在可以互相发送消息,通过发送摘要(不包括历史或文件)让其他会话在任务中接收,从而避免重复解释。