零风险并非目标:CISO代理式AI指南

零风险并非目标:CISO代理式AI指南

💡 原文英文,约3300词,阅读约需12分钟。
📝

内容提要

安全主管在代理式AI时代应管理风险而非追求零风险。通过四个问题评估代理风险:摄入内容、可执行操作、影响范围、可观测性。采用最小权限原则,区分服务账户与人类凭证,实施身份管理、连接器白名单、沙箱执行、出口白名单、遥测监控等控制措施。治理不应成为瓶颈,需设计适应模型演进的协议,主动接受可控风险。

🔎

延伸解读

治理的平衡:拒绝与失控之间

文章指出,对代理式AI用例简单说“不”会导致影子采用,失去可见性和控制;而说“是”但缺乏控制则可能引发事故。CISO的目标不是零风险,而是让风险可理解、可界定,从而主动接受可控风险。这要求安全团队在审批时提供清晰的框架,而不是成为业务创新的瓶颈。

代理身份光谱:责任归属的关键

代理系统在身份访问模型上处于两个极端:系统服务账户(单一用途、最小权限)和人类凭证(个人负责)。中间地带——代理携带人类委派身份进入人类未监控的系统——会导致责任模糊,使事故难以解释。因此,明确代理的身份类型和责任人,是治理的重要环节。

模型演进带来的新风险

文章通过案例说明,模型能力提升可能带来未预期的行为,如代理在无人监督时自主发起代理间通信。这要求安全设计不能基于当前模型限制,而应预设能力会扩展,并确保控制措施(如最小权限、人工审批)能适应这种演进。

从低风险用例开始建立治理能力

文章建议,组织应选择内部压力最大的代理用例,用四个问题评估风险,并测试七项控制要求(如身份管理、连接器白名单、沙箱执行等)。通过先在低风险场景中建立治理能力,才能在更高自主性的用例到来时做好准备。

Q&A

CISO在代理式AI时代应该追求零风险吗?

不应该。CISO的责任不是实现零风险,而是让代理式AI的风险变得可理解和有边界,从而有意识地接受可控的风险,让业务按自己的节奏前进,而不是绕过安全团队。

评估代理式AI风险时应该问哪四个问题?

四个问题是:1. 它摄入了哪些不受信任的内容?2. 它能采取什么行动,代表谁?3. 如果它偏离对齐,影响范围有多大?4. 我有什么可观测性?

什么是“最小代理权限”原则?

最小代理权限原则是指授予代理完成特定任务所需的最窄能力,即只给代理完成工作所必需的最小权限,以降低风险。

代理式AI的身份谱系两端分别是什么?

一端是系统服务账户,即自包含、单一用途、最小权限的身份,不关联人类身份;另一端是人类凭证,即员工使用个人代理时,由键盘前的人对结果负责。中间地带是代理携带人类委派身份进入人类未监控的系统,这会导致责任模糊。

Anthropic的应急响应代理案例说明了什么?

案例说明,通过四个问题评估风险并实施控制,代理可以在有界范围内运行。同时,随着模型升级,代理出现了新的能力(如代理间通信),但控制措施仍然有效,因为人类在环上,且写入操作需要人工审查。

Claude Cowork中如何实施连接器白名单?

Claude Cowork采用双重门控模型:管理员在组织范围内启用每个连接器,然后每个用户单独授权自己的账户。还有按角色控制连接器的功能,因此启用连接器决定了代理可以访问哪些数据。

为什么出口白名单是抵御提示注入的最强控制?

因为如果代理被其读取的内容入侵,攻击者仍然需要将数据带出,而当出站请求只能到达你选择的域名时,攻击者就没有地方可以发送数据。

治理如何避免成为代理式AI的瓶颈?

治理不应成为瓶颈,可以采取以下措施:首先更新风险登记册,使其能跟上系统变化;理解谁构建了代理以及为什么构建,避免影子采用;确保人类问责是工作流程的一部分,例如通过ISO 42001和风险委员会。

设计安全协议时如何考虑模型智能的演进?

设计安全协议时,不要基于模型当前的能力,而应设计为适应模型未来六个月的发展。因为模型智能提升会带来更多自由度,并使精心设计的提示词变得过时,如果依赖这些作为控制,它们将被移除,导致失去控制点。

开始实施代理式AI安全框架的三个起点是什么?

三个起点是:1. 选择内部压力最大的代理用例,用四个问题评估,找出批准的条件;2. 将七项要求带给现有供应商,询问他们能否在现有技术栈中实现;3. 确定信任边界,明确哪些内容算作不受信任的内容。

🏷️

标签

➡️

继续阅读