内容提要
本文介绍“渐进式自主”架构,通过六层系统(评分、分级、预执行、执行、后执行、交付门)缩小AI代理信任差距。代理从T1开始,基于准确性、安全性等维度评分,逐步提升权限,违规立即降级。使用Amazon Bedrock AgentCore和DynamoDB实现策略控制与审计,确保安全可靠。
延伸解读
信任差距的根源
传统IAM在配置时一次性决定权限,假设主体行为一致。但LLM代理可能周一准确、周二因提示词或模型更新产生幻觉,导致同一代理行为不稳定。因此,仅靠API日志无法提供可见性、决策溯源和可逆性,需要新的架构来动态管理信任。
安全作为独立底线
评分引擎综合五个维度,但安全维度权重20%且作为独立底线,防止强指标掩盖危险行为。这意味着即使整体分数高,只要安全分低,代理也会被降级。这种设计确保安全不可被其他性能平均掉,是信任框架的关键决策。
渐进式授权的实际运作
代理从T1开始,仅读权限,通过持续高分逐步升级,但降级立即生效。为防止振荡,升级需高于阈值5分,降级则在阈值处触发。信任状态存储在DynamoDB,每次调用读取当前层级,延迟仅毫秒级,确保实时执行策略。
多层防御与审计
预执行层在进程内快速过滤,但由执行层的Cedar策略兜底,默认拒绝。审计记录捕获行动前状态,支持恢复。交付门通过对抗性测试确保未经授权的工具调用阻止发布。生产监控使用蜜罐案例,验证工具调用轨迹而非自然语言输出,确保异常检测可靠。
Q&A
什么是AI代理的信任差距?
信任差距是指AI代理实际能执行的操作与操作者信任其执行的操作之间的距离。例如,代理可以读取客户数据、处理退款或删除账户,但团队通常只能选择完全访问或只读,导致代理的价值未被充分利用。
渐进式自主架构的六个层次是什么?
六个层次包括:评分引擎、分级系统、预执行层、执行层、后执行层和交付门。评分引擎计算信任分数,分级系统根据分数分配自主级别,预执行层在工具调用前阻止危险操作,执行层通过Cedar策略在基础设施级别强制实施,后执行层评估结果并记录审计,交付门确保降级的代理版本不会进入生产环境。
代理的自主级别是如何确定的?
代理从T1(试用期)开始,根据五个维度的加权分数(准确性、安全性、一致性、合规性、效率)在50个操作的滚动窗口内计算得分。分数达到41-70进入T2(监督),71-90进入T3(信任),91-100进入T4(自主)。提升需要持续表现,降级则立即发生,且使用滞后机制防止振荡。
预执行层如何阻止危险操作?
预执行层在工具调用前评估六个信号:对抗性注入检测、敏感目标检测、危险工具检测、行为一致性、置信度校准和推理质量。任何信号匹配都会立即阻止调用并可能施加信任惩罚。这些检查是快速的第一道过滤,但并非完全防御,由执行层的默认拒绝策略作为后盾。
执行层如何确保代理无法绕过权限?
执行层在代理进程之外,通过Amazon Bedrock AgentCore Gateway和Policy进行强制。Gateway路由所有MCP工具调用,Policy评估Cedar策略,采用禁止优先语义,即任何禁止规则都覆盖允许规则。默认拒绝,且工具列表只显示策略允许的工具,因此代理无法调用被禁止的工具。
后执行层如何支持审计和恢复?
后执行层在每次工具调用后生成审计记录,遵循思考、计划、行动、观察、评分的链条。记录包括推理链、工具选择、策略匹配、结果和信任影响。计划与行动记录捕获操作前状态,使恢复成为可能。操作者可以用自然语言查询,获得人类可读的解释。
交付门如何防止降级版本进入生产?
每次对代理的提示、配置或工具定义的更改都会触发AWS CodePipeline运行。候选版本部署到暂存环境,并使用Amazon Bedrock AgentCore Evaluations对真实基准测试,包括对抗性案例如提示注入和数据外泄。任何对抗性案例中的未授权工具调用都会导致门禁失败,只有通过的版本才成为最后已知稳定版本。
生产环境中如何监控和恢复代理?
框架将合成蜜罐案例注入一小部分流量,验证工具调用轨迹而非自然语言输出。当安全分数低于下限时,代理被降级,并重新部署最后已知稳定版本。操作者可以设置紧急停止,推送Cedar拒绝所有策略,在几秒内生效。多代理系统中,委派操作的有效级别是委派链中的最小值,防止权限提升。