内容提要
赛潍是北美大型生鲜电商,运维面临巡检、根因分析、新服务上线三类高频工作。文章介绍其用 AgentCore Harness 构建 AIOps 智能体:通过 instructions、memory、tools、skills 等配置项定制领域 Agent,借助 Gateway 统一工具接入与权限管控,支持按调用触发、独立 microVM 隔离、版本灰度与回滚,并落地巡检、根因分析、上线自动化三个场景。
延伸解读
领域专属 Agent 的配置化思路
文章指出,现成 Harness 多针对编程场景优化,其记忆策略、上下文注入和工具集不一定适合运维。AgentCore Harness 将领域属性拆为 instructions、memory、tools、skills 等配置项,让团队能按巡检、根因分析等不同任务灵活组合。这种配置化方式降低了构建领域专属 Agent 的门槛,但需注意配置项本身仍需结合业务理解来设计,并非开箱即用。
权限约束必须落在代码与配置层
运维 Agent 权限风险高,文章强调不能仅靠提示语限制,因为工具返回的数据可能包含诱导性文本。约束应通过 Gateway 的入站/出站认证、Credential Provider 和 3LO 等机制在代码和配置层实现。同时,凭证绝不能进入模型上下文,且需支持以用户身份调用,确保数据访问范围与工程师本人权限一致。这些设计对生产环境安全至关重要。
运行隔离与成本控制机制
针对巡检、根因分析、上线等不同触发方式,AgentCore Harness 按调用触发,每个会话运行在独立 microVM 中,避免常驻服务资源空占和并发干扰。通过 maxIterations、timeoutSeconds、maxTokens 等参数可控制单次执行边界,防止异常重试消耗过多 Token。对于步骤依赖强的流程,还可嵌入 Step Functions 编排,兼顾灵活性与可控性。
灰度验证与迭代闭环
运维 Agent 的输出质量难以即时验证,漏报可能直到事故才暴露。文章介绍 Harness 支持不可变版本和命名端点,可实现灰度对比与快速回滚。结合 AgentCore Evaluations 的数据集评估,能用历史问题资源提前检验新版本发现能力。Optimization 则基于真实 Trace 自动改进提示词和工具描述,形成跑、打分、建议、A/B 验证的闭环,提升迭代效率。
Q&A
赛潍的运维团队主要面临哪三类高频工作?
赛潍运维团队长期面对三类高频、重复且依赖经验的工作:日常巡检、问题的根因分析、新服务的上线配置。
AgentCore Harness 通过哪些配置项来定制领域专属 Agent?
AgentCore Harness 把领域属性拆成配置项:instructions 放固定的角色定义和流程规范;memory 管长期信息的存取,提供 SEMANTIC、SUMMARIZATION、USER_PREFERENCE、EPISODIC 四种策略;tools 声明能调什么,可挂 Gateway、远程 MCP Server、内联函数等;skills 是一组可复用的指令集合,支持从本地路径、S3 或 Git 加载。
自建 Agent 时,如何给 Agent 流程排错?
要定位问题,必须看那次执行的完整交互流:每一轮模型收到的输入、输出、调用的工具、工具返回结果以及下一步推理。AgentCore Harness 每次调用自动产生 Trace、日志和指标进 CloudWatch,模型调用、工具调用、记忆读写、命令执行每一步都带时间戳和载荷细节,无需额外埋点。开发阶段可用 agentcore dev 起本地开发服务器和 Agent Inspector 在浏览器里对话、看 Trace。
AgentCore Gateway 如何解决 Agent 安全使用外部系统和工具的问题?
AgentCore Gateway 是 Agent 访问工具的统一安全入口:入站认证控制谁能访问 Gateway,出站认证负责 Gateway 如何访问后端工具。凭证由 Credential Provider 管理,API Key 和 OAuth 凭证存在这里,Gateway 调用后端时自行注入,模型全程看不到凭证内容。以人的身份调用通过 MCP target 层面的三方 OAuth(3LO)实现,Harness 向下游传播用户身份需使用 Bearer JWT 入站认证路径。Gateway 还支持工具语义化检索,避免所有工具定义塞进上下文。
AgentCore Harness 如何控制 Agent 的运行资源,避免无限循环或 Token 浪费?
AgentCore Harness 按调用触发,每个会话运行在独立的 microVM 里,按生命周期配置释放。可通过参数控制运行:maxIterations 最大迭代次数、timeoutSeconds 总时长、maxTokens Token 预算、idleRuntimeSessionTimeout 空闲超时、maxLifetime 会话最大生命周期。其中 maxIterations、timeoutSeconds 和 maxTokens 可在 Harness 上设默认值,也能在单次调用时覆盖。三个场景可共用一个 Harness,但为每次调用设置不同的迭代次数、总时长和 Token 预算。
如何验证新版 Agent 的效果,确保没有退化?
AgentCore Harness 支持不可变版本和命名端点,可让新旧两个版本同时跑在不同端点上,用同一批资源做输入,对比输出差异;确认有问题直接把端点指回旧版本即可回滚。AgentCore Evaluations 接 Agent 的 Trace,用 LLM-as-a-Judge 按评估器打分,支持在线、按需和批量评估。数据集评估支持基于测试数据集运行 Agent,可把历史上出过问题的资源整理成数据集,提示语改完先跑一遍,直接看新版本能否发现已知问题。AgentCore Optimization 还能分析失败模式,自动生成改进后的系统提示词和工具描述,并支持 A/B 测试。
赛潍在三个运维场景中如何落地 Agent?
日常巡检:EventBridge Scheduler 按计划触发,调用 Harness 执行巡检任务,Agent 依次调用 Gateway 后面的采集工具获取基础设施状态数据,汇总分析后输出巡检报告并推送到协作渠道。根因分析:输入是工程师的自然语言描述,Agent 先调用监控工具确认现象,再查询日志系统寻找异常模式,然后检查部署记录和配置变更,最终输出带证据链的分析。新服务上线:Agent 依次调用 GitHub API 完成仓库配置、调用 DNS 管理接口配置域名解析、调用 CI/CD 系统建立流水线、触发部署并验证结果,涉及写操作,权限约束更严格,生产环境部署需人工审批。