内容提要
Harness推出AI Agent开发生命周期服务,将应用代码的治理、测试和安全机制应用于AI代理部署。通过质量门控、评估分数和可追溯记录,解决代理非确定性输出问题,同时提供安全工具应对动态攻击面,使代理在生产环境中更可靠。
延伸解读
非确定性带来的测试挑战
文章指出,AI代理的底层模型每次可能选择不同工具或动作,导致相同输入产生不同输出。这意味着传统确定性测试无法保证结果可复现,一次通过的测试下次可能失败。因此,Harness建议不要试图让代理本身可预测,而是让围绕它的管道可预测,通过质量门控和评估分数来管理不确定性。
可追溯记录的价值
Harness强调,虽然无法让代理输出完全可复现,但可以记录每次运行的详细信息,包括模型调用、工具调用和步骤。这种记录让工程师能基于实际行为调整代理,而非猜测。AgentTrace等工具正是为此设计,帮助开发者理解代理的决策路径,并持续优化其表现。
安全与治理的扩展
代理连接工具和API,产生动态且更大的攻击面,传统静态扫描不足以应对。Harness推出AI资产目录、AgentTrace等产品,旨在实现代理的发现、归属和追踪,确保每个代理都有明确负责人。这有助于减少重复工作和无序扩张,同时加强安全治理。
Q&A
Harness 新推出的 AI Agent 开发生命周期服务主要解决什么问题?
该服务旨在将应用代码的治理、测试和安全机制应用于 AI 代理部署,解决代理输出非确定性问题,使代理在生产环境中更可靠。
为什么 AI 代理的输出是非确定性的?
因为代理的底层语言模型决定如何完成任务,所以同一代理在相同输入下可能选择不同工具或采取不同行动,导致每次运行结果可能不同。
Harness 如何应对 AI 代理的非确定性输出?
Harness 不试图让代理本身可预测,而是让管道可预测。通过质量门控和评估分数,将代理响应的正确性、安全性和性能评分直接接入管道作为通过/失败门禁。
Harness 提供了哪些新功能来支持 AI 代理的部署和管理?
包括 Harness AI Evals(质量评估)、Agent deployments(金丝雀发布和治理)、AI configs(运行时管理提示和模型变更)、AI asset catalog(资产发现和归属)、AgentTrace(运行追踪)。
AgentTrace 的作用是什么?
AgentTrace 记录代理单次运行和完整多步骤会话的详细信息,显示代理采取的路径、性能瓶颈以及不同模型或提示对结果的影响,帮助开发者调试和优化。
Harness 在安全方面如何应对 AI 代理带来的动态攻击面?
Harness 提供安全能力,如 AI 资产目录和 AgentTrace,以应对代理连接工具和 API、生成子代理等带来的动态风险,弥补静态扫描的不足。
Harness 是否开源了相关组件?
是的,Harness 开源了 AgentTrace 的基础组件,包括 harness-sdk 和 harness-evals,以便开发者将这些追踪原语集成到自己的 AI 应用中。
Harness 如何确保 AI 代理的可追溯性和责任归属?
通过 AI 资产目录自动发现所有代理、技能和插件,并关联到所有者,确保每个代理都有明确负责人,且从构建开始就保持可追溯。