代理的答案总在变,Harness却打造了不在乎的交付管道。

代理的答案总在变,Harness却打造了不在乎的交付管道。

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

Harness推出AI Agent开发生命周期服务,将应用代码的治理、测试和安全机制应用于AI代理部署。通过质量门控、评估分数和可追溯记录,解决代理非确定性输出问题,同时提供安全工具应对动态攻击面,使代理在生产环境中更可靠。

🔎

延伸解读

非确定性带来的测试挑战

文章指出,AI代理的底层模型每次可能选择不同工具或动作,导致相同输入产生不同输出。这意味着传统确定性测试无法保证结果可复现,一次通过的测试下次可能失败。因此,Harness建议不要试图让代理本身可预测,而是让围绕它的管道可预测,通过质量门控和评估分数来管理不确定性。

可追溯记录的价值

Harness强调,虽然无法让代理输出完全可复现,但可以记录每次运行的详细信息,包括模型调用、工具调用和步骤。这种记录让工程师能基于实际行为调整代理,而非猜测。AgentTrace等工具正是为此设计,帮助开发者理解代理的决策路径,并持续优化其表现。

安全与治理的扩展

代理连接工具和API,产生动态且更大的攻击面,传统静态扫描不足以应对。Harness推出AI资产目录、AgentTrace等产品,旨在实现代理的发现、归属和追踪,确保每个代理都有明确负责人。这有助于减少重复工作和无序扩张,同时加强安全治理。

Q&A

Harness 新推出的 AI Agent 开发生命周期服务主要解决什么问题?

该服务旨在将应用代码的治理、测试和安全机制应用于 AI 代理部署,解决代理输出非确定性问题,使代理在生产环境中更可靠。

为什么 AI 代理的输出是非确定性的?

因为代理的底层语言模型决定如何完成任务,所以同一代理在相同输入下可能选择不同工具或采取不同行动,导致每次运行结果可能不同。

Harness 如何应对 AI 代理的非确定性输出?

Harness 不试图让代理本身可预测,而是让管道可预测。通过质量门控和评估分数,将代理响应的正确性、安全性和性能评分直接接入管道作为通过/失败门禁。

Harness 提供了哪些新功能来支持 AI 代理的部署和管理?

包括 Harness AI Evals(质量评估)、Agent deployments(金丝雀发布和治理)、AI configs(运行时管理提示和模型变更)、AI asset catalog(资产发现和归属)、AgentTrace(运行追踪)。

AgentTrace 的作用是什么?

AgentTrace 记录代理单次运行和完整多步骤会话的详细信息,显示代理采取的路径、性能瓶颈以及不同模型或提示对结果的影响,帮助开发者调试和优化。

Harness 在安全方面如何应对 AI 代理带来的动态攻击面?

Harness 提供安全能力,如 AI 资产目录和 AgentTrace,以应对代理连接工具和 API、生成子代理等带来的动态风险,弥补静态扫描的不足。

Harness 是否开源了相关组件?

是的,Harness 开源了 AgentTrace 的基础组件,包括 harness-sdk 和 harness-evals,以便开发者将这些追踪原语集成到自己的 AI 应用中。

Harness 如何确保 AI 代理的可追溯性和责任归属?

通过 AI 资产目录自动发现所有代理、技能和插件,并关联到所有者,确保每个代理都有明确负责人,且从构建开始就保持可追溯。

🏷️

标签

➡️

继续阅读