评估优先的AI智能体:Zepto如何在Databricks和MLflow上扩展客户支持

评估优先的AI智能体:Zepto如何在Databricks和MLflow上扩展客户支持

💡 原文英文,约2400词,阅读约需9分钟。
📝

内容提要

Zepto与Databricks合作,基于MLflow构建评估优先的AI客服系统,管理超80%工单,成本降低65%,一个月内回本。系统采用双循环架构,通过追踪、分层采样和自动回归,实现快速检测与修复,显著提升准确率与效率。

🔎

延伸解读

评估优先:从“能跑”到“可靠”的关键

Zepto的经验表明,AI智能体在规模扩大后,1%的错误率也会造成大量不良结果。传统监控只关注系统是否运行,无法捕捉内容错误。因此,他们将评估作为核心基础设施,通过双循环架构(开发与生产)和自动回归,确保每次变更都经过验证。这提醒我们,构建生产级智能体时,评估不是最后一步,而是贯穿始终的基石。

分层采样:成本与覆盖的平衡艺术

对100%流量进行评估成本过高,而简单均匀采样又会漏掉边缘案例。Zepto采用分层采样,针对高价值客户、新功能、高风险交互等提高采样率,以18-20%的样本覆盖45-60%的边缘案例,并将问题检测时间缩短至4-6分钟。相比均匀采样,审查成本降低86%,边缘案例检测提升9倍。这为资源有限的团队提供了可借鉴的评估策略。

数据质量:评估体系的“10倍乘数”

Zepto发现,开发与生产准确率之间的差距是数据集质量的信号。他们持续投入构建黄金数据集,从500个示例、8个百分点的差距,提升到5247个示例、0.4个百分点的差距。每个小时的数据集投入可节省约10小时的线上调试。这强调了高质量评估数据的重要性,它不仅是测试集,更是系统持续改进的基石。

可观测性与模块化:智能体架构的支撑

Zepto的智能体架构设计为可观测和可分解的:通过MLflow追踪记录每次调用的详细轨迹,并将智能体分为垂直(特定意图)和水平(跨领域监督)两类。这种设计使得每个组件都能独立评估,例如欺诈检测或意图识别,从而在问题发生时快速定位。这提示我们,智能体架构应从一开始就考虑可观测性和模块化,以支持有效的评估。

Q&A

Zepto如何利用Databricks和MLflow构建评估优先的AI客服系统?

Zepto与Databricks合作,基于MLflow构建了评估优先的AI客服系统。该系统采用双循环架构(开发循环和生产循环),通过MLflow自动追踪(autolog)和自定义追踪(@mlflow.trace)记录每次代理调用的详细执行轨迹,并将数据集中到Unity Catalog的Delta表中。开发循环中,使用MLflow评估数据集作为黄金数据集,进行提示词优化和自动回归测试;生产循环中,通过分层采样和实时评分监控,快速检测和修复问题。

Zepto的AI客服系统取得了哪些成果?

Zepto的AI客服系统管理了超过80%的支持工单,将支持成本降低了65%,并在不到一个月内实现了投资回报。此外,系统每天处理超过10万张工单,通过分层采样实现了18-20%的有效评估样本,检测到45-60%的边缘案例,并在4-6分钟内发现问题。

Zepto如何确保AI代理的可靠性?

Zepto通过评估优先的方法确保AI代理的可靠性。他们建立了双循环架构,开发循环中使用黄金数据集进行回归测试,生产循环中通过分层采样和实时评分监控。任何失败都会被自动捕获并反馈到开发循环中,用于改进数据集和提示词。此外,他们使用MLflow进行自动追踪和评估,确保代理在部署前达到质量标准。

Zepto的AI客服系统架构是怎样的?

Zepto的AI客服系统采用多代理架构,包括一个代理编排器和路由器,以及垂直代理和水平代理。垂直代理是专家,每个负责一个特定的意图族(如WIMO、退货、退款等);水平代理是跨用例的监督层(如欺诈检测、图像验证等)。这种分离使得每个代理可以独立评估和优化。

Zepto如何评估AI代理的性能?

Zepto使用MLflow评估框架,定义了多个评估支柱(如客户体验、运营效率、风险合规、财务影响),每个支柱有明确的数值阈值。他们使用黄金数据集进行离线评估,并在生产环境中通过分层采样和实时评分进行在线评估。评分器包括基于规则的评分器和LLM评分器,并校准到与人类标签80-90%的一致性。

Zepto如何处理AI代理在生产中的失败?

Zepto通过生产循环中的实时监控和警报来处理失败。他们使用分层采样捕获边缘案例,并通过MLflow追踪记录失败轨迹。这些失败轨迹被添加到黄金数据集中,用于改进未来的代理版本。此外,他们设置了关键警报(如意图准确性下降、接地违规等)和高/中警报(如共情退化、成本飙升等),以便快速检测和响应。

Zepto如何优化提示词?

Zepto使用MLflow的提示词优化功能,将提示词工程变为数据驱动的自动化过程。他们注册初始提示词,生成并优化变体,使用与部署相同的评分器进行A/B评估,然后部署最佳结果。优化器使用强模型进行反思,使用较便宜的模型进行生产评分,以保持成本意识。

Zepto如何控制AI客服的成本?

Zepto通过分层采样和模型可选性来控制成本。分层采样只评估18-20%的流量,但捕获了45-60%的边缘案例,相比均匀采样,审查成本降低了86%。此外,他们可以在Databricks上切换不同的专有和开源模型,以找到成本、性能和质量的平衡。

Zepto的AI客服系统如何处理多模态输入?

Zepto的AI客服系统支持文本和图像输入。对于图像,他们使用多模态评估管道,包括预处理检查(模糊、亮度、分辨率)、OCR验证,以及三个视觉模型组成的评审团进行共识决策。此外,还应用了模糊检测、截图检测、重复检测、图像与SKU匹配等。

Zepto在构建AI客服系统时遇到了哪些挑战?

Zepto面临的挑战包括:每天超过10万张工单,即使1%的错误率也会导致大量不良结果;季节性高峰(如天气事件、排灯节)导致流量激增;业务扩展到新品类(如服装、电子产品)引入了新的退款、换货流程;多语言客户带来了更多样化的请求,每几周就会出现新的失败模式。此外,代理系统是多步骤工作流,失败可能发生在任何环节,而不仅仅是最终答案。

🏷️

标签

➡️

继续阅读