利用 User Insights 识别 AI 模型过度使用

💡 原文英文,约2400词,阅读约需9分钟。
📝

内容提要

Cloudflare 为 AI Gateway 推出 User Insights 更新,可分析任务类型、对话轮次与成本,识别高能力模型被用于简单任务的情况,并关联具体用户、代理和应用。配套的 Auto Router 进入测试,能自动为任务选择合适模型以降低成本。分类异步进行,不增加请求延迟。

🔎

延伸解读

异步分类的代价:非实时视图

User Insights 的分类异步进行,不增加请求延迟,但分析可能滞后约一天。这意味着它适合识别长期使用模式,而非监控实时请求。团队需注意,新对话不会立即出现在仪表板中,因此不应依赖它做即时决策。

身份关联:需稳定标识符

要将使用情况关联到具体用户、团队或应用,自定义应用需在请求元数据中提供稳定的 user_id 和 session_id。对于 Claude Code、Codex 等工具,通过 Cloudflare Access 可自动继承身份上下文。注意不要将敏感身份信息放入提示本身。

模型适配评估:非自动推荐

Overkill 视图帮助识别模型能力可能超出任务需求的情况,但它不是排行榜,也不会自动推荐替代模型。团队应结合成本、延迟、令牌用量和对话轮次,自行判断是否更换模型或调整工作流。目标是理解模型是否适合任务,而非一味选择最便宜的模型。

日志保留与数据边界

User Insights 仅暴露派生类别和聚合视图,不会将仪表板变成原始提示浏览器。底层日志正文的保留遵循 AI Gateway 的日志配置,团队应审查这些设置,以决定哪些数据可送入分类器。分类引擎处理符合条件的日志,但不会替换或暴露原始请求。

❓

Q&A

Cloudflare 的 User Insights 更新主要解决了什么问题?

它解决了仅靠模型名称和请求次数无法理解 AI 使用背景的问题,能展示任务类型、对话轮次、成本,并识别高能力模型被用于简单任务(模型过度使用)的情况,同时关联具体用户、代理和应用。

User Insights 如何判断一个模型是否被过度使用?

它通过分析对话轨迹(包括用户请求、助手响应、工具调用和结果)来识别任务类型(如编码、研究、写作、总结、数据分析),并评估任务复杂度、意图模糊性、风险等维度,当所选模型的能力明显超出任务需求时,就会标记为过度使用。

Auto Router 是什么?它如何帮助降低成本?

Auto Router 是 Cloudflare 推出的自动路由功能,目前处于公开测试阶段。它利用对话轨迹、任务类别、任务复杂度和模型匹配信号,自动为请求选择合适模型,而不是简单地将所有请求发送到最便宜的模型,从而在保证任务效果的同时降低成本。

User Insights 的分类过程会影响 AI 请求的响应速度吗?

不会。分类是异步进行的,发生在 AI Gateway 处理完请求之后。AI Gateway 先将日志写入存储,分类 Worker 随后处理,因此不会给用户响应增加任何延迟。

User Insights 能关联到具体用户和团队吗?如何实现?

可以。AI Gateway 是身份感知的,通过将 AI Gateway 置于 Cloudflare Access 之后,可以自动关联经过身份验证的用户和会话。对于自定义应用,请求需包含稳定的 user_id 和 session_id 元数据,以便按用户、团队或应用分组分析。

User Insights 的数据是实时的吗?

不是实时的。由于分类异步进行,新收到的对话可能不会立即出现在仪表板中,分析可能滞后于传入流量约一天。因此,它更适合识别长期使用模式,而非监控实时请求活动。

🏷️

标签

➡️

继续阅读