如何将AI生产反馈转化为更优的智能体

如何将AI生产反馈转化为更优的智能体

💡 原文英文,约1300词,阅读约需5分钟。
📝

内容提要

CoreWeave推出Forge平台,将AI运行、观测、数据整理、改进与评估整合于同一开发环境,解决模型训练与生产运维脱节问题。平台包含模型注册、实验追踪、Agent追踪、沙盒及微调蒸馏等工具,支持跨云部署,帮助团队利用生产数据持续改进模型并验证效果。

🔎

延伸解读

生产反馈闭环的常见断点

文章指出,模型训练与生产运维常由不同团队负责,导致应用追踪、评估套件和业务指标分散在各自仪表盘中。当用户行为变化时,评估套件可能无人更新,生产故障也难以自动转化为评估案例。这种交接断层是AI系统迭代变慢的核心原因,团队需明确谁负责将故障转化为评估用例并保持其时效性。

Forge如何串联AI迭代各环节

CoreWeave Forge将运行、观测、数据整理、改进与评估整合到同一开发环境。其组件包括管理模型与数据集的Registry、追踪实验的Weights & Biases Models、观测Agent决策的Agent Lens、提供隔离环境的Sandboxes,以及支持微调与蒸馏的Post-Training。这些工具旨在让团队能追溯部署对应的模型版本、评估和数据集,从而验证改进效果。

从生产信号到模型改进的路径

文章描述了利用生产数据改进模型的几种方式:通过Serverless SFT或RL实验训练配方,或对已验证任务使用Model Distillation训练更小的开源模型,并与原模型对比评分。改进后需在部署前后用可重复标准评估,确保发布有证据支撑。选择推理方式时,Serverless适合托管基础设施,Dedicated则提供对权重和GPU资源的控制,团队可根据需求切换。

评估改进效果时的注意事项

文章提到Agent Lens据称将故障检测提升20%、修复成本减半,RL Rollouts实现15倍模型重载延迟改进,但建议团队根据自身工作负载评估这些结果。此外,小模型只有在满足任务要求时才有用,蒸馏后的候选模型需与现有模型头对头比较才能决定是否切换流量。改进循环还需与现有可观测性、数据仓库和安全栈集成,并保持数据可移植。

❓

Q&A

CoreWeave Forge 是什么?它主要解决什么问题?

CoreWeave Forge 是 CoreWeave 推出的平台,将 AI 运行、观测、数据整理、改进与评估整合于同一开发环境,解决模型训练与生产运维脱节的问题,帮助团队利用生产数据持续改进模型并验证效果。

AI 持续改进循环包含哪些阶段?

循环包括:运行(Run)、观测(Observe)、整理(Curate)、改进(Improve)、评估(Evaluate),然后重复。每个阶段需要携带足够上下文供下一团队行动。

CoreWeave Forge 提供了哪些具体工具来支持 AI 循环?

包括 CoreWeave Registry(管理模型、智能体、数据集)、Weights & Biases Models(实验追踪)、CoreWeave Agent Lens(追踪步骤、决策、工具调用)、CoreWeave Notebooks(托管 Python 笔记本)、CoreWeave ARIA(分析运行、提议实验、推荐代码更改)、CoreWeave Sandboxes(隔离的 CPU/GPU 环境)、Post-Training(Serverless SFT、Serverless RL、Model Distillation)以及 CoreWeave Inference(Serverless 和 Dedicated 推理)。

Agent Lens 在观测方面有什么效果?

Agent Lens 追踪步骤、决策和工具调用,提供对话视图和技术细节。根据发布文章,Agent Lens 将故障检测提高了 20%,并以一半的成本修复问题,但团队应针对自身工作负载评估这些结果。

CoreWeave 的推理服务有哪些选项?如何选择?

CoreWeave Inference 提供 Serverless Inference(访问开源权重模型,基础设施由 CoreWeave 管理)和 Dedicated Inference(在隔离基础设施上运行,团队控制模型权重、部署设置和 GPU 资源)。根据工作负载需求选择,并可随需求变化在两者间迁移。

CoreWeave 如何优化强化学习中的检查点加载?

CoreWeave 在 Dedicated Inference 中新增 RL rollouts 功能,利用 NVIDIA Dynamo 基础实现热加载更新检查点,最小化停机时间。与 NVIDIA 和 you.com 合作,在 NeMo gym 中使用 RL Rollouts 对 NVIDIA Nemotron 3.5 Lightning 进行后训练,发布文章报告模型重载延迟比基线提高了 15 倍。

🏷️

标签

➡️

继续阅读