内容提要
CoreWeave推出Forge平台,将AI运行、观测、数据整理、改进与评估整合于同一开发环境,解决模型训练与生产运维脱节问题。平台包含模型注册、实验追踪、Agent追踪、沙盒及微调蒸馏等工具,支持跨云部署,帮助团队利用生产数据持续改进模型并验证效果。
延伸解读
生产反馈闭环的常见断点
文章指出,模型训练与生产运维常由不同团队负责,导致应用追踪、评估套件和业务指标分散在各自仪表盘中。当用户行为变化时,评估套件可能无人更新,生产故障也难以自动转化为评估案例。这种交接断层是AI系统迭代变慢的核心原因,团队需明确谁负责将故障转化为评估用例并保持其时效性。
Forge如何串联AI迭代各环节
CoreWeave Forge将运行、观测、数据整理、改进与评估整合到同一开发环境。其组件包括管理模型与数据集的Registry、追踪实验的Weights & Biases Models、观测Agent决策的Agent Lens、提供隔离环境的Sandboxes,以及支持微调与蒸馏的Post-Training。这些工具旨在让团队能追溯部署对应的模型版本、评估和数据集,从而验证改进效果。
从生产信号到模型改进的路径
文章描述了利用生产数据改进模型的几种方式:通过Serverless SFT或RL实验训练配方,或对已验证任务使用Model Distillation训练更小的开源模型,并与原模型对比评分。改进后需在部署前后用可重复标准评估,确保发布有证据支撑。选择推理方式时,Serverless适合托管基础设施,Dedicated则提供对权重和GPU资源的控制,团队可根据需求切换。
评估改进效果时的注意事项
文章提到Agent Lens据称将故障检测提升20%、修复成本减半,RL Rollouts实现15倍模型重载延迟改进,但建议团队根据自身工作负载评估这些结果。此外,小模型只有在满足任务要求时才有用,蒸馏后的候选模型需与现有模型头对头比较才能决定是否切换流量。改进循环还需与现有可观测性、数据仓库和安全栈集成,并保持数据可移植。
Q&A
CoreWeave Forge 是什么?它主要解决什么问题?
CoreWeave Forge 是 CoreWeave 推出的平台,将 AI 运行、观测、数据整理、改进与评估整合于同一开发环境,解决模型训练与生产运维脱节的问题,帮助团队利用生产数据持续改进模型并验证效果。
AI 持续改进循环包含哪些阶段?
循环包括:运行(Run)、观测(Observe)、整理(Curate)、改进(Improve)、评估(Evaluate),然后重复。每个阶段需要携带足够上下文供下一团队行动。
CoreWeave Forge 提供了哪些具体工具来支持 AI 循环?
包括 CoreWeave Registry(管理模型、智能体、数据集)、Weights & Biases Models(实验追踪)、CoreWeave Agent Lens(追踪步骤、决策、工具调用)、CoreWeave Notebooks(托管 Python 笔记本)、CoreWeave ARIA(分析运行、提议实验、推荐代码更改)、CoreWeave Sandboxes(隔离的 CPU/GPU 环境)、Post-Training(Serverless SFT、Serverless RL、Model Distillation)以及 CoreWeave Inference(Serverless 和 Dedicated 推理)。
Agent Lens 在观测方面有什么效果?
Agent Lens 追踪步骤、决策和工具调用,提供对话视图和技术细节。根据发布文章,Agent Lens 将故障检测提高了 20%,并以一半的成本修复问题,但团队应针对自身工作负载评估这些结果。
CoreWeave 的推理服务有哪些选项?如何选择?
CoreWeave Inference 提供 Serverless Inference(访问开源权重模型,基础设施由 CoreWeave 管理)和 Dedicated Inference(在隔离基础设施上运行,团队控制模型权重、部署设置和 GPU 资源)。根据工作负载需求选择,并可随需求变化在两者间迁移。
CoreWeave 如何优化强化学习中的检查点加载?
CoreWeave 在 Dedicated Inference 中新增 RL rollouts 功能,利用 NVIDIA Dynamo 基础实现热加载更新检查点,最小化停机时间。与 NVIDIA 和 you.com 合作,在 NeMo gym 中使用 RL Rollouts 对 NVIDIA Nemotron 3.5 Lightning 进行后训练,发布文章报告模型重载延迟比基线提高了 15 倍。