内容提要
红帽发布AI 3.5平台,支持企业以关键任务级标准运行AI。新版本强化多租户隔离、优先级感知服务和共享GPU调度,新增EvalHub部署前安全评估、实时可观测性仪表盘及令牌用量追踪,旨在将孤立的AI试点转化为受治理的企业架构,使GPU资源成为策略控制的基础设施池。
延伸解读
GPU 调度:从技术细节到业务优先级
红帽 AI 3.5 的优先级感知服务将每个 GPU 请求转化为优先级决策。这意味着企业需要明确业务关键任务(如财务结算)与内部实验的优先级差异,并据此配置调度策略。否则,低优先级任务可能占用资源,影响关键工作负载的响应时间。
多租户隔离:共享 GPU 的安全底线
文章强调,效率提升不能以牺牲隔离为代价。红帽 AI 3.5 通过硬件到软件的全隔离,确保不同租户的数据、模型和计算环境互不干扰。对于处理敏感数据或受监管信息的企业,这是将 AI 试点推向生产的前提条件。
可观测性与令牌追踪:让成本可见
新版本提供实时仪表盘和按用户令牌用量追踪(showback),帮助平台团队监控推理健康度、GPU 利用率和模型性能。这使企业能够回答“谁用了多少资源、成本如何”等问题,为内部计费和容量规划提供依据。
部署前评估:降低安全与合规风险
EvalHub 支持在部署前进行安全基准测试和合规认证,避免将未经验证的模型投入生产。结合实时可观测性,企业可以在 AI 生命周期早期发现风险,减少事后补救的成本,满足监管要求。
Q&A
红帽AI 3.5是什么?它主要解决什么问题?
红帽AI 3.5是红帽发布的一个AI平台,旨在让企业以关键任务级标准运行AI。它主要解决AI试点中GPU排队和资源管理问题,通过多租户隔离、优先级感知服务和共享GPU调度,将孤立的AI试点转化为受治理的企业架构。
红帽AI 3.5如何实现多租户隔离和优先级感知服务?
红帽AI 3.5通过硬件到软件的完全隔离实现多租户隔离,确保AI服务不干扰其他服务的数据、模型或计算环境。优先级感知服务则动态分配GPU容量,让关键任务优先执行,低优先级任务利用空闲容量。
红帽AI 3.5新增了哪些可观测性和安全评估功能?
新增了EvalHub部署前安全评估,支持风险导向的安全基准测试和合规认证;实时可观测性仪表盘提供推理健康、GPU利用率和模型性能的实时视图;还支持按用户令牌用量追踪(showback)和分布式推理工作负载监控。
共享GPU调度如何提升AI基础设施效率?
共享GPU调度通过公平份额调度管理跨租户资源分配,优先级感知服务提供准入控制和基于优先级的请求路由,保护实时推理。同时允许后台工作负载使用可用容量,避免为低优先级任务单独配置GPU,从而最大化GPU利用率。
红帽AI 3.5如何帮助企业管理AI成本和使用情况?
通过内置的可观测性和MaaS showback功能,提供按用户令牌计量、模型和代理的性能仪表盘、MLflow可视化代理追踪以及GPU利用率仪表盘,实现运营和使用透明化,帮助企业追踪成本和使用情况。
红帽AI 3.5在GPU内存管理方面有哪些新特性?
红帽AI 3.5提供了CPU卸载的正式发布和存储卸载的开发者预览,允许模型处理更长的对话和更大的文档,而无需额外GPU硬件,从而优化GPU内存管理。