内容提要
Kubernetes已成为AI基础设施的核心,但GPU支持不足,导致多数团队仅间歇性部署模型。NVIDIA深化对CNCF的承诺,投入400万美元支持GPU测试,并贡献DRA驱动、KAI调度器等开源项目,推动GPU工作负载在Kubernetes上高效运行。NVIDIA坚信开放、社区治理的基础设施将主导AI未来。
延伸解读
GPU支持不足是AI落地的主要瓶颈
文章指出,虽然Kubernetes已成为AI基础设施的核心,但GPU支持不足导致多数团队无法持续部署模型。仅7%的组织每日部署模型,47%仅间歇性部署。这种差距源于GPU被视为静态、不可分割的资源,难以满足大规模训练、低延迟推理和多租户共享集群的需求,造成硬件过度配置和闲置。
NVIDIA的开源策略与社区治理
NVIDIA通过加入CNCF管理委员会并投入400万美元支持GPU测试,推动GPU管理标准化。其贡献的DRA驱动和KAI调度器均采用上游优先、社区治理的模式,而非专有扩展。这体现了NVIDIA对开放基础设施的承诺,旨在让GPU工作负载在Kubernetes上像其他工作负载一样高效运行。
AI基础设施的未来走向开放
文章强调,AI基础设施的未来可能走向专有封闭,也可能像互联网一样由开放社区驱动。NVIDIA选择后者,认为开放、互操作、社区治理的平台能构建更大生态、更快创新。Kubernetes AI Conformance Program的扩展和v1.35新要求,正是为了确保AI基础设施的一致性和可靠性,推动行业标准化。
Q&A
Kubernetes在AI基础设施中扮演什么角色?
Kubernetes已成为AI基础设施的核心,被称为“事实上的操作系统”。根据CNCF 2025年调查,82%的容器用户在生产环境运行Kubernetes,66%的生成式AI组织使用它管理推理工作负载。
为什么大多数团队没有持续部署AI模型?
因为GPU支持不足,导致运营困难。只有7%的组织每天部署模型,47%仅间歇性部署。主要原因是Kubernetes将GPU视为静态、不可分割的资源,导致过度配置、GPU闲置和应用在生产中失败。
NVIDIA对CNCF的承诺是什么?
NVIDIA加入了CNCF Governing Board,并承诺在未来三年投入400万美元,用于支持CNCF项目在真实GPU上进行CI和测试,而不是使用模拟器。
NVIDIA的GPU DRA驱动有什么作用?
DRA驱动是Kubernetes SIG-Node中供应商中立的DRA API的参考实现,它取代了静态分配,实现实时按需GPU分配,支持MIG设备共享(alpha)和ComputeDomains,允许GPU通过Multi-Node NVLink跨节点安全快速地共享内存。
KAI Scheduler是什么?它解决了什么问题?
KAI Scheduler是NVIDIA贡献给CNCF的调度器,已作为Sandbox项目接受。它支持大规模AI集群所需的调度功能,包括带预调度模拟的团伙调度、层次化队列和主导资源公平性,以及异步绑定,已在超过10,000个GPU的集群上运行。
Kubernetes AI Conformance Program是什么?
这是一个验证AI就绪基础设施一致性的项目,自推出以来,认证平台从18个增加到31个。v1.35版本新增了代理工作流支持和推理服务的原地Pod调整要求。
NVIDIA为什么选择开源和社区治理的方式?
NVIDIA认为开放、社区治理的基础设施将主导AI未来,因为历史表明开放、可互操作、社区治理的平台能构建更大的生态系统,发展更快,惠及更多人。Jensen Huang也强调开源对研究和创新的必要性。