GPU调度需依次解决三个层次的问题:选择节点、选择卡、确定卡在机器内的位置。本文基于三层框架分析HAMi v2.10的策略链,并澄清常见误解:互斥并非排斥其他互斥Pod,而是要求独占整张卡。结论通过可在笔记本上复现的关键实验得出。
本文探讨GPU共享从稀缺硬件演进为可治理基础设施能力的关键,指出缺失的并非分区技术,而是调度决策与运行时隔离之间可验证的对应关系。作者强调,实现可治理性需确保调度与隔离的可靠匹配,以支持GPU资源的有效管理和共享。
本文介绍如何通过KServe与HAMi实现GPU共享,使多个推理服务共用一张GPU。文章详细说明了安装GPU Operator、cert-manager和HAMi-DRA的步骤,并展示了创建共享GPU推理服务的配置方法。通过ResourceClaimTemplate声明GPU资源,每个Pod获得独立配额,验证了两个副本能同时共享同一张Tesla T4 GPU,各分配3Gi显存和20%算力,有效避免小模型独占整卡,提升GPU利用率。
HAMi是CNCF孵化项目,用于Kubernetes GPU共享。Kubernetes DRA(动态资源分配)自v1.34起GA,支持可消耗容量,使调度器原生处理GPU切片请求,但仅跟踪承诺,不执行运行时限制。HAMi保留其核心执行层(拦截CUDA调用),并推出HAMi-DRA驱动和webhook,将传统扩展资源转换为DRA声明,实现向后兼容。两者互补,DRA负责调度,HAMi-core负责强制限制,生产环境需按版本和供应商选择模式。
HAMi被CNCF技术监督委员会接受为孵化项目,旨在解决Kubernetes中的异构加速器资源调度问题。该项目提供开源的GPU虚拟化中间件,支持多种设备,促进了社区的快速发展。项目已发布多个版本,吸引了大量贡献者和用户,未来将继续扩展功能和设备支持。
HAMi的成长故事探讨了在AI编程时代开源社区的价值。HAMi是Kubernetes的GPU虚拟化和共享中间件,经历了从2021年开源到2024年CNCF沙箱,再到2026年CNCF孵化的演变。尽管AI降低了代码生产成本,但共识的建立成本未减,开源社区的护城河正从代码生产转向共识与信任。
本文讨论了Kueue与HAMi vGPU的结合,重点在于GPU显存和算力配额的管理。通过环境准备、资源模型和演示,展示了在Kubernetes中有效切分和管理GPU资源的方法,确保多个任务合理使用GPU,避免资源冲突,实现GPU集群的多租户管理能力。
招商银行基于HAMi构建的AI计算调度平台获得CNCF认证,提升硬件利用率至100%,有效解决算力孤岛问题。该项目吸引500余名开发者,已在多家企业部署,节省硬件成本80%。在国际上受到关注,标志着中国开源技术在AI算力调度领域的进步。
HAMi成为CNCF孵化项目后,开源社区的资源逐渐从代码转向共识,标志着社区治理、生态建设和实际应用进入新阶段。
密瓜智能的开源项目HAMi于2026年7月2日晋升为CNCF孵化项目,专注于异构GPU资源的虚拟化与调度,吸引了500余位贡献者,服务300多家企业,应用于多个行业,标志着AI基础设施进入新竞争阶段。
HAMi 现已用于评估桌面 AI 工作站的体验,Olares 公司将其集成到项目中,标志着桌面 AI 工作站的新发展。
博维智慧科技通过Kubernetes和HAMi实现科研实验室GPU资源的高效管理,提升了70%的GPU利用率。该方案支持训练与推理的物理隔离,优化显存使用,降低运维门槛,适用于多种科研场景。
本文介绍了Kubernetes上HAMi DRA模式的安装与使用。HAMi是一个开源GPU虚拟化平台,能够将物理GPU细分为多个虚拟GPU供不同Pod共享。DRA模式通过调度器动态分配资源,解决资源不足的问题。用户可选择手动创建ResourceClaim的原生模式或使用兼容模式自动转换资源申请,简化迁移过程。文章详细描述了安装步骤、验证方法及两种模式的区别。
最近,我关注国内GPU调度和Kubernetes在AI资源管理方面的进展。随着HAMi v2.9的发布,我想分享一些关于AI基础设施控制平面演变的观察,特别是Kubernetes作为AI的GPU控制平面。
HAMi v2.9.0 正式发布,增强了异构设备的虚拟化和调度能力。新特性包括用户态虚拟化、生产就绪的 HAMi-DRA、增强的安全性和稳定性,以及对瀚博半导体设备的支持。HAMi-core 模式实现了显存与算力的细粒度共享,提升了资源利用率,已在招商银行验证。此外,该版本还更新了可观测性和安全性功能,推动了 DRA 生态联盟的发展。
顺丰科技在深圳举办的HAMi社区Meetup上分享了其AI平台的演进,涵盖从Kubeflow到多云混合架构。陈俊超介绍了GPU资源管理的创新,包括GPU切分、混部和显存超分,显著提升资源利用率。同时,通过深度定制Device Plugin,顺丰简化了运维,构建了全链路监控闭环,为资源决策提供支持。
HAMi Meetup深圳站将于2026年4月25日举行,主题为提升AI算力利用效率。活动将讨论异构算力调度和GPU优化等技术,并分享顺丰科技、招商银行等企业的实践经验。欢迎AI开发者和运维工程师参与,共同推动算力管理与调度的创新。
KCD Beijing 2026 是大型 Kubernetes 社区大会,HAMi 社区介绍了 GPU 调度的 DRA 模型,强调 GPU 从“设备”转变为“资源对象”。DRA 提升了资源建模能力,但用户体验有所下降。HAMi-DRA 通过自动化迁移简化用户操作,提高了 Pod 创建速度和可观测性,推动了 AI 基础设施的发展。
KubeCon EU 2026 结束,密瓜智能的 HAMi 项目展示了 GPU 共享与调度,强调 Kubernetes 在 AI 工作负载中的重要性,推动全球对 AI 基础设施的关注。
本周末,Dynamia 密瓜智能团队将参加阿姆斯特丹的 KubeCon + CloudNativeCon Europe 2026,讨论 Kubernetes、AI 和基础设施。他们作为 HAMi 项目的发起方,将参与多个核心活动,展示 GPU 虚拟化与调度的重要性,强调 AI 在云原生生态中的主导地位。
完成下面两步后,将自动完成登录并继续当前操作。