内容提要
CoHDI项目正式成为CNCF沙箱项目,由Red Hat、Fujitsu等合作开发,旨在通过Kubernetes动态资源分配实现可组合分解基础设施中PCIe设备的灵活挂载,支持AI推理等场景,提升能效。项目包含三个核心组件,并邀请开发者参与共建。
延伸解读
项目背景与目标
CoHDI于2025年3月由Red Hat、FSAS、Fujitsu、IBM Research和NTT联合发起,旨在为Kubernetes节点构建基于可组合分解基础设施的开放标准生态。其核心是通过动态资源分配(DRA)实现PCIe设备的主机级动态挂载与卸载,从而在AI推理等场景中灵活调配资源,提升能效。该项目的入选标志着其技术方向获得CNCF认可,并有望推动多云环境下的硬件创新。
技术架构与组件
CoHDI软件套件包含三个核心组件:Composable-DRA-Driver作为Kubernetes与CoHDI管理器之间的桥梁,将可用资源以ResourceSlices形式暴露给DRA框架;Dynamic-Device-Scaler支持根据Pod请求动态增减设备而无需重启操作系统;Composable Resource Operator则通过外部API动态挂载或卸载GPU等硬件资源。这些组件协同工作,使Kubernetes能够更灵活地管理分解式硬件资源。
应用场景与价值
CoHDI特别适用于LLM推理中的Prefill/Decode分解场景,其中Prefill阶段计算密集、Decode阶段内存密集,CoHDI可根据不同阶段的需求动态调整资源分配。此外,在Agentic AI工作流中,它也能适应各操作阶段变化的资源需求。这种灵活性有助于实现高能效和可持续的运营,符合当前AI时代对绿色计算的需求。
Q&A
CoHDI是什么?它最近有什么重要进展?
CoHDI(发音为“Cody”)是Composable Hardware in Disaggregated Infrastructure的缩写,是一个旨在将Kubernetes演进为可组合分解基础设施的项目。它于2025年3月由Red Hat、FSAS、Fujitsu、IBM Research和NTT联合发起,最近正式被CNCF接纳为沙箱项目。
CoHDI如何实现PCIe设备的动态挂载?
CoHDI通过Kubernetes的动态资源分配(DRA)机制,在节点级别实现PCIe设备(如GPU)的动态挂载和卸载。它利用三个核心组件:Composable-DRA-Driver、Dynamic-Device-Scaler和Composable Resource Operator,这些组件协同工作,使得设备可以根据Pod请求动态添加或移除,无需重启操作系统。
CoHDI在AI推理场景中有什么应用?
CoHDI在AI推理场景中特别有用,例如在LLM推理的Prefill/Decode分离架构中,它可以分别满足预填充阶段(计算密集型)和解码阶段(内存密集型)的不同资源需求。此外,在Agentic AI工作流中,它也能动态适应各操作阶段变化的资源需求。
CoHDI的三个核心组件分别是什么?各自的作用是什么?
CoHDI的三个核心组件是:1. Composable-DRA-Driver:与Dynamic-Device-Scaler配合,根据Pod请求实现动态设备扩展,并将CoHDI管理器管理的可用资源作为ResourceSlices暴露给Kubernetes DRA框架。2. Dynamic-Device-Scaler:与Composable-DRA-Driver协同,实现设备的动态添加和移除,无需重启OS。3. Composable Resource Operator:通过调用CoHDI管理器的外部API,动态地将可组合硬件资源(如GPU)挂载到集群节点或从节点卸载。
CoHDI与Kubernetes的哪些SIG有合作?
CoHDI与Kubernetes的SIG Node、SIG Autoscaling和SIG Scheduling有合作,通过集成Kubernetes的动态资源分配(DRA)来管理分解资源。
CoHDI对可持续计算有什么贡献?
CoHDI通过动态分配和释放硬件资源,能够提高资源利用率,从而支持高能效和可持续的运营。例如,在AI推理中,它可以根据不同阶段的需求灵活调整资源,避免资源浪费。
开发者如何参与CoHDI项目?
开发者可以通过CNCF Slack或GitHub与CoHDI社区联系,提供反馈、增强请求或讨论用例。项目欢迎开发者、平台工程师和研究人员参与共建。