Kubernetes调度与Cilium网络策略因拓扑感知差异,导致分布式训练协调器与GPU工作节点跨可用区隔离,训练停滞且GPU闲置。修复无需改动CNI,仅通过节点亲和性和拓扑分布约束将Pod同区部署,即可消除网络阻断、延迟和跨区成本,GPU利用率从40%提升至85%。
Kubernetes v1.35引入了可变的PersistentVolume节点亲和性,允许在线管理存储卷,管理员可以根据需求灵活调整节点亲和性,但需注意调度竞争条件。未来计划与CSI集成以简化操作。
完成下面两步后,将自动完成登录并继续当前操作。