导航器:用于延迟敏感机器学习工作流的分散调度器

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

该文综述多种深度学习调度系统:GPU集群调度器通过邻近性整合降低通信延迟,端到端完成时间改进达69%;CASSINI利用亲和图交错通信阶段,提升完成时间1.6至2.5倍;Nimble采用提前调度降低开销;Symphony集中调度推理,吞吐量提升4.7倍;还涉及联邦学习框架等。

🔎

延伸解读

调度优化如何降低通信延迟

文章指出,GPU集群调度器通过基于邻近性的资源整合,将通信密集的作业集中放置,从而减少网络延迟。在拥挤网络下,这种调度可带来高达69%的端到端完成时间改进,同时平均作业完成时间降低83%,通信开销减少98%。这提示我们,对于延迟敏感的机器学习工作流,调度策略对性能有显著影响。

CASSINI的通信阶段交错机制

CASSINI利用亲和图调整作业的通信阶段,使共享网络链路的作业通信模式交错,从而减少拥塞。实验显示,在24台服务器上对13个常见模型,平均完成时间和尾部完成时间分别提升1.6倍和2.5倍,ECN标记包减少33倍。这表明网络感知调度能有效缓解链路竞争。

不同调度系统的适用场景

文章综述了多种调度系统:Nimble采用提前调度降低开销,适合对调度延迟敏感的任务;Symphony集中调度推理,通过非工作保持算法提升吞吐量达4.7倍;联邦学习框架通过智能调度加速训练。这些系统针对不同工作负载,读者可根据需求选择。

调度技术的潜在收益与局限

文章提到,基于强化学习的调度在异构SoC中能减少执行时间,MetaNet优化在线调度策略可提升多项指标。然而,这些方法通常依赖特定环境或模拟,实际部署可能受限于集群规模和网络条件。读者应关注其泛化能力和开销。

❓

Q&A

GPU集群调度器如何通过邻近性整合降低通信延迟?

该调度器基于DDL作业对预期通信网络延迟的敏感性,采用基于邻近性的资源整合,通过经典的延迟调度算法实现作业的放置和整合。在拥挤的网络条件下,与现有的基于整合的调度方法相比,可提供多达69%的端到端完成时间的改进,同时将平均作业完成时间降低多达83%,并将通信开销最小化多达98%。

CASSINI调度器如何优化机器学习作业的通信?

CASSINI是一个面向机器学习聚类的网络感知作业调度器,引入几何抽象来考虑不同作业的通信模式,在网络链接上放置它们。通过使用亲和图,CASSINI找到一系列时间偏移值来调整一组作业的通信阶段,以便共享相同网络链接的作业的通信模式交错在一起。实验证明,与最先进的机器学习调度器相比,CASSINI将作业的平均完成时间和尾部完成时间分别提高了1.6倍和2.5倍,并将集群中标记的ECN数据包数量减少了多达33倍。

Nimble执行引擎采用什么调度技术来降低开销?

Nimble采用ahead-of-time(AoT)调度技术,可以以尽可能小的调度开销运行GPU任务。与PyTorch、TensorRT和TVM相比,Nimble在加速推断和训练方面表现出较好的性能。

Symphony调度系统如何提升GPU集群上的推理吞吐量?

Symphony是一个集中式调度系统,用于在GPU集群上协调深度神经网络模型推断。它通过使用非工作保持调度算法实现高批量效率,并能够自动扩展。Symphony利用基于计算和内存需求的模型将模型分配给子集群的大规模算法,经过广泛的实验,证明了其比之前的系统具有高达4.7倍的吞吐量。

MetaNet如何优化在线任务调度策略?

MetaNet使用元模型来解决在线动态选择调度策略的问题,以优化任务调度和执行成本。相比于现有的深度学习调度器,MetaNet能使执行成本、能源消耗、响应时间和服务水平协议的违规率分别提高11%、43%、8%和13%左右。

多工作联邦学习框架如何通过调度实现更快训练?

该框架通过智能调度方法实现了分散数据的并行训练过程,实验证明相比基线方法,其训练时间更快(最高可达12.73倍)且准确率更高(最高46.4%)。

🏷️

标签

➡️

继续阅读