字节跳动正式开源分布式训练调度框架 Primus
原文中文,约2500字,阅读约需6分钟。发表于: 。动手点关注干货不迷路项目地址:https://github.com/bytedance/primus随着机器学习的发展,模型及训练模型所需的数据量越来越大,也都趋向于通过分布式训练实现。而算法工程师通常需要对这些分布式框架涉及到的底层文件存储和调度系统有较深的理解,才能够快速批量开启模型训练,保证资源利用率。目前业界有很多类似的框架,如 TonY、TensorFlowOnSpark,Kubeflo...
Primus是一个通用的分布式训练调度框架,支持多种训练框架、调度器和角色,具备容错处理、动态调度、多数据源数据类型支持等功能。它能够帮助算法工程师从底层细节中解脱出来,更多地关注算法层面。