本文介绍了如何使用MosaicML的StreamingDataset库将数据转换为Mosaic Data Shard(MDS)格式,以便高效地训练生成AI模型。文章提供了一个教程,介绍了如何使用流式Spark转换器将Spark数据帧转换为StreamingDataset MDS格式,并解释了如何从UC Volume流式传输数据到MosaicML平台进行LLM训练。
我们已完成对MosaicML的收购,加速生成式AI在企业中的应用。我们将与MosaicML团队合作,降低模型训练和定制的成本,推动模型的民主化。同时,我们将与研究团队合作,创新建模架构,使生成式AI模型更适用于企业。
MosaicML是一家创业公司,旨在通过提供易于训练和部署大型AI模型的工具,帮助AI社区提高预测准确性、降低成本并节省时间。他们的目标是使大型语言模型的使用变得民主化。MosaicML是NVIDIA Inception计划的成员,致力于解决协调大量GPU训练模型的困难和相关成本的问题。最近,MosaicML被Databricks以13亿美元的价格收购。对于许多公司来说,控制模型行为、尊重数据隐私并快速迭代开发基于AI的新产品是非常重要的。
MosaicML在B轮融资中获得5000万美元,估值达到4亿美元,年收入超过1000万美元,增长迅速。Databricks收购时估值约为7.5亿美元,AI基础设施竞争激烈,企业倾向于使用开源模型。
在人工智能热潮下,英伟达股价上涨,因为人工智能模型训练依赖于英伟达的加速卡。然而,初创公司MosaicML的评测显示,AMD米兰芯片的性能并不差,其MI250加速卡也足够使用。MosaicML还提到,加速卡制造商的主要弱点在于软件优化,而AMD在这方面不断改进,预计新推出的HPCGPU会提供更好的性能。这份评测报告支持了AMD在AI行业的战略,但英伟达拒绝评价,可能因为这对他们来说不是好消息。
为了支持生成式人工智能的大型语言模型和扩散模型,需要大量的基础设施,包括GPU和数据存储基础设施。许多机器学习团队已经开始使用对象存储来托管数据集和检查点。MosaicML的工具和Cloudflare R2可以一起解决这些挑战。使用MosaicML的开源StreamingDataset和Composer库,可以轻松地将训练数据流式传输并将模型检查点读/写回R2。由于R2的零出口定价,您可以根据GPU的可用性和价格启动/停止/移动/调整作业,而无需支付任何数据传输费用。
完成下面两步后,将自动完成登录并继续当前操作。