一项新服务将AI模型的令牌效率提高了5倍,使开发人员能够立即访问在NVIDIA DGX Cloud上运行的NIM微服务。该服务帮助开发人员快速部署大型语言模型,并通过NVIDIA NIM微服务进行优化。推理服务帮助开发人员在Hugging Face Hub上快速原型设计和部署到生产环境中。企业Hub用户可以利用无服务器推理提高灵活性、减少基础设施开销,并通过NVIDIA NIM实现优化性能。这些工具为Hugging Face开发人员提供了在NVIDIA加速基础设施上实验、测试和部署尖端模型的新方法。
Hugging Face Hub将更改用户与Git交互时的身份验证方式。从2023年10月1日开始,将不再接受密码。建议用户使用个人访问令牌或SSH密钥进行身份验证。用户需要在10月1日之前切换到这些方法。提供了生成访问令牌和SSH密钥的详细说明。将向依赖密码进行身份验证的用户发送电子邮件。个人访问令牌或SSH密钥将从2023年10月1日开始成为所有Git操作的强制要求。有关更多信息,用户可以联系HF Support。
本文介绍了如何利用机器学习改进Hugging Face Hub上数据集的语言元数据。作者使用机器学习模型预测数据集的语言,并通过Librarian-Bot自动更新元数据,提高Hub的可用性。语言元数据对于训练开源语言模型和寻找相关机器学习模型也非常重要。作者将继续探索自动元数据丰富的机会,并欢迎合作和意见。
Hugging Face Hub是一个中央存储库,人们可以在其中分享和访问机器学习模型、数据集和演示文稿。Hugging Face Spaces是一个平台,允许您托管机器学习演示文稿和应用程序。机构可以通过在Hugging Face Hub上分享数据集和模型来扩大其影响力和社区。
Hugging Face Hub提供了50,000个数据集,用户可以使用DuckDB运行SQL查询,DuckDB是一个快速的数据库管理系统,Datasets Server会自动将数据集转换为Parquet文件,用户可以通过HTTP调用获取Parquet文件的URL,并使用DuckDB连接到这些文件进行分析。这个功能可以帮助用户更好地了解数据集的内容,提高模型质量。
Hugging Face Hub现在支持fastText的官方镜像,包括157种语言的词向量和最新的语言识别模型。用户可以通过几个命令轻松下载和使用这些模型。fastText使用词袋和n-gram表示句子,利用子词信息和隐藏表示来跨类别共享信息,并使用分层softmax加速计算。此外,该集成还支持文本分类和特征提取小部件。用户可以使用Hugging Face Hub下载和使用fastText模型。
BERTopic Python库现在支持与Hugging Face Hub的集成,用户可以将训练好的主题模型推送和拉取到Hub中,从而更方便地在不同环境中部署和管理模型。此外,BERTopic现在还支持使用safetensors库进行序列化。用户可以使用BERTopic分析客户评论、研究论文或对新闻文章进行分类,从而从文本数据中提取有意义的信息。通过一个例子,展示了如何使用BERTopic监测聊天模型训练数据集中主题的变化,并比较不同数据集中的主题分布。BERTopic Hub集成为用户提供了更快的迭代和高效的模型更新,确保在不同环境中的一致性。
完成下面两步后,将自动完成登录并继续当前操作。