内含教程丨音色克隆模型 GPT-SoVITS,5 秒语音就能克隆出相似度 95% 的声音

💡 原文中文,约2600字,阅读约需7分钟。
📝

内容提要

语音技术是AI技术之一,应用广泛。大型云计算公司已开源AI语音能力,开发者可基于此搭建应用。音色克隆项目GPT-SoVITS开源后受到热捧,可通过提供5秒语音样本克隆语音。教程已上线,可自定义音色。

🔎

延伸解读

从识别到克隆:语音技术的交互演进

文章梳理了语音技术从识别到交互的历程:早期系统如AT&T贝尔实验室的Audrey仅能识别10个英文数字,1988年李开复的Sphinx实现大词汇量识别,2011年Siri将语音带入交互阶段。如今,语音交互已扩展到智能家居、驾驶和机器人等领域,而GPT-SoVITS这类音色克隆项目则代表了从“听懂”到“模仿”的新方向,让机器不仅能理解语言,还能复现特定音色。

5秒样本克隆:效果与数据要求

GPT-SoVITS 的核心卖点是仅需 5 秒语音样本即可克隆音色,据博主测试相似度可达 80%~95%。但教程同时指出,若要自定义音色,建议准备约 30 秒的单独人声 MP3 文件,且高质量音频能提升克隆逼真度。这说明 5 秒是极低门槛的体验,而实际效果受样本质量和长度影响,用户需在便捷性与效果之间权衡。

实操门槛:算力、实名与容器管理

教程显示,运行 GPT-SoVITS 需在 OpenBayes 平台克隆容器,推荐使用 RTX 4090,首次启动约 3-5 分钟,若超 10 分钟可尝试重启。此外,使用 API 地址需完成实名认证。新用户注册可获 4 小时 RTX 4090 和 5 小时 CPU 免费算力,但免费时长有限,适合初步实验。这些细节提示用户,尽管模型开源,实际部署仍涉及算力成本和平台操作步骤。

❓

Q&A

GPT-SoVITS 音色克隆需要多少语音样本?克隆相似度能达到多少?

仅需提供 5 秒语音样本,克隆语音的相似度可达到 80%~95%。

GPT-SoVITS 的部署教程在哪里可以找到?

教程已上线 HyperAI 超神经官网,链接为 https://hyper.ai/tutorials/29812。

使用 GPT-SoVITS 克隆自定义音色时,对音频文件有什么要求?

需要准备一段该音色的 MP3 格式音频文件,最好为单独人声,时长 30 秒左右即可,高质量的音频文件可以提升克隆声音的逼真程度。

运行 GPT-SoVITS 的 Demo 需要哪些步骤?

主要步骤包括:在 OpenBayes 平台克隆教程、创建并上传数据集、打开工作空间运行 run.ipynb 中的所有单元格、填写数据集地址并开始训练、最后通过 API 地址进行推理。

新用户使用 GPT-SoVITS 有免费算力吗?如何获取?

新用户通过专属邀请链接注册,可获得 4 小时 RTX 4090 + 5 小时 CPU 免费算力时长。

语音识别技术早期有哪些重要里程碑?

最早的电子计算机语音识别系统是 AT&T 贝尔实验室开发的 Audrey,能识别 10 个英文数字;1988 年李开复实现了第一个大词汇量语音识别系统 Sphinx;1997 年首个面向消费者的连续语音听写系统 Dragon NaturallySpeaking 发布;2011 年 iPhone 4S 的 Siri 将智能语音带入交互新阶段。

🏷️

标签

➡️

继续阅读