内容提要
VoxCPM2是首个完全放弃离散token的开源TTS方案,直接在连续潜空间用扩散自回归建模,避免离散化导致的情感与韵律细节损失。它支持通过自然语言描述生成音色、克隆音色并独立控制风格,覆盖30种语言及9种中文方言,输出48kHz音频,采用Apache-2.0许可可商用,支持LoRA微调,单张RTX 4090即可完成。
延伸解读
连续潜空间建模:为何能保留更多韵律细节
传统TTS将音频离散化为token,本质是有损压缩,会丢失换气节奏、句尾拖音等细微变化。VoxCPM2直接在连续潜空间用扩散自回归建模,避免离散化损失,从而在情感转折、长文本连贯性上更自然。这解释了它为何在非文本维度上表现更优,但并不意味着离散方案一无是处——标准朗读场景下差异可能不易察觉。
自然语言音色设计:降低音色定制门槛
VoxCPM2支持用自然语言描述凭空创建音色,无需参考音频或配音演员。描述维度包括性别、年龄、语速、情绪等,写在文本前的括号内即可。这为游戏NPC、有声书等场景提供了便利,且开源免费可商用。但需注意,生成音色的自然度和稳定性可能受描述具体程度影响,实际效果需测试。
克隆与风格解耦:音色和风格可独立控制
传统声音克隆通常绑定参考音频的风格,而VoxCPM2将音色与风格分离:参考音频决定音色,括号指令控制情绪、语速等。克隆时甚至无需参考音频的转写文本,简化了流程。高保真模式可同时提供音频和转写以提升相似度。这为需要同一音色多种演绎的场景提供了灵活性,但克隆相似度仍受参考音频质量影响。
微调与部署:消费级硬件即可上手
VoxCPM2支持全参数和LoRA微调,LoRA仅需约20GB显存,全量约40GB,单张RTX 4090即可完成。准备5-10分钟纯净单人音频即可适配特定说话人或领域。建议30%-50%训练样本带ref_audio以保留零样本克隆能力。这降低了定制门槛,但微调效果取决于数据质量和任务匹配度,并非所有场景都需微调。
Q&A
VoxCPM2 和传统 TTS 方案在技术路线上有什么根本区别?
VoxCPM2 是首个完全放弃离散 token 的开源 TTS 方案,直接在连续潜空间用扩散自回归建模,避免了传统 TTS 中音频离散化导致的情感与韵律细节损失。
VoxCPM2 如何实现用自然语言描述来生成音色?
在目标文本前的括号里用自然语言描述音色,如性别、年龄、音调、语速、情绪基调、音色质感等,模型就能凭空创造全新声音,无需参考音频。
VoxCPM2 的声音克隆有什么独特之处?
克隆后还能独立控制风格:参考音频负责音色,括号里的指令负责风格,可以在保留音色的同时改变情绪和语速,且克隆时不需要提供参考音频的转写。
VoxCPM2 支持哪些语言和方言?
支持 30 种语言、8 个语系,包括东亚、东南亚、南亚、欧洲、闪米特语族及非洲斯瓦希里语;中文侧覆盖四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南语 9 大方言。
VoxCPM2 的微调需要什么硬件和数据条件?
支持全参数微调和 LoRA 微调,LoRA 约需 20GB 显存,全量微调约 40GB,单张 RTX 4090 即可完成;准备约 5-10 分钟纯净单人讲话音频,数据格式为 JSONL,建议 30%–50% 样本带 ref_audio。
VoxCPM2 的输出音质如何?
AudioVAE V2 采用非对称编解码,编码端接受 16kHz 参考音频,解码端直接输出 48kHz,无需外部上采样器,能完整保留呼吸声、唇齿音、情感起伏等细微变化。